ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

556 个大模型塞进像素小镇:这个开源项目用数据帮开发者做选型

556 个大模型塞进像素小镇:这个开源项目用数据帮开发者做选型 最近 GitHub 上有一个叫ai-model-world大模型世界的项目在涨星作者是开发者 liyupi程序员鱼皮。它的玩法很有意思把 556 个大模型拟人化成像素小人放进一座像素小镇你打开就能看到此刻谁最聪明、谁最会写代码、谁最便宜、谁刚发布。国内和国外分区还能按厂商、按能力搜索。表面上像个可视化玩具但仔细看它的文档和数据结构会发现它真正解决的问题是很多开发者天天头疼的事——模型太多信息太散横评对不上。它到底做了一件什么事现在新模型几乎每周都在发新闻里全是新名字但你很难回答三个基本问题此刻谁最强谁最便宜谁刚刚更新还没被评测更麻烦的是不同榜单口径不一样分数根本没法直接比。ai-model-world 的思路是把分散的模型元数据和榜单数据聚合、仲裁、再统一展示。它的数据来自几个公开来源模型元数据models.devMIT 许可榜单分数智力 / 数学 / 科学 / 编程Epoch AICC-BY 4.0编程测评LiveBenchApache-2.0参数量与开源许可Hugging Face按项目说明这些数据每小时自动同步新模型发布、旧模型退役、价格调整、榜单更新都会跟着走。设计上有几个细节我觉得挺专业跨赛制的分数不混算。同一个模型换一套评测脚手架分数能差二三十分所以项目把 30 多个互不通用的第三方编程赛制分开列绝不拍成一个综合数。缺数据的画成空槽厂商自报的会标自报。也就是说它不为了让页面好看而编数据。所有文案由真实数据套模板生成不调用任何 LLM。这句很关键——介绍文字是算出来的不是生成出来的避免了模型幻觉污染事实。另外它还标注了合规边界项目不使用 Artificial Analysis 的数据其条款禁止再分发也不抓取 LMArena其条款禁止自动化抓取。做数据聚合工具先把来源许可看清楚这点值得很多同类项目学习。对做技术选型的人有什么用如果你平时要选模型、做方案对比这个站能省不少事横向对比价格、上下文长度、能力四个维度聪明、编程、记性、便宜一目了然缺数据的地方标得清清楚楚。时间线几百个模型按发布日期排成一条河能看到各家迭代的节奏和厂商的演进关系。排行榜按不同赛制分开看而不是被一个综合分误导。搜索输入多模态直接列出全站多模态模型输入某厂商 多模态还会回答这家有没有对应模型。想自己跑一遍成本很低项目是 Next.js 静态导出、零后端部署很轻。本地开发基本就是常规的那几步gitclone https://github.com/liyupi/ai-model-world.gitcdai-model-worldnpminstallnpmrun dev它真正的核心是两条数据管线npmrunsync# 抓取上游数据、仲裁、校验产出 data/models.jsonnpmrun sprites# 由 models.json 再生产角色精灵图和搜索索引# 数据管线的 217 项纯函数自检不联网npx tsx scripts/sync/selftest.ts按文档说明这两条管线离线确定性不需要任何 API Key同样的输入永远产出同样的输出。从中国大陆运行时访问 Hugging Face 可能失败参数量字段会留空并标记为confidence: unknown但不影响其余部分——生产环境的抓取跑在 GitHub Actions 上。这个容错设计也挺值得借鉴。代码和文档是 MIT 许可。作者也把话说得很实在技术上不难唯一依赖人工常识的地方是某家厂商应该对应什么形象这部分做成了一张查表欢迎提 PR 补。几个要提醒的坑榜单分数不等于你的场景效果。再全的横评也只是参考最终还是要用你自己的业务数据压测。数据是聚合来的会有延迟和缺漏。官方说明是每小时同步但第三方榜单本身也有更新周期别把它当实时真理。只看谁最强容易踩坑。便宜、延迟、稳定性、工具调用、结构化输出很多维度榜单测不出来选型时得自己补。一句话收尾这个项目最有价值的地方不是像素小人好看而是它用一套可复现、可追溯、尊重来源许可的数据工程把选模型这件碎片化的事变得可比较。工具能帮你少翻几篇评测但替代不了你自己的压测。你现在选模型主要看什么榜单、价格还是直接上手试评论区聊聊。
返回列表