Kimi K3 实测:2.8T 参数、100 万上下文,我让它做了网页、PPT 和 3D 游戏
Kimi K3 实测:2.8T 参数、100 万上下文,我让它做了网页、PPT 和 3D 游戏
大家好,我是王不二。
最近事情实在是太多,没有第一时间发布K3的实测,请各位粉丝海涵。
晚是晚了点,但好处是排队的人……并没有变少。反正已经迟到几天了,索性把测试做得更扎实些。
写在前面:为了测它,我充了 199
先说一件有点肉疼的事。K3 上线后实在太火,好几次想白嫖测试,K3都很客气的把我拒绝了。
于是我一咬牙,充了 199 的会员。某种意义上,我的钱包比我更先体验了 K3。为了给大家做这期测试,也算是下了血本,看完觉得有用记得给个三连啦。
真金白银换来的第一手上手体验,基本可以浓缩成四个字:大、慢、强、贵。
大,是真的大:我其实有点不理解Kimi,之前大家都说不卷参数不卷参数,结果Kimi回回把模型越做越大。上一次也是Kimi率先把模型参数从B级别,带到了T级别。这次更狠,直接奔着3T去了。照这个膨胀速度,以后本地部署党可以彻底死心了,甚至很多企业端想要本地部署,也可以死心了。也挺好,我的显卡释放出来,全心全意为我的游戏服务。
慢,是真的慢:这个不单单是我的体验,基本用过的都会吐槽。倒不是因为显卡、算力什么的不够,导致的回复慢。而是模型想太多,一个简单任务也要思考半天,还要再校验,校验完自己还要再润色。但客观来讲,面对复杂问题的时候,这种做法还是不错的。所以你能明显感觉到,模型在处理复杂任务上很强。
强,是真的强:复杂问题上的思考深度确实换来了质量。这里先不展开了,下文有实测。
贵,也是真的贵:API 输出价 $15/百万 token,比上一代 K2.6($4/百万 token)贵了近 4 倍;第三方 Artificial Analysis 跑一轮完整评测,烧了 1.3 亿输出 token,成本约 2690 美元,收获中肯评价“聪明但贵且慢”。连 C 端会员都得分档,199 这档才算真正用上完整版——是的,就是我充的那档。
一、K3 基本情况
| 项目 | 内容 |
|---|---|
| 发布时间 | 2026 年 7 月 16 日深夜上线,17 日官宣(WAIC 2026 前夕) |
| 模型定位 | 旗舰模型,面向长程编程、知识工作、推理三类前沿场景 |
| 参数规模 | 2.8 万亿总参数,MoE 架构,896 个专家、每 token 激活 16 个 |
| 上下文长度 | 100 万 token,最高输出 1048576 token |
| 模态 | 原生多模态输入(图/视频/文本),输出为文本 |
| 开源承诺 | 完整权重 2026 年 7 月 27 日前发布,技术报告随权重一同公布 |
| API 价格 | 缓存命中输入 $0.30 / 未命中 $3.00 / 输出 $15.00(每百万 token) |
技术方面
完整的技术报告要后续随权重一起发,目前能看的只有官方技术博客。
KDA 混合线性注意力:传统注意力生成每个字,都要回头"看"一遍前面所有的内容——前面有 100 个字看 100 个,有 100 万个字看 100 万个。所以很多模型的"百万上下文"是塞得下、用不起。KDA 这套 Kimi 自研的新机制,让"回头看"的成本不再随长度膨胀,不管前面是 1 千字还是 100 万字,生成下一个字的成本基本恒定。第三方实测百万 token 下,生成速度最高快 6.3 倍(具体怎么测的,要等 7 月 27 日技术报告确认)。
极致稀疏 MoE:共 896 个专家,但每次 token 只激活 16 个,极致的稀疏比例。官方称扩展效率比 K2 提升约 2.5 倍,相当于同样的算力,K3 能"学"到 K2 两倍半的东西。
长程 Agentic Coding:官方给了三个案例——从零写出 MiniTriton 编译器、单次自主运行 48 小时设计一颗芯片、官方宣传片自己剪。共同点就一个:任务链条长到人都会累,它几十小时连续决策不跑偏。
官方自曝三大局限:这一点,Kimi做的还是挺坦诚的。①对思考历史敏感(一个任务中最好不要切换模型)、②"过度主动"(遇到模糊意图会替你做没让它做的决定)、③体验与 Fable 5 / GPT 5.6 Sol 仍有差距。
性能跑分
接下来看看官方发布的基准对比表,K3 和 Claude Fable 5、GPT 5.6 Sol、Opus 4.8 这些第一梯队模型正面刚。
Coding 编程
六个编程基准,K3 拿下两个第一,Program Bench(77.8)和 SWE Marathon(42.0)。输掉的几项里,其实落后的差距也并不大。Terminal Bench 2.1(终端命令行操作)只差 0.5 分。真正差距明显的是 DeepSWE 和 FrontierSWE(都是高难度软件工程任务),榜首还是 GPT-5.6 Sol 和 Fable 5。
General Agents 通用智能体
BrowseComp 深度搜索 91.2 第一、Automation Bench 自动化办公 30.8 第一、SpreadsheetBench 表格处理 34.8 险胜拿下第一。输的主要是两个综合 Elo 评分(GDPval-AA 和 AA-Briefcase),考的是模拟真实岗位的白领知识工作(写报告、做分析、处理文档这类)。
Visual Agents 视觉智能体
两个带工具的视觉推理基准,K3 都是第二:CharXiv 91.3、Zerobench 41.0,榜首都是 Fable 5。但是也算稳稳站在第一梯队。
二、实测:图形、网页、PPT、3D 游戏
先交代测试思路。K3 本身只能输出文本(输入支持图像、视频、文本),但在线使用时我发现K3有图片生成工具,所以我先测了两个图片案例热身;再把精力放在 K3 最被看好的代码和生成能力上——网页、PPT、3D 游戏各两个案例。prompt 全部原文照录,大家可以直观体会一下。
2.1 图形测试
案例 1: 生成美女直播卖农具的图片。卖的是金锄头,标价388。
直播元素全齐了,左上角"直播"标 + 5.8 万观看、环形补光灯、手机支架、背景"助农惠农 乡村振兴"横幅、左下角弹幕滚动,右下角红色价格牌"金锄头 ¥388"。
案例 2:生成一张试卷,有题目,有解答,有老师的判分。满分100,得分98 因为有错误。保证题目和做对的题都是真实正确的。
填空、判断全部正确。最后一道应用题,计算正确但漏写单位"厘米",老师扣 2 分,98 分的构成完全合理。美中不足是应该是手写部分的字体看着像打印的,太工整了。
2.2 网页测试
前端代码是 K3 第三方盲投登顶的领域,两个案例验证含金量。
案例 1: 生成一个"黑客帝国"风格的数字雨动画:黑色背景上,绿色字符(日文片假名+数字+字母)从顶部随机位置下落。在这个上面再加一些正常网页有的内容,比如把这个网页改造成一个博客。
结果很不错,数字雨实时渲染,画面流畅不卡顿。内容也是有鼻子有眼,比较充实。
案例 2:生成一个销售数据仪表盘页面,包含:折线图展示近12个月销售额趋势、饼图展示产品类别占比、柱状图对比各区域业绩。使用 ECharts 或 Chart.js 库,数据用模拟数据,支持图表联动(点击饼图区域,折线图只显示该区域趋势)
KPI 卡片、折线图、饼图、柱状图,要素齐全。要说不足的话,就是这个页面还是太简单了,够用,但是没有让我感受到惊艳的感觉,当然这个也怪prompt太简单了。
2.3 PPT 测试
PPT 最能暴露"内容策划"底细——代码可以搜、版式可以套,"这几页讲什么"全靠模型自己组织。
案例 1: 生成一个PPT,讲讲最近特别火的幻兽啪鲁这个游戏,大概5页就好。哈哈哈,请原谅我最近玩帕鲁有点上头。
像素可爱风,PPT结构也很清楚:封面(“4000 万玩家上头”)→ 有多火(四张数据卡)→ 玩法(宝可梦×方舟×打工人模拟器)→ 1.0 正式版时间轴 → 后续(任天堂官司和玩梗)。
案例 2:帮我做一个专业的,有深度的,商务场景用的,AI讲解PPT,10页
这个效果,完全可以到直接使用的程度,我初步看了下,格式几乎不用改。下次在讲课,就直接用K3生成了。
2.4 3D 游戏测试
最后的重头戏。官方叙事里有"一句话生成可玩 Minecraft 克隆"——这话听得我心痒,我用两个案例来测测它的效果。
案例 1:帮我用html 生成一个太阳系模型,3D的,要求可以放大缩小,选中对应的星体,还可以仔细查看,包括旋转,放大什么的
这个太赞了,效果很好,包括各个星球的样式也很完美。地球我认真看了,很真实、没毛病,其他的星球没仔细比对,但应该也不差。
案例 2:做一个H5的,我的世界,游戏内容主要是向上攀登。主角有发射蜘蛛丝的能力,可以荡蜘蛛丝,可以顺着蜘蛛丝拉过去,比如一些比较高的地方,可以利用蜘蛛丝攀登,左键发射,右键拉扯。要求场景优美。
MC 风浮空岛场景,草地方块、树叶、水池、像素云和太阳、一应俱全。机制上也确实实现了使用蜘蛛丝的功能。美中不足是有一些地方设计的不合理,并不是每一个平台都能跳上去,有一些地方必须使用蛛丝。(我认真通关了,还挺好玩的)