
8 月 29 日科技媒体 testingcatalog 报道OpenAI 正在加快新一代模型 Astra 的发布进程新增了 mozaik-alpha-fdm 测试阶段来扩大内部测试范围随后有网友分享了首批演示样本仅一次对话交互模型就生成了一个类似《侠盗猎车手 2》的俯视角游戏以及精细的网站、3D 对象和体素环境。这是目前关于下一代 GPT 级别模型信息量最具体的一次流出。这次透露了什么先说结论目前没有任何官方确认Astra 是否就是外界猜测的 GPT-6 还没有定论但多方报道据报道包括《The Information》在内普遍认为 Astra 是 GPT-6 的候选名称之一参数规模可能达到 10 万亿。代号延续了 OpenAI 的天体命名传统——Sol、Terra、Luna 之后是 Astra拉丁语意为星辰。比起参数传闻演示样本更有信息量模型重点提升的是代码编写和可视化软件创建而不是聊天、写作这类文本能力输出物是可直接运行/可交互的制品游戏、网页、3D 对象不是代码片段测试方反馈当前是零样本测试、开满推理强度推理时间比现役的 GPT-5.6 Sol 长得多。变了什么没变什么从技术本质看这次变化的信号是大模型的能力重心从生成文本转向端到端生成可运行的软件制品。以前 AI 写代码是给你一段代码你自己跑现在是给你一个能玩的游戏、一个能打开的网站。这背后的关键是模型对工程上下文的把握——文件结构、运行环境、对象关系一次交互就要全部组织对复杂度比生成单文件高一个量级。但没变的东西同样明显演示 ≠ 产品。零样本、最大推理强度、测试阶段这三个词意味着当前版本是能跑通但很贵很慢的状态和正式发布的 API 差距可能很大推理成本和延迟的老问题依然存在。10 万亿参数级别的模型如果推理时间比现在的旗舰还长得多普通开发者想日常调用先得掂量一下账单人还是要负责验收。模型生成的东西看起来能跑和业务上正确是两回事测试、验收、迭代依然需要人。对普通开发者和做产品原型的人来说实际影响是原型制作这个环节的成本可能会明显下降——以前从需求到可演示的 demo 要排期、要写代码将来可能是一句话的事。但反过来需求描述能力和结果验收能力会变得更值钱。现在能做点什么我的建议是分三层看**第一别被演示样本带节奏。**测试阶段的视频挑的都是最顺利的一次交互不代表平均水准。等正式发布、第三方跑基准测试再看尤其要等 API 价格和延迟公布那才是能不能日常用的关键指标。**第二把描述需求当技能练。**如果未来的工作流是一句话 → 可运行原型那提示词就不再只是聊天的技巧而是产品需求的表达方式。一个能写清楚约束、验收标准的人和只会说帮我做个游戏的人产出质量会差很远。**第三自己先体验一下同类能力。**等不到 Astra 也没关系现在就能用现成工具感受从描述到可运行制品的流程比如让模型生成一个单文件的网页小游戏canvasidcwidth320height240styleborder:1px solid #333/canvasscriptconstcdocument.getElementById(c),ctxc.getContext(2d);letx10,y10;ctx.fillStyle#222;ctx.fillRect(0,0,320,240);ctx.fillStyle#0f0;ctx.fillRect(x,y,20,20);document.addEventListener(keydown,e{if(e.keyArrowRight)x5;if(e.keyArrowLeft)x-5;if(e.keyArrowDown)y5;if(e.keyArrowUp)y-5;ctx.fillStyle#222;ctx.fillRect(0,0,320,240);ctx.fillStyle#0f0;ctx.fillRect(x,y,20,20);});/script 保存成 html 用浏览器打开方向键就能移动那个方块。这就是一次交互生成可运行制品的最小形态——现在的模型做到这一步已经很轻松Astra 演示的意义在于把它做到了游戏、3D 场景这种更复杂的级别。 等 Astra 正式发布后评估要不要用我建议盯三个指标一是**成功率**同一个需求多跑几次看演示里的效果能不能稳定复现二是**延迟和单价**原型阶段可以忍受慢但要算清楚一次生成的成本贵到比人写还费钱就没意义了三是**可控性**能不能分步修改生成的工程而不是推倒重来。原型场景适合当加速器但生产环境该等生态工具链跟上再上别把正式业务押在一次交互上。 ## 结语 从代码补全到一句话生成一个可玩的游戏这个方向本身不意外真正值得盯的是发布后的价格、延迟和稳定性——那才决定这事跟我们普通打工人有没有关系。你怎么看评论区聊聊。