ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Agentic 成为 2026 大模型新赛点:DeepSeek-V4-Flash 登顶调用榜、Qwen3.8-Max 问鼎 Agentic Index

Agentic 成为 2026 大模型新赛点:DeepSeek-V4-Flash 登顶调用榜、Qwen3.8-Max 问鼎 Agentic Index

Agentic 成为 2026 大模型新赛点:DeepSeek-V4-Flash 登顶调用榜、Qwen3.8-Max 问鼎 Agentic Index


![封面图](https://picsum.photos/seed/17865019992789/800/400)


2026 年 8 月的 AI 圈,两件事同时发生:**DeepSeek-V4-Flash 正式版以单周 8.83 万亿 Token 登顶 OpenRouter 全球调用量榜首**,中国大模型连续十五周超越美国;同一周,**阿里 Qwen3.8-Max 以 55.4 分问鼎 Artificial Analysis 的 Agentic Index 排行榜**,力压 Claude Opus 5(55.3 分)与 GPT 5.6。过去一年我们习惯了"智力榜单"上的你追我赶,而 2026 年下半年的竞争焦点,已经从"谁更聪明"转向"谁更会干活"——**Agentic(智能体)能力,就是这场新赛点的主战场**。本文结合这两大事件,拆解 Agentic 能力的本质、三大技术支柱,并给出工程侧的评测与选型实战。


一、两个标志性事件:量价登顶与能力登顶


先看数据。OpenRouter 最新周榜(8 月 3 日至 8 月 9 日)显示:


• 全球 AI 大模型周调用总量 69 万亿 Token,环比增长 21.48%;

• **DeepSeek-V4-Flash 正式版以 8.83 万亿 Token 登顶,环比暴涨 570%**;

• 中国大模型周调用量 34.25 万亿 Token,**连续十五周超过美国**,全球调用量前四全部是中国模型;

• Artificial Analysis 同期将其评为"**全球运行成本最低的主流大模型**":输入 0.14 美元 / 百万 Token,输出 0.28 美元 / 百万 Token。


另一边,独立评测机构 Artificial Analysis 更新的 Agentic Index 榜单上,Qwen3.8-Max 在 GDPval-AA v2、τ³-Banking 等关键智能体任务中表现出色,以 55.4 分登顶。要知道,这个榜单的冠军此前长期被 Claude、GPT 垄断,中国模型此前最好成绩是 Kimi K3 的 50.1 分——这一跃,直接刷新了中国大模型在智能体领域的历史纪录


两个事件合起来看,信号非常清晰:模型竞争已经进入"Agentic 红利期"。调用量爆发,是因为 Agent 应用在真实生产环境里疯狂消耗 Token;能力登顶,是因为模型厂商把后训练资源集中砸向了"会干活"的能力。智能体应用是 Token 消耗的最大引擎,而 Token 消耗又反过来倒逼模型在工具调用、长程任务上做到又快又便宜。


二、Agentic Index 是什么?为什么它比"智力榜"更重要


传统榜单(如 MMLU、GPQA)考的是"知识"和"推理",更像闭卷考试。而Agentic Index 考的是"干活":给模型一个开放目标,让它自己去拆解任务、调用工具、读取反馈、修正计划,最后交付结果。


Artificial Analysis 的 Agentic Index 主要基于两类基准:


| 基准 | 考察内容 |

| --- | --- |

| GDPval-AA v2 | 多步开放任务的自主规划与执行质量 |

| τ³-Banking | 长程交互中的工具调用正确率与状态跟踪 |


两者的共同点:评价的不是"一次回答好不好",而是"一整条工作流能不能跑通"。模型需要处理工具返回的错误、记住中间状态、在几十上百轮交互中不迷失目标——这正是 Agent 落地到企业场景时最要命的能力。


这也是为什么 Qwen3.8-Max 的登顶被 HN 开发者称为"中国已经追平了":当 SOTA 之间的"智力"差距小到难以分辨时,谁的工具调用更稳、规划更准、成本更低,谁就决定了下半年 Agent 应用的天花板


三、Agentic 能力的三大技术支柱


3.1 工具调用(Function Calling):Agent 的"手"


Agentic 能力的地基是稳定的工具调用。一个模型如果连 JSON 参数都经常填错,后面的规划全是空中楼阁。以下是一个标准的工具调用循环:


import json from openai import OpenAI client = OpenAI(base_url="https://api.deepseek.com", api_key="<YOUR_KEY>") tools = [{ "type": "function", "function": { "name": "query_flight", "description": "查询指定日期的航班余票与价格", "parameters": { "type": "object", "properties": { "date": {"type": "string", "description": "日期 yyyy-MM-dd"}, "from": {"type": "string"}, "to": {"type": "string"} }, "required": ["date", "from", "to"] } } }] def agent_loop(messages, max_steps=5): for _ in range(max_steps): resp = client.chat.completions.create( model="deepseek-v4-flash", messages=messages, tools=tools, ) msg = resp.choices[0].message if not msg.tool_calls: return msg.content # 模型认为任务完成 messages.append(msg) for tc in msg.tool_calls: # 真实执行工具,并把结果回填给模型 result = execute_tool(tc.function.name, json.loads(tc.function.arguments)) messages.append({ "role": "tool", "tool_call_id": tc.id, "content": json.dumps(result, ensure_ascii=False), }) return "已达最大步数,任务未完成"


关键点在于:工具结果必须作为新消息回填,模型才能基于真实反馈继续决策——这一步的工程化程度,直接决定了 Agent 的可靠性。


3.2 长程规划与状态跟踪:Agent 的"脑"


DeepSeek-V4-Flash 正式版与预览版"模型结构、参数规模完全一致,仅完成新一轮后训练优化",却实现了 Agent 能力的跃迁——这说明 2026 年的竞争重心已经从预训练转向后训练强化:用大规模 Agentic 数据 + RL 教模型"长时间不跑偏"。


# 简易 Agent 状态机:拆解 → 执行 → 校验 → 重试 class SimpleAgent: def __init__(self, model, max_retries=3): self.model = model self.max_retries = max_retries def run(self, goal: str) -> str: plan = self.plan(goal) # 1. 拆解子任务 for step in plan: ok = False for _ in range(self.max_retries): result = self.execute(step) # 2. 执行 if self.verify(result): # 3. 校验 ok = True break if not ok: return f"步骤失败: {step}" return self.summarize() # 4. 汇总交付


生产级实现远比这复杂(记忆管理、并发工具、安全护栏),但骨架不变:规划-执行-校验-重试。Agentic Index 高分模型的共性,就是在这条循环里每一步都更少出错。


3.3 成本效率:Agent 的"命"


Agent 工作流是 Token 消耗大户——一个长任务动辄几十上百轮交互。DeepSeek-V4-Flash 的 284B 总参数 / 13B 激活 MoE 架构 + 百万级上下文 + 极致定价,让"跑得起"成为可能。性能差距缩小到可接受范围后,价格就是决定性因素,这也是它能单日消耗 8 万亿 Token 的原因。


四、工程实战:如何科学评测与选型 Agentic 模型


选型不能只看榜单。给你一个可落地的本地评测 harness:用 OpenAI 兼容协议并发跑一批"多步工具任务",统计工具调用成功率和任务完成率:


import asyncio, json from openai import AsyncOpenAI TASKS = [ {"prompt": "查询北京到上海明天的高铁,选最早一班,返回车次", "steps": 2}, {"prompt": "查 A、B、C 三只股票今日涨跌,按涨幅排序", "steps": 3}, # ... 按你的业务场景扩展 ] async def eval_model(base_url, api_key, model_name): client = AsyncOpenAI(base_url=base_url, api_key=api_key) ok_steps, ok_tasks = 0, 0 for t in TASKS: steps_done = 0 messages = [{"role": "user", "content": t["prompt"]}] for _ in range(10): r = await client.chat.completions.create( model=model_name, messages=messages, tools=TOOLS) msg = r.choices[0].message if not msg.tool_calls: break steps_done += 1 messages.append(msg) for tc in msg.tool_calls: messages.append({"role": "tool", "tool_call_id": tc.id, "content": json.dumps(mock_tool(tc.function.name))}) ok_steps += min(steps_done, t["steps"]) ok_tasks += steps_done >= t["steps"] return {"tool_call_accuracy": ok_steps / sum(t["steps"] for t in TASKS), "task_completion": ok_tasks / len(TASKS)}


评测建议三条铁律:


1.用你自己的业务工具,别用公开基准的玩具工具;

2.看长尾失败:是规划错、参数错、还是反馈处理错?逐类修复;

3.算总成本:任务完成率 × 每任务 Token 消耗 × 单价,才是真正的 ROI。


五、展望:Agentic 竞争才刚刚开始


从"会聊天"到"会干活",2026 年大模型的竞争维度已经彻底切换。国产模型在这一轮中展现了惊人的执行力:DeepSeek 用极致性价比把 Agent 的推理成本打到地板,Qwen 用 Agentic Index 登顶证明"工具调用+长程任务"能力可以做到世界第一。可以预见,接下来半年将出现三件事:


1.Agentic 基准进一步细分:金融、代码、浏览器操作等垂直 Agent 榜单会越来越多;

2.后训练军备竞赛加剧:Agentic 数据合成与 RL 会成为各厂商的护城河;

3."模型+框架+成本"三位一体选型:开发者选型时,Agentic 分数、工具生态、每任务成本将取代单纯的"智力分"。


AI 的下半场,比的不是谁会背书,而是谁会干活。你的 Agent 跑在哪个模型上,可能比模型本身更值得你花时间研究。


返回列表