ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Ornith-1.5-35B-A3B-GGUF如何开启推理链与工具调用:reasoning_content与OpenAI兼容接口实战指南

Ornith-1.5-35B-A3B-GGUF如何开启推理链与工具调用:reasoning_content与OpenAI兼容接口实战指南 Ornith-1.5-35B-A3B-GGUF如何开启推理链与工具调用reasoning_content与OpenAI兼容接口实战指南【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUFOrnith-1.5-35B-A3B-GGUF 是开源推理模型 Ornith-1.5-35B-A3B 的 GGUF 量化版本合集。这是一个约 35B 参数的混合专家MoE模型每个 token 仅激活约 3B 参数却在小尺寸模型中领先SWE-bench Verified 达 79 分MCP-Atlas 达 70.2 分。本指南教你用本地 GGUF 权重快速搭起 OpenAI 兼容接口正确开启「推理链reasoning_content」与「工具调用tool_calls」并读懂两者的返回结构。图Ornith-1.5-35B-A3B 在编码、推理与 Agent 基准上的成绩SWE-bench Verified 79、GPQA Diamond 89.2、MCP-Atlas 70.2 等为什么它天生支持推理链Ornith-1.5-35B-A3B 是一个推理模型默认情况下助手回复会先输出一段think … /think思考块再给出最终答案见 README.md 的 Quickstart 说明。关键点是思考块和正文如何分开返回取决于推理时启用哪种解析器——运行环境启用方式返回形式vLLM ≥ 0.19.1--reasoning-parser qwen3思考过程独立放入reasoning_content字段SGLang ≥ 0.5.9--reasoning-parser qwen3同上独立reasoning_content字段llama.cpp / Ollama运行时自带模板解析思考内容在响应中单独呈现正文更干净也就是说reasoning_content不是一个开关参数而是服务端解析器开启后自动产生的字段。对新手来说最省事的路线是直接用 llama.cpp 或 Ollama 跑 GGUF 文件它们开箱即用若你有 GPU 集群跑 BF16 权重再考虑 vLLM/SGLang。仓库文件一览选对量化版本本仓库直接放好了各量化档位的权重文件按需选择即可Ornith-1.5-35B-Q4_K_M.gguf体积最小显存/内存占用最省新手首选Ornith-1.5-35B-Q5_K_M.gguf质量与体积的平衡点Ornith-1.5-35B-Q6_K.gguf接近全精度适合显存充裕的机器Ornith-1.5-35B-Q8_0.gguf8 位量化质量损失极小Ornith-1.5-35B-BF16.gguf全精度版本约 70GB推荐 2×80GB GPU 起步mmproj-Ornith-1.5-35B-BF16.gguf多模态投影文件配合 BF16 主权重使用官方采样参数建议详见 README.md日常使用temperature0.6、top_p0.95、top_k20复现基准成绩则用temperature1.0。最快上手Ollama 一行命令跑 GGUF如果你的机器没有足够显存Q4_K_M 档用 Ollama 是零门槛方案ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUFOllama 会自动把 GGUF 加载进来并在本地暴露 OpenAI 兼容的/v1/chat/completions接口。之后任何 OpenAI SDK 或curl都能直接对话思考块会被自动解析、与正文分开呈现。开启工具调用llama.cpp 的 OpenAI 兼容服务想要「模型调用你的函数」推荐用 llama.cpp 的llama-server起服务这也是 Atomic.chat 等客户端的加载方式llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF --port 8000 -c 262144它支持 256K 上下文。若要在 API 层暴露tools能力在启动命令中追加自动工具选择开关即可具体参数以你使用的 llama.cpp 版本帮助文档为准。服务起来后用任何 OpenAI 兼容客户端Python、Node.js 或 curl指向http://localhost:8000/v1/chat/completions就能对话。读取 reasoning_content 与 tool_calls 的返回结构一次「开启推理 工具调用」的完整请求长这样OpenAI Python SDKfrom openai import OpenAI client OpenAI(base_urlhttp://localhost:8000/v1, api_keyEMPTY) tools [{ type: function, function: { name: get_weather, description: Get the current weather for a city, parameters: { type: object, properties: {city: {type: string}}, required: [city], }, }, }] response client.chat.completions.create( modelOrnith-1.5-35B-A3B, messages[{role: user, content: 巴黎现在天气怎么样}], toolstools, tool_choiceauto, temperature0.6, max_tokens2048, ) msg response.choices[0].message print(getattr(msg, reasoning_content, None)) # 思考过程如解析器已开启 print(msg.content) # 最终回复 print(msg.tool_calls) # 结构化函数调用如 get_weather {city: Paris}看懂三个字段就够了reasoning_content模型「想」的过程。开启推理解析器vLLM/SGLang 的--reasoning-parser qwen3后自动填充建议日志留存排查 Agent 决策问题时非常有用。content用户可见的最终答案。tool_calls标准 OpenAI 格式的函数调用。把工具执行结果以role: tool消息回填后继续对话即可组成完整的 Agent 循环。接入 Agent 与编码 CLI 的实用清单Ornith-1.5-35B-A3B 专为工具调用和 Agent 编码优化配合 OpenAI 兼容端点即可接入主流框架完整示例见 README.mdHermes Agent / OpenClaw设置OPENAI_BASE_URLhttp://localhost:8000/v1、OPENAI_API_KEYEMPTY指向你的本地服务OpenCode在配置中把本地端点注册为 provider 即可Unsloth Studiopip install unsloth后可直接加载该模型做本地推理或微调Atomic.chat直接通过 llama.cpp 的 GGUF 构建加载本仓库权重常见问题速查问题原因与解决回复里混着think标签服务端未开启推理解析器vLLM/SGLang 加--reasoning-parser qwen3或运行时版本过旧vLLM ≥ 0.19.1、SGLang ≥ 0.5.9、Transformers ≥ 5.8.1工具调用返回空确认请求里带了tools与tool_choiceauto且服务端启用了自动工具选择长任务上下文超限模型原生支持 262,144 tokens确需更长窗口时官方建议用 YaRN 扩展factor 4.0 可扩到约 1M注意静态缩放对普通长度请求可能略降质量显存不够跑 BF16换用 Ornith-1.5-35B-Q4_K_M.gguf 等量化档MoE 架构 3B 激活参数推理速度依然可观小结GGUF 权重下载下来用 Ollama 或 llama.cpp 一分钟起服务就能拿到 OpenAI 兼容接口思考过程走reasoning_content函数调用走tool_calls两条线都遵循标准 OpenAI 协议接 Agent 框架几乎零改造。建议从 Q4_K_M Ollama 起步验证流程再按硬件升级到更高精度。【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表