
如何把 Ornith-1.5-35B-A3B-GGUF 变成 AI 编程助手OpenClaw、Hermes、OpenCode 接入指南【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUFOrnith-1.5-35B-A3B-GGUF 是开源模型 Ornith-1.5-35B-A3B 的 GGUF 量化包每 token 仅激活约 3B 参数却能在终端编程、SWE-bench 等 Agent 编码基准上领先同级模型。本文带你在 3 步内把它变成自己的 AI 编程助手启动 OpenAI 兼容服务再接入 OpenClaw、Hermes、OpenCode 等 Agent 框架。35B-A3B 为什么适合当编程助手Ornith-1.5 是 Ornith 团队通过端到端自我改进任务生成、脚手架构建、强化学习共同优化训练的新一代基础模型。这个仓库提供的是它的 GGUF 版本专为 llama.cpp / Ollama 等本地推理运行时设计特性说明MoE 架构总参数 ~35B每 token 激活 ~3B推理速度快上下文256K tokens可用 YaRN 扩展到约 1M推理模型默认先输出think思考块再给出最终答案工具调用输出 OpenAI 风格tool_callsAgent 框架即插即用编码能力SWE-bench Verified 79 分Terminal-Bench 2.1 达 67.8 分完整的基准对比和评测说明见 README.md。选择 GGUF 量化版本仓库内置 5 个精度的模型文件按需选择即可下载后放在同一目录下多模态场景还需视觉投影文件 mmproj-Ornith-1.5-35B-BF16.gguf文件精度体积参考适合谁Ornith-1.5-35B-Q4_K_M.ggufQ4_K_M约 20 GB显存/内存 24GB 的首选性价比最高Ornith-1.5-35B-Q5_K_M.ggufQ5_K_M约 23 GB追求更高质量内存 32GBOrnith-1.5-35B-Q6_K.ggufQ6_K约 26 GB内存 32GB质量与体积平衡Ornith-1.5-35B-Q8_0.ggufQ8_0约 36 GB内存 48GB接近全精度Ornith-1.5-35B-BF16.ggufBF16约 70 GB追求极致质量MoE 可按需卸载到内存 新手推荐从Q4_K_M起步速度快、质量损失小足够支撑日常编程任务。第一步启动 OpenAI 兼容服务Ornith-1.5-35B-A3B-GGUF 提供两条启动路线二选一即可。路线 A本地 GGUFCPU 或小显存推荐新手方式 1Ollama 一条命令ollama run hf.co/ornith-ai/Ornith-1.5-35B-A3B-GGUF方式 2llama.cpp 起 API 服务本文后续接入 Agent 用这条llama-server -hf ornith-ai/Ornith-1.5-35B-A3B-GGUF --port 8000 -c 262144启动后在http://localhost:8000得到 OpenAI 兼容端点-c 262144即开启 256K 上下文。Atomic.chat 等图形界面也可用同样的llama-server命令直接加载。路线 BGPU 高并发vLLM / SGLang多卡环境下可用 BF16 权重起服务。以 vLLM2×80GB为例关键点是开启工具调用解析和推理内容解析Agent 框架才能正确识别工具调用vllm serve ornith-ai/Ornith-1.5-35B-A3B \ --served-model-name Ornith-1.5-35B-A3B \ --host 0.0.0.0 --port 8000 \ --tensor-parallel-size 2 \ --max-model-len 262144 \ --enable-prefix-caching \ --enable-auto-tool-choice --tool-call-parser qwen3_xml \ --reasoning-parser qwen3 \ --trust-remote-codeSGLang 的等价命令--tool-call-parser qwen3_coder --reasoning-parser qwen3同样见 README.md。第二步接入 Agent 框架服务起来之后接入各类 Agent 框架都只需要指向端点这一件事。OpenClaw3 个环境变量即完成OpenClaw 支持任何 OpenAI 兼容端点设置三个环境变量后指向你的 Ornith 服务即可export OPENAI_BASE_URLhttp://localhost:8000/v1 export OPENAI_API_KEYEMPTY export OPENAI_MODELornith-ai/Ornith-1.5-35B-A3B之后 OpenClaw 的 Agent 循环思考、调用工具、执行命令全部由本地 Ornith 驱动代码不出本机。Hermes Agent同一套环境变量Hermes 与 OpenClaw 的配置方式一致把基地址和模型名指过去即可export OPENAI_BASE_URLhttp://localhost:8000/v1 export OPENAI_API_KEYEMPTY export MODELornith-ai/Ornith-1.5-35B-A3B⚠️ 本地服务不需要真实密钥EMPTY之类的任意非空字符串都能通过验证。OpenCode注册本地 ProviderOpenCode 需要在~/.config/opencode/opencode.json里把本地端点注册为一个 provider{ $schema: https://opencode.ai/config.json, provider: { ornith: { npm: ai-sdk/openai-compatible, name: Ornith (local), options: { baseURL: http://localhost:8000/v1, apiKey: EMPTY }, models: { ornith-1.5-35B-A3B: { name: Ornith-1.5-35B-A3B } } } } }保存后运行opencode在模型列表里选择ornith-ai/Ornith-1.5-35B-A3B即可在终端里让它理解代码库、自动改文件、跑测试。第三步推荐参数与长上下文技巧日常使用建议的采样参数README.md 官方推荐通用任务temperature0.6、top_p0.95、top_k20复现基准成绩temperature1.0 两个实用技巧思考内容分离Ornith 是推理模型服务端开启reasoning-parser后think思考链会进入独立的reasoning_content字段最终答案干净可读。超 256K 的长上下文可用内置的 YaRN 把窗口扩到约 1Mfactor: 4.0。注意只在任务确实超长时再开启——静态缩放对普通长度输入略有损耗50 万 token 左右的需求用factor: 2.0更合适。常见问题排查现象原因与解决连接被拒绝服务未启动或端口不对确认http://localhost:8000/v1可访问报 model not found客户端里的模型名与服务端--served-model-name不一致401 未授权本地服务也要求非空 key填EMPTY即可长任务被截断启动参数未给足上下文llama.cpp 的-c、vLLM 的--max-model-len文件清单速查模型文件Ornith-1.5-35B-Q4_K_M.gguf · Ornith-1.5-35B-Q5_K_M.gguf · Ornith-1.5-35B-Q6_K.gguf · Ornith-1.5-35B-Q8_0.gguf · Ornith-1.5-35B-BF16.gguf视觉投影多模态mmproj-Ornith-1.5-35B-BF16.gguf完整说明与评测README.md写在最后35B-A3B 的3B 激活设计意味着它用远小于总参数量的算力就能干活——这正是本地 AI 编程助手最需要的特性一台 32GB 内存的电脑跑 Q4_K_M 版本配合 OpenClaw、Hermes 或 OpenCode就拥有一位 24 小时在线、代码不出内网的编程搭档。从 Q4_K_M 起步把端点指过去剩下的交给 Agent 框架。【免费下载链接】Ornith-1.5-35B-A3B-GGUF项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B-GGUF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考