ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Strata 让普通游戏电脑跑 1250 亿参数大模型

Strata 让普通游戏电脑跑 1250 亿参数大模型 摘要Strata 是一个开源推理引擎能让一台带 NVIDIA 显卡的普通游戏电脑跑起 1250 亿参数的 Qwen3.8-Flash-Next。Windows 和 Linux 都支持一键安装装完在本机 8080 端口提供 OpenAI 和 Anthropic 两种兼容接口还能直接喂图片。官方在 RTX 507012GB上实测生成速度 53 到 93 tokens/s比人读字还快。背景大模型为什么总在服务器上这类模型动辄需要几百 GB 显存而一张游戏卡只有 12 到 24GB。差距太大所以大家习惯了调云端接口。Strata 的思路是别让显卡单打独斗把整台电脑的资源都用起来就像厨房里常用的调料放手边其余的收进储物间。核心优势专家分层存放。模型由 24576 个小专家组成每生成一个词只调用其中 10 个。显卡只放每个词都要用的部分以及被调用最频繁的几千个专家并且会在使用中持续学习哪些最常用。全部专家放在内存里显卡没有的由 CPU 同步计算两边互不等待。硬盘上还有一张约 29GB 的查找表每个词只读其中几小行。先猜后验提速 1.6 到 1.8 倍。模型内置一个小助手先猜接下来几个词大模型一次性检查这些猜测认可的就保留。每个词最终仍由大模型把关所以回答质量不变只是出字更快。长文读得快。长文按最多 8192 个 token 一块来读长文档和代码库的读取速度能超过每秒 1000 token。接口全兼容。本机直接给出 OpenAI 风格接口和 Anthropic 风格接口现有的聊天应用、编程助手改个地址就能接上。支持图片输入网页里点「Picture」终端里输入/image加路径应用里直接附图即可。完全开源引擎采用 MIT 协议模型文件各自遵循自己的许可。速度到底怎么样官方在 RTX 507012GB、锐龙 5 7600、64GB 内存上的实测量化版本短对话生成128K 上下文生成读取提示词Q2_093 tokens/s74 tokens/s2170 tokens/sIQ2_XS79 tokens/s63 tokens/s2090 tokens/sIQ3_XXS62 tokens/s49 tokens/s1750 tokens/sIQ3_S53 tokens/s46 tokens/s1620 tokens/s显存更大的卡会更快官方估计 RTX 309024GB大约在 100 到 140 tokens/s。读 3.2 万 token 的提示词用 Q2_0 大约 15 秒。面向人群想在本机跑大模型、不愿把代码和文档交给云端的开发者手里有 12GB 以上显存的 RTX 20、30、40、50 系显卡内存在 32GB 以上64GB 最从容的玩家想给编程助手接一个本地后端省掉接口费用的人对「消费级硬件如何跑超大模型」的工程思路感兴趣的人硬件要求重点看这里先把门槛说清楚避免踩坑显卡NVIDIA RTX 20、30、40、50 系列显存 12GB 及以上。双卡或三卡可以共同分担此时每张卡需要 8GB 以上内存取决于选哪个版本。内存至少要比模型第一分片大 10GB 左右留给系统和其他程序硬盘约 80GB 空闲空间用固态硬盘首次启动会快很多系统Windows 10/11 或 Linux驱动需要自己装好较新的 NVIDIA 驱动其余的 Python、引擎、模型都由安装脚本搞定四个体积版本的取舍版本内存加显存需求特点Q2_037.6 GB最快质量不错IQ2_XS39.2 GB较快质量更好官方推荐IQ3_XXS47.0 GB稍慢质量很好IQ3_S54.8 GB最慢质量最好在公开测试上与完整模型持平不确定就选 IQ2_XS。如果主要写代码或者内存只有 32 到 48GB可以选 Coder 版它砍掉一半专家只保留代码、工具调用和图片需要的部分第一分片只有 29.6GB32GB 内存就能跑。快速上手Windows下载项目压缩包并解压双击START-HERE.bat。它会问几个问题包括选哪个模型和体积、上下文多长、要不要读图一路回车就是推荐配置。随后自动下载约 70GB 的模型并启动浏览器会打开本机 8080 端口的 Strata 页面。Linux执行./setup.sh问题和结果都一样。DockerLinux需要 NVIDIA Container Toolkit 和 580 以上的驱动。dockerbuild-tstrata.dockerrun--rm--gpusall-p8080:8080--ulimitmemlock-1-vstrata-data:/data strata有两点要提前知道首次启动时电脑可能卡顿 1 到 3 分钟因为它要往内存里装 35 到 55GB 数据。这是正常现象别关窗口。下载中断了重新运行脚本就会接着下不会重复下载。进阶用法接入自己的应用。在应用里添加一个「OpenAI 兼容」提供方地址填下面这个密钥和模型名随便填http://127.0.0.1:8080/v1使用 Anthropic 接口的应用地址则是http://127.0.0.1:8080/v1/messages调节思考深度。模型回答前会先思考可以选关闭、低、中、高。关闭最快高适合难题。网页里在菜单切换终端里用/think low应用里用推理强度设置。多卡共用。直接运行START-HERE.bat它会列出可用的显卡并询问是否分摊。官方在 RTX 5080 加 RTX 3090 上测得读提示词比单张 5080 快 18% 到 20%生成速度持平。测出你机器的最快设置。运行START-HERE.bat --calibrate花 5 到 10 分钟测几项引擎参数并保留最快的一组官方机器上让 Coder 版提速了 7%。使用中要注意它一次只处理一个请求不适合多人并发一段对话的第一条消息会被完整读取大约每 3 万 token 需要 1 分钟之后只读新增部分追问几秒就开始回答聊天记录只存在浏览器本地换浏览器或开无痕窗口就是空的如果要从手机或另一台电脑访问务必设置密钥不要把端口裸露在网络里我的看法Strata 最有价值的地方是把「内存大、显卡小」这个普通人的现实条件变成了可用的方案。它不追求单项极限而是让显卡、CPU、内存、硬盘各干各的活。当然也别神化它12GB 显存加 48 到 64GB 内存Coder 版也要 32GB的门槛依然不是人人都有而且量化版本相比完整模型有精度损失IQ3_S 才是官方称与完整模型持平的那一档。但对已经有这套硬件的玩家来说本地跑一个 1250 亿参数的模型已经从想象变成了双击就能完成的事。项目地址github.com/Niko1221/Strata
返回列表