ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

如何用Lucebox本地回答图片问题:LLM视觉推理完整指南(mmproj视觉投影器实战)

如何用Lucebox本地回答图片问题:LLM视觉推理完整指南(mmproj视觉投影器实战) 如何用Lucebox本地回答图片问题LLM视觉推理完整指南mmproj视觉投影器实战【免费下载链接】luceboxLLM speculative inference server for heterogeneous hardware consumer GPUs项目地址: https://gitcode.com/gh_mirrors/lu/luceboxLucebox 是一个面向消费级显卡和异构硬件的 LLM 推测推理服务器除了飞速的文字生成它还支持本地图片问答只要启动时挂载一个--mmproj视觉投影器Qwen 或 DeepSeek V4 Flash Vision 模型就能理解你发来的图表、照片并给出回答。本文带你从零跑通 LLM 视觉推理安装服务器、加载 mmproj 视觉投影器、发送带图片的 API 请求并查看真实硬件上的性能表现。mmproj 是什么让 LLM看懂图片的翻译官大语言模型本身只会处理文字看不懂像素。视觉模型靠一个**投影器projector即 mmproj 文件**把图片的视觉特征转换成模型能理解的向量再交给语言模型生成回答。Lucebox 的用法非常直接不加载--mmproj服务器行为和纯文本模式完全一致零额外开销加载--mmproj服务器通过 OpenAI 兼容接口接收 base64 编码的 JPEG/PNG 图片端到端回答图片问题。官方文档对这条路线有完整说明docs/image-input.md。快速上手3 步跑通 Lucebox 视觉推理服务器第 1 步获取并构建服务器git clone --recurse-submodules https://gitcode.com/gh_mirrors/lu/lucebox cd lucebox cmake -S server -B server/build-hip -G Ninja \ -DCMAKE_BUILD_TYPERelease \ -DCMAKE_HIP_COMPILER/opt/rocm/lib/llvm/bin/clang \ -DLUCE_GPU_BACKENDhip -DLUCE_HIP_ARCHITECTURESgfx1201 cmake --build server/build-hip --target luce_server -j$(nproc) 提示DeepSeek V4 Flash VisionDS4V模型还要求构建时能找到 hipBLASLtCMake 会打印hipBLASLt found: building the DS4V vision ops来确认。第 2 步下载模型和 mmproj 视觉投影器你需要两样东西目标模型 GGUF和与它配套的mmproj 投影器 GGUFclip 格式支持 BF16 / F16 / Q8_0官方推荐 Q8_0——同样的回答质量编码速度更快。模型视觉投影器适合硬件Qwen3.8-27BQwen3.8-27B-mmproj-Q8_0.gguf或任意公开的qwen3vl_mergermmproj单张 GPU任意后端DeepSeek V4 Flash VisionDS4VDeepSeek-V4-Flash-Vision-Exp-mmproj-BF16.ggufHIPStrix Halo 独享或 R9700 Strix Halo第 3 步带上--mmproj启动服务器以 Qwen3.8-27B DFlash2 推测解码为例R9700 上实测./server/build-hip/luce_server models/Qwen3.8-27B-IQ4_XS-pure.gguf \ --target-device hip:0 \ --draft models/Qwen3.8-27B-DFlash2-Q8_0.gguf --draft-device hip:0 \ --draft-block-size 16 --max-ctx 32768 \ --cache-type-k q8_0 --cache-type-v q8_0 \ --mmproj models/Qwen3.8-27B-mmproj-Q8_0.gguf \ --port 8216关键只有一个参数--mmproj 投影器文件。图片请求峰值约需 21 GiB 显存文字与图片请求都能走 DFlash2 推测解码。发送第一个图片问题OpenAI 兼容 APILucebox 提供标准 OpenAI Chat Completions 接口图片以 base64 data URL 形式放在 user 消息的内容数组里按展示顺序排列文字和图片片段即可IMG$(base64 chart.png | tr -d \n) curl -s http://127.0.0.1:8216/v1/chat/completions \ -H Content-Type: application/json \ -d {messages:[{role:user,content:[ {type:text,text:这张图表展示了什么}, {type:image_url,image_url:{url:data:image/png;base64,$IMG}}]}], max_tokens:256}图片请求的限制详见 docs/image-input.md✅ 仅支持 base64 的JPEG / PNGdata URL✅ 单请求最多16 张图单张编码后 ≤ 16 MiB合计 ≤ 32 MiB❌ 不支持远程图片 URL图片也只能放在 user 消息里验证视觉能力检查 /props 端点投影器加载成功后GET /props会返回capabilities.image_input_supported: true。这是部署自检最快的方式curl -s http://127.0.0.1:8216/props | grep image_input_supported在 Docker 镜像中运行时把容器内的投影器路径写入环境变量LUCE_MMPROJ即可。/props端点的设计细节见 docs/specs/props-endpoint.md。进阶技巧双 GPU 分离图片编码快近 2 倍DS4V 有一个很实用的布局模型留在 Strix Halo图片编码器放到 R9700 上运行只需加一个参数--mmproj-device hip:0。编码器每完成一张图就立即流入 prefill主 GPU 永不空等图片数量提示词 token 数编码器在 Strix Halo编码器在 R970011262.97 s2.94 s494211.2 s9.1 s164,35851.8 s34.6 s图片越多收益越大且两种布局的答案完全一致。真实成绩Lucebox 回答图片问题有多快官方在 AI2D 和 ChartQA 各 100/60 道题上做了实测数据来自 docs/image-input.mdQwen3.8-27BR9700AI2D 90/100ChartQA 56/60图片 prompt 平均 prefill 仅 0.56 s带推测解码后单张图片回答76 tok/s4.0 s/答案比 llama.cpp 同配置快 1.21×~1.58×DS4VStrix HaloAI2D 85/100ChartQA 55/60单图 prefill 约 4 s带 DSpark drafter 解码 30 tok/s并发场景Qwen 在 R9700 上 4 路并发的 256-token 图片回答共 6.9 s 完成149 tok/s 合计串行则需要 13.3 s另外值得注意投影器只额外占用约 0.9 GiB 显存不加载投影器时文本请求与原版逐字节一致、速度相同——视觉能力是纯增量不拖累文字推理。常见问题 FAQQ1不加--mmproj能发图片吗不能。没有投影器时文字服务路径完全不变图片输入能力不存在。Q2为什么图片请求不走前缀缓存因为光看 token 无法唯一标识一张图片所以图片请求会绕过 token 前缀缓存、磁盘缓存和提示词压缩每次真实编码。Q3DS4V 的 mmproj 可以自己导出吗可以。仓库自带导出工具 server/tools/export_ds4v_mmproj.py纯标准库实现从官方视觉模型中提取 vision tower 和 aligner逐字节保真详见 docs/ds4v-mmproj.md。Q4哪些部署方式不支持图片跨 GPU 分层/张量拆分、远端 target shard、上游转发都不支持图片。Qwen 和 DS4V 都支持并发图片请求--paged-attention --max-concurrency N多用户同时提问也能批处理。Q5Qwen 的图片会消耗多少 token图片按训练规则缩放到 32 像素整数倍后每 32×32 像素算 1 个 token64~1024 之间更大图会被缩小到上限。延伸阅读 图片输入完整指南docs/image-input.md DS4V 视觉投影器导出docs/ds4v-mmproj.md 服务器 API 参考server/docs/API.md 推荐模型与硬件配置server/docs/RECOMMENDED_SETUPS.md 服务器参数手册server/README.md一句话总结--mmproj一个参数消费级硬件上就有了一个私有、免费、不联网的 LLM 视觉问答服务——这正是 Lucebox 把本地 AI 作为默认选项的意义。【免费下载链接】luceboxLLM speculative inference server for heterogeneous hardware consumer GPUs项目地址: https://gitcode.com/gh_mirrors/lu/lucebox创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表