ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

让Clef拥有眼睛:图片与视频多模态输入完整指南,从收据识别到视频帧决策

让Clef拥有眼睛:图片与视频多模态输入完整指南,从收据识别到视频帧决策 让Clef拥有眼睛图片与视频多模态输入完整指南从收据识别到视频帧决策【免费下载链接】clef项目地址: https://ai.gitcode.com/hf_mirrors/Cloudflare/clefClef 是 Cloudflare 发布的 27B 多模态决策模型它能把图片、视频、文本和 JSON 统一当作状态来读取在一次前向传播中直接输出每个问题的各选项概率——不生成自由文本也无需解析输出。本指南带你从收据识别到视频帧决策快速给 Clef装上眼睛。 Clef 如何看见图片与视频Clef 的多模态能力来自内置在主干里的视觉编码器vision encoder模型配置文件 config.json 中可以找到它的完整定义vision_config段27 层视觉块、patch 大小 16、时间 patch 为 2。它的工作方式可以理解为三步占位记录里每加一张图片就插入一个 图像占位符每加一段视频就插入一个 视频占位符见 joint_schema_model.py 中的IMAGE_PLACEHOLDER与VIDEO_PLACEHOLDER。编码processor_config.json 中定义的图片处理器会把图像切成 16×16 的小块并做归一化视频处理器默认按2 fps 抽帧帧数介于 4 到 768 之间。决策视觉 token 与文本 token 一起送入主干再由小型联合 schema 头joint_head.safetensors配置见 joint_head_config.json把证据路由到每个问题对全部选项联合打分输出概率。 关键点Clef 的输出永远是每个选项一个概率所以它天然适合票据审核、路由分派、异常判断这类结构化决策场景而不是聊天式回答。⚡ 三步启用多模态输入最快配置方法环境要求torch2.11 transformers5.10.2图片/视频输入还需安装pillow。第 1 步加载模型和处理器用load_release_model一次性加载主干、联合头和图像/视频处理器processor它正是图片与视频编码的入口。model, processor load_release_model(path, devicecuda)第 2 步在记录里加images或videos多模态输入只需要在记录里多填一个字段并把 processor 传给encode_record。record { state: {task: Review the attached receipt.}, images: [Image.open(receipt.jpg)], # PIL 图片 # videos: [frames_array], # 视频帧数组二选一或同时提供 questions: { legible: {type: noul, instructions: Is the receipt total legible?}, }, } encoded encode_record(processor.tokenizer, record, processorprocessor)第 3 步单次前向推理拿到决策概率跑一次model(batch)对每个问题的 logits 做 softmax就能得到各选项的概率如legible问题下是/否的概率直接按概率最大的选项做决策。 实战场景用收据图片做票据审核这是多模态输入最典型的用例——把一张收据照片交给 Clef同时问多个类型的问题一次拿全答案问题字段类型示例legiblenoul是/否收据总额是否清晰可辨statuschoice命名选项票据状态paid / overdue / draftlargenoul总额是否超过 1000 USDstate可以同时包含 JSON 数据如供应商、金额和一张图片Clef 会把两者联合起来理解。文本记录和多模态记录也可以在同一个 batch 中混排批量处理很灵活。 视频帧决策把视频交给 Clefvideos字段接收视频帧数组列表视频处理器会自动完成抽帧、缩放与归一化参数均在 processor_config.json 的video_processor段fps: 2—— 默认每秒取 2 帧min_frames: 4/max_frames: 768—— 帧数下限与上限temporal_patch_size: 2—— 相邻 2 帧合并为 1 个时间块兼顾时序信息适合场景监控视频里是否有人靠近闸机、录屏中页面是否出现报错、流水线视频中零件是否缺件等基于画面演变的判断。视频每段对应一个 占位符可一次传入多段。️ 多模态输入实用技巧清单控制图片分辨率图像处理器允许通过media_kwargs传入额外参数如size在看清细节和省 token之间取平衡。注意长度预算encode_record默认上限 16,384 tokenjoint_schema_model.py图片、视频、长文本共用预算超长state会被截断可用max_state_tokens显式限制文本部分。混合批处理同一 batch 里可以既有纯文本文档、又有带图记录调度更省心。API 一体化systemone接口兼容 Jev/SystemOne 请求体请求中同样支持images与videos字段返回值按问题 ID 给出选项、置信度和概率joint_schema_model.py。对话模板已适配chat_template.jinja 会自动为图片/视频消息插入编号占位符走标准聊天接口时也能带上多模态内容。 相关文件速查文件作用joint_schema_model.py记录编码、批处理、模型加载与systemoneAPIprocessor_config.json图片/视频处理器参数抽帧、缩放、归一化config.json主干与视觉编码器结构定义joint_head_config.json联合 schema 头结构2 层证据路由 4 层 transformerjoint_head.safetensors联合 schema 头权重chat_template.jinja支持图像/视频占位的对话模板README.md完整使用说明与基准成绩一句话总结给 Clef 装上眼睛只需要两个字段——images和videos。从一张收据到一段视频它都会把看到的直接变成每个选项的概率让多模态决策又快又稳。【免费下载链接】clef项目地址: https://ai.gitcode.com/hf_mirrors/Cloudflare/clef创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表