ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Day10:多模态能力地图与商业化路径(收官篇)

Day10:多模态能力地图与商业化路径(收官篇) 作者梅雅达编程笔记这是多模态栏的最后一篇。用一张表回顾 Day01~Day09 的全部技能点写一个把抠图、语音合成、语音识别、LLM 整合到一起的多模态 Agent再梳理这套技术栈在 2026 年的典型应用场景和进阶方向。最后做 6 栏 92 篇的总回顾。学了这么多到底能干嘛前几天有个读者私信我“Mable老师你 10 篇我都跟完了代码也跑通了。但说实话我不知道这些东西拼在一起能干什么。单独拎出来抠图就是抠图TTS 就是 TTS……怎么变成一个能解决实际问题的工具”这个问题问得挺好。单点能力不值钱组合能力才值钱。电商卖家不会说帮我抠个图他会说我淘宝店 500 个 SKU主图背景太乱帮我全换成白底的顺便把商品描述也写一下。教培机构不会说帮我做语音合成他会说我想搞个 AI 客服用户打电话进来能自动应答声音要好听。知识博主不会说帮我做视频字幕他会说我有一堆教学视频帮我加上字幕再出个文字版讲义。每一个实际需求都是多项能力的组合。这篇就是把散落的珠子串成项链。全栏知识图谱十篇技能全景图先把 Day01~Day09 干了什么摊开看篇章主题核心工具学到了什么应用场景Day01AI 抠图rembg, Pillow背景移除、批量处理、Alpha 通道电商白底图、证件照Day02AI P图与增强Real-ESRGAN, inpainting超分辨率、去水印、风格迁移老照片修复、商品美化Day03AI 营销素材CogView-4, SD, Prompt文生图、Prompt 工程、模型路由海报、Banner、广告图Day04AI 语音合成Edge-TTS, SSMLTTS 合成、音色选择、SSML 控制客服语音通知、有声内容Day05AI 语音识别WhisperASR 转写、实时识别、说话人分离语音工单、会议记录Day06声音克隆Fish-Speech, GPT-SoVITS声音克隆、情感控制、语音对话品牌专属语音客服Day07AI 视频字幕Whisper FFmpeg音轨提取、SRT 字幕、多语言翻译教学视频字幕Day08AI 视频摘要关键帧 LLM场景检测、语音转写、结构化摘要课程精华笔记Day09小红书图文GLM CogView Pillow文案生成、封面设计、自动排版内容矩阵自动化能力分层三大模块 一个整合层把上面的表再抽象一层┌─────────────────────────────────────────────┐ │ 多模态 Agent 整合层 │ │ LLM 调度 管道编排 输出管理 │ ├──────────┬──────────────┬───────────────────┤ │ 图像模块 │ 语音模块 │ 视频模块 │ ├──────────┼──────────────┼───────────────────┤ │ 抠图 │ 语音合成(TTS) │ 字幕生成 │ │ 增强 │ 语音识别(ASR) │ 视频摘要 │ │ 生成 │ 声音克隆 │ 关键帧提取 │ │ 排版 │ 对话管理 │ 音轨处理 │ └──────────┴──────────────┴───────────────────┘底层三列是 Day01~Day08 的单项能力顶层是 Day09 和 Day10 要做的——把这些能力通过 LLM 调度起来变成一个能理解复杂指令的 Agent。2026 多模态能力地图你需要掌握的核心技能站在 2026 年的节点上多模态 AI 的工具链已经相当成熟。我把值得投入时间掌握的技能和工具整理成了一份地图Tier 1 · 必会核心工具技能推荐工具理由图像抠图/分割rembg / SAM2开源效果够用图像生成CogView-4 / Flux / SD3API 本地部署两条路线语音合成Edge-TTS / Fish-Speech基础方案够用进阶用开源语音识别Whisper large-v3开源标杆多语言准确率高LLM 文本生成GLM-4.7-Flash / Qwen3长上下文中文能力强Tier 2 · 加分拉开差距的技能推荐工具理由视频处理FFmpeg MoviePy字幕/剪辑/转码的基础声音克隆Fish-Speech / GPT-SoVITS品牌化语音的杀手锏图像增强Real-ESRGAN老照片/低质图片修复Prompt 工程各模型的最佳实践直接决定生成质量Tier 3 · 前沿关注即可技能推荐工具理由模型路由Runway Media Router自动选择最优模型AI 视频生成Runway Gen-3 / 可灵还在快速迭代中多模态大模型GPT-4o / Gemini 2.5看图说话、看图写代码你不需要全部掌握。Tier 1 吃透就能解决大部分实际问题Tier 2 学会能应对更复杂的需求Tier 3 了解能跟上技术趋势。动手实战多模态 Agent 整合示例说了这么多整合来个真的。下面这个 Agent 能做这么一件事你给它一张商品图片 一段语音指令它能听懂你说了什么语音识别看懂图片是什么抠图 视觉理解根据你的指令生成商品文案LLM把文案读出来语音合成生成一张带文案的营销图图像生成 排版整个流程全自动你只管说话。安装依赖pipinstallrembg edge-tts pillow openai跟前面几篇一样依赖都是开源或公开可用的工具。完整代码 Day10 · 多模态 Agent 整合示例 功能图片 语音 → 自动抠图 → LLM 生成文案 → TTS 语音播报 → 营销图 importosimportasyncioimporttempfilefrompathlibimportPathimportedge_ttsfromPILimportImage,ImageDraw,ImageFontfromrembgimportremove,new_sessionfromopenaiimportOpenAI# ─── 配置 ───────────────────────────────────────────# GLM API智谱 AI 开放平台申请clientOpenAI(api_keyos.getenv(GLM_API_KEY,your-api-key-here),base_urlhttps://open.bigmodel.cn/api/paas/v4/)# 抠图模型预加载rembg_sessionnew_session(u2net)# TTS 音色TTS_VOICEzh-CN-XiaoxiaoNeural# 晓晓女声自然# ─── 第一步语音识别Whisper ────────────────────deftranscribe_voice(audio_path:str)-str:语音 → 文字把用户的语音指令转成文本# 实际项目中用 Whisper 本地模型# from transformers import pipeline# whisper pipeline(automatic-speech-recognition, modelopenai/whisper-large-v3)# result whisper(audio_path)# return result[text]# 这里用 GLM 的语音理解 API 做演示withopen(audio_path,rb)asf:responseclient.chat.completions.create(modelglm-4v-flash,messages[{role:user,content:[{type:audio,audio:f.read()},{type:text,text:请转写这段语音的内容}]}])returnresponse.choices[0].message.content# ─── 第二步图像抠图 ──────────────────────────────defcutout_image(input_path:str,output_path:str)-Image.Image:去除图片背景返回透明 PNGimgImage.open(input_path).convert(RGB)resultremove(img,sessionrembg_session)result.save(output_path)returnresult# ─── 第三步LLM 生成文案 ──────────────────────────defgenerate_copy(product_name:str,style:str电商)-str:根据产品信息生成营销文案promptf你是一个资深文案。请为以下商品写一段{style}风格的营销文案 商品{product_name}要求 1. 50字以内 2. 突出卖点有画面感 3. 适合小红书/电商详情页 responseclient.chat.completions.create(modelglm-4-7b-flash,messages[{role:user,content:prompt}])returnresponse.choices[0].message.content# ─── 第四步语音合成 ──────────────────────────────asyncdeftext_to_speech(text:str,output_path:str):文字 → 语音把文案读出来communicateedge_tts.Communicate(text,TTS_VOICE)awaitcommunicate.save(output_path)# ─── 第五步生成营销图 ────────────────────────────defcreate_marketing_image(product_img:Image.Image,copy_text:str,output_path:str,size:tuple(800,800)):将抠好的商品图 文案合成一张营销图# 创建画布渐变背景色canvasImage.new(RGB,size,#F5E6D3)drawImageDraw.Draw(canvas)# 粘贴商品图居中偏上product_resizedproduct_img.resize((500,500))canvas.paste(product_resized,(150,50),product_resized)# 写文案底部—— 注意必须用中文字体否则中文会显示成方框# Windows 用 simhei.ttfmacOS 用 PingFang.ttcLinux 用 NotoSansCJKfont_paths[C:/Windows/Fonts/simhei.ttf,/System/Library/Fonts/PingFang.ttc,/usr/share/fonts/opentype/noto/NotoSansCJK-Regular.ttc,]found_fontNoneforfpinfont_paths:ifos.path.exists(fp):found_fontfpbreakiffound_font:fontImageFont.truetype(found_font,32)else:fontImageFont.load_default()print(警告未找到中文字体文案可能显示为方框)# 自动换行wordscopy_text bboxdraw.textbbox((0,0),words,fontfont)text_widthbbox[2]-bbox[0]x(size[0]-text_width)//2y600draw.text((x,y),words,fill#333333,fontfont)# 加品牌水印复用同一个中文字体字号小一点small_fontImageFont.truetype(found_font,14)iffound_fontelseImageFont.load_default()draw.text((20,size[1]-30),© 梅雅达工作室,fill#999999,fontsmall_font)canvas.save(output_path)print(f营销图已保存:{output_path})# ─── 主管道串联所有能力 ──────────────────────────asyncdefmultimodal_agent(image_path:str,audio_path:strNone,style:str电商): 多模态 Agent 主管道 输入商品图片 语音指令可选 输出抠图结果 文案 语音 营销图 work_dirPath(./agent_output)work_dir.mkdir(exist_okTrue)print(多模态 Agent 启动...)print(*50)# Step 1: 语音识别如果有语音输入instruction请为这个商品生成营销文案ifaudio_pathandos.path.exists(audio_path):print(Step 1/5: 识别语音指令...)instructiontranscribe_voice(audio_path)print(f → 识别结果:{instruction})else:print(Step 1/5: 无语音输入使用默认指令)# Step 2: 抠图print(Step 2/5: AI 抠图...)cutout_pathstr(work_dir/cutout.png)product_imgcutout_image(image_path,cutout_path)print(f → 抠图完成:{cutout_path})# Step 3: LLM 生成文案print(Step 3/5: 生成营销文案...)# 这里简化处理实际可以结合视觉理解 API 自动识别商品copy_textgenerate_copy(商品,style)print(f → 文案:{copy_text})# Step 4: 语音合成print(Step 4/5: 语音合成...)tts_pathstr(work_dir/narration.mp3)awaittext_to_speech(copy_text,tts_path)print(f → 语音已保存:{tts_path})# Step 5: 合成营销图print(Step 5/5: 生成营销图...)marketing_pathstr(work_dir/marketing.png)create_marketing_image(product_img,copy_text,marketing_path)print(*50)print(全部完成输出文件)print(f 抠图结果:{cutout_path})print(f 营销文案:{copy_text})print(f 语音播报:{tts_path})print(f 营销海报:{marketing_path})return{cutout:cutout_path,copy:copy_text,audio:tts_path,marketing:marketing_path}# ─── 运行 ─────────────────────────────────────────if__name____main__:# 示例给一张商品图自动生成全套营销素材asyncio.run(multimodal_agent(image_pathproduct.jpg,# 替换为你的商品图audio_pathNone,# 可选传入语音指令 .wav/.mp3style电商))运行结果配好GLM_API_KEY后在 Day10 目录放一张product.jpg商品图直接执行python day10_multimodal_agent.py这次是真实调用智谱 APIrembg 完成抠图LLM 生成营销文案Edge-TTS 合成语音Pillow 排版出海报四件套全部落地到agent_output/抠图、文案、语音、海报再实测语音路径用 edge-tts 合成一段中文指令test_voice.wav“你好这是一个多模态智能体的语音输入测试请帮我分析这张产品图片并生成宣传海报”把audio_path传进multimodal_agent完整跑一遍语音识别 → 抠图 → 文案 → 语音播报 → 海报注意一个实测细节代码里transcribe_with_glm把音频二进制直接塞进{type: audio, audio: bytes}智谱的 OpenAI 兼容接口不认这种格式报Object of type bytes is not JSON serializable。语音识别改成 Day05 的 faster-whispersmall本地推理后一次通过识别出你好,这是一个多模态智能体的语音输入测试,请帮我分析这张产品图片,并生成宣传海报。后面每一步都是真实调用rembg 抠图、GLM-4-flash 生成文案、Edge-TTS 合成语音、Pillow 排版海报产物落在agent_output_voice/。注意上面代码里文案模型写的是glm-4-7b-flash这个模型名在当前智谱开放平台会返回模型不存在错误码 1211配套的day10_multimodal_agent.py已改为glm-4-flash并实测跑通。动手前先到智谱开放平台控制台确认当前可用模型名。代码结构拆解看看这个 Agent 做了什么输入图片语音 │ ▼ ┌──────────────┐ │ Step 1 │ Whisper 语音识别 → 理解指令 │ 语音识别 │ Day05 技能 └──────┬───────┘ ▼ ┌──────────────┐ │ Step 2 │ rembg 抠图 → 获取透明底商品图 │ AI 抠图 │ Day01 技能 └──────┬───────┘ ▼ ┌──────────────┐ │ Step 3 │ GLM-4.7-Flash → 生成营销文案 │ LLM 文案 │ Day03/09 技能 └──────┬───────┘ ▼ ┌──────────────┐ │ Step 4 │ Edge-TTS → 文案转语音 │ 语音合成 │ Day04 技能 └──────┬───────┘ ▼ ┌──────────────┐ │ Step 5 │ Pillow 排版 → 输出营销海报 │ 营销图合成 │ Day03/09 技能 └──────┬───────┘ ▼ 输出抠图文案语音海报5 个步骤5 项技能来自 Day01~Day09 的不同篇章。单独看每一段代码都不复杂但组合在一起就是一个能解决实际问题的多模态 Agent。用 AI 写 AI 的整合代码你可能注意到了上面这段代码本身就是用 AI 辅助写的。这不是套娃这是 2026 年的开发方式。写多模态 Agent 的正确姿势先把每个能力模块单独跑通Day01~Day09 已经帮你做了把各模块的核心函数丢给 AI让它帮你写整合管道你只需要关注业务逻辑——输入是什么、输出要什么、中间怎么串比如你可以直接跟 AI 说“我有一个抠图函数 remove_bg(image_path)一个 TTS 函数 generate_speech(text, output_path)一个 LLM 函数 generate_text(prompt)。帮我写一个 pipeline输入商品图片输出抠图结果 商品描述文案 语音播报。”AI 会帮你把胶水代码写好你只需要测试、调整、部署。这就是多模态全栈的真正含义不是每个模型都自己训练而是把现成的能力模块像乐高一样拼起来。这套技术栈能做什么四大应用方向把前面 10 篇的能力组合起来可以覆盖很多实际场景。我整理了四个典型方向每个方向都给出了需求拆解和技术方案。方向一营销素材批量生成客户类型需求技术方案电商卖家500 张 SKU 白底图rembg 批量抠图 统一模板排版教育公司招生海报 10 套CogView 生成 Pillow 排版自媒体日更小红书图文Day09 方案直接复用关键点批量处理的核心是模板化。把背景、字体、布局固定成模板然后批量替换商品图和文案。500 张图和 1 张图的代码几乎一样只是外层加个循环。方向二AI 语音交互方案客户类型需求技术方案小商家微信自动回复语音Edge-TTS 关键词匹配教培机构课程提醒语音通知TTS 批量生成 定时发送品牌方专属声音的客服声音克隆 对话 Agent关键点声音克隆是差异化利器。同样一个语音通知方案用默认音色和用克隆品牌代言人声音用户的感知价值完全不同。技术难度差不了多少但体验天差地别。方向三教学视频字幕与摘要客户类型需求技术方案知识博主视频加字幕Whisper FFmpeg企业培训视频变图文讲义Day07Day08 方案MCN多语言字幕Whisper LLM 翻译关键点效率是这类场景的核心。一个 60 分钟的教学视频Whisper 转写可能只要 10 分钟剩下的是校对和排版。流水线跑起来后边际成本极低。方向四内容矩阵自动化客户类型需求技术方案个人 IP日更公众号 小红书Day09 流水线企业号多平台内容分发批量生成 排版电商商品图文全案抠图 文案 海报关键点自动化的核心是可重复。一旦你的流水线跑通每月维护成本极低。难点在于第一次把流程调通——这也是本栏 10 篇在帮你做的事。从跟完教程到独立做项目路线图如果你是从 Day01 一路跟过来的你现在已经具备了做项目的基础能力。但能跑 Demo和能独立做完整项目之间还有一段路。路线图Week 1-2跑通全部 10 篇代码理解每个模块 ↓ Week 3-4做 2-3 个完整案例电商素材包/语音客服 Demo/视频字幕 ↓ Week 5-6把案例整理成作品集发到 GitHub 或技术社区 ↓ Week 7-8根据反馈优化流程尝试更复杂的组合 ↓ Month 3建立自己的工具链模板形成可复用的项目脚手架几个实用建议建一个 GitHub 仓库把你的多模态工具链整理好这就是你的技术简历每个项目都留案例经授权后积累作品集写自动化脚本减少重复劳动同样是抠图第一次你手动跑脚本第十次你应该有个一键批处理工具了保持学习关注本栏提到的前沿工具SAM2、Runway Gen-3、模型路由新能力 新的可能性参考链接本栏核心工具rembgAI 抠图Real-ESRGAN图像超分Edge-TTS语音合成Fish-Speech声音克隆Whisper语音识别智谱 AI 开放平台GLM 模型Runway Media Router模型路由6 栏矩阵总回顾多模态栏 10 篇到这里完结。把镜头拉远一点这其实是「AI Python 系列」第 6 栏的收官——也是整个系列 92 篇的一个节点。#专栏名称篇数核心技能状态01办公自动化20 篇Python 文件处理 Excel/Word/PDF 自动化 邮件 定时任务已完结02数据可视化15 篇Matplotlib Seaborn Plotly ECharts 数据分析已完结03爬虫实战15 篇Requests Scrapy Selenium 反爬 数据清洗已完结04Web 全栈20 篇Flask/FastAPI 前端 数据库 部署 小程序已完结05AI Agent15 篇LLM API RAG 知识库 Agent 框架 工作流已完结06AI 多模态10 篇抠图/生图/TTS/ASR/声音克隆/视频处理/内容矩阵已完结总计92 篇92 篇从最基础的文件处理一路写到多模态 Agent。这 6 栏不是孤立的——它们是一张网办公自动化 多模态 批量处理营销素材爬虫 数据可视化 竞品监控 数据报告Web 全栈 AI Agent 能对话的智能网站数据可视化 多模态 自动生成带图表的营销内容当你把这些技能组合起来你能做的事情远超任何单栏的范畴。收尾去年这个时候AI Python这个系列还只是脑子里的一个想法。当时就想Python 教程那么多AI 教程也那么多但把 Python 和 AI 真正结合起来、让普通人能用一套可落地的方案跑起来的教程好像没见到几个。于是就写了。92 篇每一篇背后都有完整可运行的代码、有真实的应用场景、有踩过的坑。有读者私信说跟着你的办公自动化栏我把公司的月报从 3 天缩短到了 2 小时——这种反馈就是继续写下去的理由。这套多模态技术栈不需要 GPU 集群不需要付费 API不需要博士学位。一台电脑跟着代码敲就能做出有用的东西。想做项目的从上面的四大方向里挑一个先做 2-3 个完整案例想继续学的把本栏 Tier 1 的工具都亲手跑一遍。梅雅达编程笔记只记录真实能落地的技术。本文为梅雅达编程笔记原创内容首发于 CSDN转载请注明出处。
返回列表