
阿里达摩院开源的 SenseVoice一个模型把语音识别、情感识别、语种识别、事件检测全包了而且比 Whisper 快 5 倍。中文识别比 Whisper 准粤语场景优势更明显还能听出说话人情绪和背景声音。速度碾压 Whisper中文准确度还更高SenseVoiceSmall 采用非自回归端到端架构参数量跟 Whisper-Small 差不多推理速度是它的 5 倍以上是 Whisper-Large 的 15 倍。在 AISHELL-1、AISHELL-2、Wenetspeech 等中文基准上识别准确率全面领先 Whisper。一个模型顶四个大多数 ASR 模型只做语音转文字。SenseVoice 在一个模型里同时输出语音识别中、粤、英、日、韩带标点带逆文本归一化情感识别7 种情绪——高兴、悲伤、愤怒、中性、恐惧、厌恶、惊讶事件检测8 种事件——音乐、掌声、笑声、哭声、咳嗽、喷嚏、呼吸、说话语种识别自动判断输入语言在不做任何目标数据微调的前提下SenseVoice 的情感识别效果就达到了甚至超过了当前最好的专用情感识别模型。录一段会议录音不仅能拿到逐字稿还能知道哪句话是开心的、哪段有人在鼓掌、背景有没有音乐。这种富文本转录对内容创作、客服质检、会议纪要这些场景很实用。AIGCPanel 一键部署5 分钟跑起来模型再好部署折腾也白搭。SenseVoice 的 AIGCPanel 服务把流程简化到了几步打开 AIGCPanel导入 SenseVoice 模型服务系统自动下载 SenseVoiceSmall FSMN-VAD 两个模型总共不到 1GB填好音频地址选择语言等结果支持 GPU 推理自动检测 CUDA没有 GPU 自动降级 CPU机器有就行。还支持粤语、日语、韩语的自动识别做海外内容、多语言客服场景很合适。能力巡礼多语言语音识别中文、粤语、英文、日文、韩文自动语种识别情感识别7 种情绪标签无需微调音频事件检测掌声、笑声、咳嗽、音乐等 8 种事件长音频支持内置 VAD自动分段合并任意时长都能处理带标点输出逆文本归一化数字日期自动规整GPU/CPU 自动切换有 GPU 用 GPU没 GPU 用 CPU边缘端也能跑GGUF 量化版本仅 254MB无需 Python单二进制运行其他信息论文已公开arXiv:2407.04051技术细节透明MIT 开源协议模型权重可商用需遵守模型协议支持 FastAPI、Docker、llama.cpp边缘端、ONNX、LibTorch 多平台部署提供完整微调脚本方便业务定制在 AIGCPanel 上试试看SenseVoice 把语音识别这件事做到了一个新高度——听得准还能听出情绪、听出场景。如果你在做语音转写、内容审核、AI 语音助手这个模型可以放进工具箱试试。你在实际场景中遇到过哪些语音识别的翻车案例是方言识别不准还是长音频处理太慢说不定 SenseVoice 刚好能解决你的问题。