ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

SageLM: A Multi-aspect and Explainable Large Language Model for Speech Judgement

SageLM: A Multi-aspect and Explainable Large Language Model for Speech Judgement SageLM相关总结与翻译一、文章主要内容本文聚焦语音到语音(S2S)大型语言模型(LLMs)的评估难题,提出了端到端、多维度且可解释的语音评估模型SageLM。首先,阐述当前S2S模型评估存在的两大核心问题:一是主流的级联式评估方法(先通过自动语音识别(ASR)将语音转文字,再用文本LLM评估)会受ASR错误传播影响,且完全忽略声学特征,无法评估语气、情感等维度;二是人工评估虽为黄金标准,但成本高、速度慢,难以满足大规模模型迭代需求。接着,为解决这些问题,作者构建了包含324,774个样本的大型多维度语音偏好数据集SpeechFeedback,涵盖语义相关性和声学质量标注。同时,提出两阶段训练范式:第一阶段利用SpeechFeedback中丰富的语义偏好数据,训练SageLM在真实性、诚实性、有用性和指令遵循四个语义维度评估,并生成带解释的结构化比较结果;第二阶段融入有限声学偏好数据,新增语音指令遵循维度(评估合成语音是否符合情感、性别等声学属性要求)。在训练方法上,通过实验对比强化学习(GRPO)与带推理依据的监督微调(SFT),发现后者能让模型在预测评估结果的同时进行合理推理,避免奖励黑客行为,且推理依据与评估结果一致性更高,因此SageLM两阶段训练均采用该方法。最后,实验验证表明,SageLM与人类评估者的一致性达82.79%,较级联基线(如Whisper + GPT-4o)和基于语音到文本(S2T)LLM的基线分别至少高出7.42%和26.20%,在语义和声学多维度评估中均表现出色,还具备位置一致性强、对不同长度语音响应适应性较好等优势,且在未见过的数据集和真实S2S模型
返回列表