
文章主要内容与创新点总结一、主要内容该研究通过系统文献综述和元分析,探究大型语言模型(LLMs)与人类在说服效果上的差异及影响因素。研究严格筛选出7项符合标准的研究(含12个效应量估计值,共17,422名参与者,主要来自英语国家),采用Hedges’g计算标准化效应量,结合随机效应模型和调节变量分析得出核心结论:整体说服效果无显著差异:LLMs与人类的整体说服表现无统计学显著差异(g=0.02,p=.530),但研究间异质性极高(I²=75.97%),表明说服效果受情境因素强烈影响。单一调节变量影响不显著:单独分析LLM模型类型(如GPT-3.x、GPT-4.x、Claude 3.x)、对话设计(一次性消息vs交互式对话)、应用领域(政治、健康、其他)等变量时,均未呈现统计学显著的调节作用,推测与研究数量有限导致统计效力不足有关。联合调节模型解释力强:将上述因素纳入联合模型后,可解释81.93%的研究间变异,且剩余异质性显著降低(I²=35.51%)。其中,交互式设计比一次性消息更具说服力,GPT-4.x优于Claude 3.x,健康领域的说服效果优于政治领域,GPT-3.x在控制其他变量后反而比GPT-4.x表现更优。时间趋势与偏倚检验:累积元分析显示,2021-2022年早期研究倾向于LLM说服效果略逊于人类,2024-2025年近期研究则趋向于无差异且略偏向LLM;Egger检验提示潜在小样本效应,但修剪填充法未发现缺失研究, p