ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Automated Safety Evaluations Across 20 Large Language Models: The Aymara LLM Risk and Responsibil...

Automated Safety Evaluations Across 20 Large Language Models: The Aymara LLM Risk and Responsibil... 文章主要内容和创新点主要内容本文介绍了一个名为Aymara AI的程序化平台,旨在为大型语言模型(LLMs)提供可扩展、严格且基于政策的安全评估。该平台能将自然语言安全政策转化为对抗性提示,并通过经人类判断验证的AI评分器对模型响应进行评分。研究通过“艾马拉大语言模型风险与责任矩阵(Aymara LLM Risk and Responsibility Matrix)”,对20个商用LLM在10个真实世界安全领域(如虚假信息、仇恨言论、隐私与 impersonation 等)的表现进行了评估。结果显示:模型安全得分差异显著,均值范围为86.2%至52.4%;在成熟安全领域(如虚假信息,均值95.7%)表现较好,但在复杂或定义模糊的领域(如隐私与 impersonation,均值24.3%)普遍表现不佳;方差分析证实,模型间和领域间的安全得分存在显著差异(p0.05)。研究还指出了现有AI安全评估工具的局限性(如静态、英语中心、模态单一等),并强调Aymara AI这类可定制、多语言、多模态工具对负责任AI开发的必要性。创新点提出Aymara AI平台:首个可程序化生成对抗性提示、支持定制化政策评估的工具,无需手动构建数据集,且支持多语言和多模态评估。全面基准测试:首次对20个商用LLM在10个真实安全领域进行系统评估,揭示了模型安
返回列表