
文章主要内容总结研究背景:大型语言模型(LLMs)在代码生成基准测试(如HumanEval、LiveCodeBench)中表现显著,但现有评估套件的测试用例数量有限且同质化,导致细微错误未被检测,夸大了模型性能,影响强化学习中可验证奖励(RLVR)的准确性。核心问题:现有测试用例存在两大挑战——测试用例同质化与LLM中心偏见(仅关注LLM类错误,忽视人类多样错误);验证器无效性与持续盲点(难以检测人类类错误,导致奖励黑客问题)。解决方案:提出多维评估指标(检测率、验证器准确率等),量化测试套件的全面性。构建TCGBench基准,整合Atcoder、Codeforces、Nowcoder的编程问题,支持TCG方法的全面评估。提出SAGA(人机协作框架),结合人类编程知识与LLM推理能力,提升测试用例的覆盖率和质量。实验结果:SAGA在TCGBench上的检测率达90.62%,验证器准确率达32.58%;其生成的评估基准验证器准确率比LiveCodeBench-v6高10.78%。此外,基于SAGA开发了CodeCompass基准和TCGCoder-7B模型。研究意义:为可靠的LLM代码评估奠定基础,推动RLVR在代码生成中的应用,为自动化对抗性测试合成和自适应基准集成铺路。文章