1、12026年1月Agent时代下的代码评测范式革新时代下的代码评测范式革新面向未来的Code Agent评测美团M17&AGI-Eval 朱耀明AGI-Eval2AGI-Eval Agent时代的到来 Coding is Important 评测范式的挑战与转变 评测范式一:通过率导向-群体竞赛导向 评测范式二:人类作为评测生产者-agent作为评测生产者Agent时代下的代码评测范式革新时代下的代码评测范式革新3AGI-EvalCoding is ImportantRef:Anthropic Economic Index report:Uneven geographic and enterp
2、rise AI adoption4AGI-Eval现行代码评测范式的挑战 传统的评测方向1:更难的题目 HumanEval-LiveCodeBench-OIBench5AGI-Eval现行代码评测范式的挑战 传统的评测方向1:更难的题目 HumanEval-LiveCodeBench-OIBench6AGI-Eval现行代码评测范式的挑战 传统的评测方向1:更难的题目 HumanEval-LiveCodeBench-OIBench7AGI-Eval现行代码评测范式的挑战 挑战1:LLM的能力增长快于人类Ref:Measuring AI Ability to Complete Long Task
3、s (METR)8AGI-Eval现行代码评测范式的挑战 挑战1:Code Agent的能力增长更快!Ref:Measuring AI Ability to Complete Long Tasks9AGI-Eval现行代码评测范式的挑战 挑战1:LLM的能力增长快于人类Ref:Measuring AI Ability to Complete Long Tasks 10AGI-Eval现行代码评测范式的挑战 传统的评测方向2:使用互联网数据+规则来合成Ref:SWE-bench:Can Language Models Resolve Real-world Github Issues?11AGI-
4、Eval现行代码评测范式的挑战 挑战2:需要更加贴合现实的场景的代码开发Ref:Introducing SWE-bench Verified12AGI-Eval现行代码评测范式的挑战 挑战2:需要更加贴合现实的场景的代码开发Ref:CoreCodeBench:A Configurable Multi-Scenario Repository-Level Benchmark13AGI-Eval现行代码评测范式的挑战 挑战2:Agent时代需要更加贴合现实的场景的代码开发(Video)Code with Claude Opening Keynote14AGI-Eval范式一:通过率导向-群体竞赛导向
5、 Code Agent Tournament Arena 抛弃传统的分数赛制,改为对战排名Code Agent在统一的环境下开发并对战首选:棋牌类游戏高竞技性、高可验证性。CATArena:让Code Agent在对战中学习Ref:CATArena:Evaluation of LLM Agents through Iterative Tournament Competitions15AGI-Eval范式一:通过率导向-群体竞赛导向 Code Agent Tournament Arena 抛弃传统的分数赛制,改为对战排名Code Agent在统一的环境下开发并对战首选:棋牌类游戏高竞技性、高可验
6、证性。*和LLM直接对战有区别CATArena:让Code Agent在对战中学习16AGI-Eval范式一:通过率导向-群体竞赛导向 Code Agent Tournament Arena 在对战完成后,学习彼此的代码来提升自己 理想:学习策略来达成群体进化*新增算法代码和工程代码优化CATArena:让Code Agent在对战中学习17AGI-Eval范式一:通过率导向-群体竞赛导向 对战能力和学习能力 对战能力:每个Agent能在首次开发中战胜多少对手 学习能力:Agent多轮迭代后能否持续提升CATArena:让Code Agent在对战中学习18AGI-Eval范式一:通过率导向-