当前位置:首页 > 报告详情

朱耀明-Agent评测.pdf

上传人: 表表 编号:1279994 2026-07-18 37页 6.59MB

1、12026年1月Agent时代下的代码评测范式革新时代下的代码评测范式革新面向未来的Code Agent评测美团M17&AGI-Eval 朱耀明AGI-Eval2AGI-Eval Agent时代的到来 Coding is Important 评测范式的挑战与转变 评测范式一:通过率导向-群体竞赛导向 评测范式二:人类作为评测生产者-agent作为评测生产者Agent时代下的代码评测范式革新时代下的代码评测范式革新3AGI-EvalCoding is ImportantRef:Anthropic Economic Index report:Uneven geographic and enterp

2、rise AI adoption4AGI-Eval现行代码评测范式的挑战 传统的评测方向1:更难的题目 HumanEval-LiveCodeBench-OIBench5AGI-Eval现行代码评测范式的挑战 传统的评测方向1:更难的题目 HumanEval-LiveCodeBench-OIBench6AGI-Eval现行代码评测范式的挑战 传统的评测方向1:更难的题目 HumanEval-LiveCodeBench-OIBench7AGI-Eval现行代码评测范式的挑战 挑战1:LLM的能力增长快于人类Ref:Measuring AI Ability to Complete Long Task

3、s (METR)8AGI-Eval现行代码评测范式的挑战 挑战1:Code Agent的能力增长更快!Ref:Measuring AI Ability to Complete Long Tasks9AGI-Eval现行代码评测范式的挑战 挑战1:LLM的能力增长快于人类Ref:Measuring AI Ability to Complete Long Tasks 10AGI-Eval现行代码评测范式的挑战 传统的评测方向2:使用互联网数据+规则来合成Ref:SWE-bench:Can Language Models Resolve Real-world Github Issues?11AGI-

4、Eval现行代码评测范式的挑战 挑战2:需要更加贴合现实的场景的代码开发Ref:Introducing SWE-bench Verified12AGI-Eval现行代码评测范式的挑战 挑战2:需要更加贴合现实的场景的代码开发Ref:CoreCodeBench:A Configurable Multi-Scenario Repository-Level Benchmark13AGI-Eval现行代码评测范式的挑战 挑战2:Agent时代需要更加贴合现实的场景的代码开发(Video)Code with Claude Opening Keynote14AGI-Eval范式一:通过率导向-群体竞赛导向

5、 Code Agent Tournament Arena 抛弃传统的分数赛制,改为对战排名Code Agent在统一的环境下开发并对战首选:棋牌类游戏高竞技性、高可验证性。CATArena:让Code Agent在对战中学习Ref:CATArena:Evaluation of LLM Agents through Iterative Tournament Competitions15AGI-Eval范式一:通过率导向-群体竞赛导向 Code Agent Tournament Arena 抛弃传统的分数赛制,改为对战排名Code Agent在统一的环境下开发并对战首选:棋牌类游戏高竞技性、高可验

6、证性。*和LLM直接对战有区别CATArena:让Code Agent在对战中学习16AGI-Eval范式一:通过率导向-群体竞赛导向 Code Agent Tournament Arena 在对战完成后,学习彼此的代码来提升自己 理想:学习策略来达成群体进化*新增算法代码和工程代码优化CATArena:让Code Agent在对战中学习17AGI-Eval范式一:通过率导向-群体竞赛导向 对战能力和学习能力 对战能力:每个Agent能在首次开发中战胜多少对手 学习能力:Agent多轮迭代后能否持续提升CATArena:让Code Agent在对战中学习18AGI-Eval范式一:通过率导向-

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
1. **评测范式革新**:传统通过率导向转向群体竞赛导向(Code Agent Tournament Arena),采用对战排名制,首选棋牌类游戏(高竞技性、可验证性)。 2. **核心挑战**:LLM/Code Agent能力增长快于人类,需更贴合现实的场景(如LiveCodeBench→OIBench)。 3. **CATArena实践**: - 对战能力:Claude在多数游戏领先,商用Agent更强,复杂游戏(如国际象棋)区分度更高。 - 学习能力:当前Agent难以有效学习他人代码,简单游戏“抄袭”,复杂游戏“复制参数”。 4. **PRDBench新范式**:以Agent为评测核心,人类兜底,基于功能验收(Unit Test/Shell交互/文件对比),基础LLM能力决定性能上限。 5. **结论**:需贴近现实任务,Agent竞争学习+反馈排名,人辅助评测。
**Agent如何进化?** (聚焦Code Agent在对战中的学习机制与群体进化潜力,吸引关注AI技术迭代的开发者) **评测新范式?** (突出从通过率到群体竞赛、人类到Agent的评测转变,引发对AI评测标准变革的讨论) **现实场景挑战?** (强调贴合真实开发的评测需求,吸引关注AI落地应用的从业者)
客服
商务合作
小程序
服务号
折叠