当前位置:首页 > 报告详情

2杨健-从代码大模型到通用代码智能体.pdf

上传人: 表表 编号:1280000 2026-07-18 40页 22.28MB

1、 从代码基础模型到代码智能体演 讲 者:杨 健北京航空航天大学汇报内容 代码智能体 代码基础模型 背景介绍研究背景:大模型代码能力发展历史 Jian Yang,etc.From Code Foundation Models to Agents and Applications:A Comprehensive Survey and Practical Guide to Code Intelligence.研究背景:大模型代码能力发展历史 Jian Yang,etc.From Code Foundation Models to Agents and Applications:A Comprehen

2、sive Survey and Practical Guide to Code Intelligence.汇报内容 代码智能体 代码基础模型 背景介绍可验证的强化学习可验证的强化学习可验证的强化学习可验证的强化学习代码大模型预训练缩放定律代码大模型的缩放定律(Scaling Law):首次系统研究了多编程语言代码预训练的缩放定律,通过1000多组实验验证了0.5B-32B代码大模型下不同编程语言的特性差异、跨语言迁移效应和最优数据分配策略,为训练有效的代码大模型提供先验不同编程语言的缩放定律跨语言协同增益矩阵预训练最优代码配比目标编程语言的预损失 由模型规模、语言特异的缩放指数,与不可约损失,

3、所决定,并由其他语言的训练数据 通过跨语言迁移系数 转化为有效数据量通用大模型的缩放定律无法拟合现有代码大模型需要代码大模型缩放定律,为训练代码基础模型提供参考模型系列与定位模型系列与定位核心特性核心特性性能亮点提供7B,14B,40B,40B-Loop 等多个参数规模,满足不同场景需求。其中40B-Loop为首个成功训练的大规模首个成功训练的大规模循环代码生成模型循环代码生成模型,专为复杂算法推理设计。Code-Flow Code-Flow 多阶段训练范式多阶段训练范式捕捉逻辑动态演化。预训练、中期训练(融入32k/128k长上下文推理轨迹)和后期训练(指令微调与推理优化)的多阶段精细优化。

4、全周期循环训练协议和梯度控制全周期循环训练协议和梯度控制,稳定BPTT过程,“Dense-to-Loop”技术解决 BPTT 不稳定性问题。在 SWE-bench Verified 等各项任务上达到业界领先各项任务上达到业界领先水平,尤其在软件工程和竞争性编程表现突出。40B-Loop版本收敛更快,具备 Over-thinking 能力,能够动态验证和优化代码逻辑,在复杂算法任务复杂算法任务上展现出超越静态模型的潜力上展现出超越静态模型的潜力。开源与社区贡献开源与社区贡献Github 开源仓库 LoopCoder 一周获得 1.2K1.2K StarStarHugging Face 模型 Lo

5、opCoder开源一周获得 42K42K下下载量载量40B-Loop 结构示意图独创的“Code-Flow”多阶段训练范式一览图模型性能一览图(各项任务均达到业界领先水平)循环代码大模型第一代:集成开发环境第二代:在线协作开发环境第三代:群智可信开发运行一体化复杂工业系统安全关键系统复杂系统智能软件系统系统精准建模模型驱动开发持续成长演化安全攸关精准建模复杂智能动态调整实时决策持续演化安全验证环境可信构造机理模型驱动设计可信测试评估运行演化监测智能验证评估智能安全评测开发运行环境智能代码生成持续学习机制智能软件演化软件生态构建智能软件建模动态部署和监控模型规模系统调控机制系统演化机理复杂系统建

6、模结构反演溯源系统行为刻画突变科学表征先进工业系统软件平台安全关键软件平台复杂智能软件演化平台循环代码大模型内部文件,严禁转发内部文件,严禁转发内部文件,严禁转发内部文件,严禁转发内部文件,严禁转发内部文件,严禁转发代码大模型评测与质量体系针对工业代码大模型在真实工业场景中缺乏系统性评测的痛点,包含可控代码生成、多轮代码生成、工业多场景代码问答、多粒度代码生成等多维度评测,显示主流模型在处理大规模代码库依赖、多粒度代码生成、理解业务逻辑等方面存在明显不足系统性评测助力训练工业代码大模型代码大模型评测系统多任务(任务角度)多场景(数据角度)多粒度(算法角度)多专家(架构角度)长序列(序列角度)混

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
1. **代码基础模型研究**:提出代码大模型缩放定律,通过1000+实验验证0.5B-32B模型多语言特性与跨语言迁移,40B-Loop模型在SWE-bench等任务达业界领先,开源一周获1.2K Star。 2. **评测体系创新**:构建多维度评测框架(如IFEvalCode、CodeSimpleQA、TableBench),覆盖8种语言、6,690万条指令数据,揭示模型在工业场景的不足。 3. **多语言智能体协作**:提出McEval基准(40语言、1.6万数据),mCoder开源模型表现优异;xDebugCoder在多语言Debug任务开源SOTA。 4. **代码智能体进展**:开发仓库级智能体(如SWE-agent)、多模态开发智能体,支持超长上下文(>128k)与动态代码反射(LiveRepoReflection基准)。 5. **开源生态**:Qwen-Coder系列全开源,下载量40万+,在十余个代码任务榜单开源第一,支持128K超长序列。
**代码智能体如何实现?** **缩放定律有何突破?** **多语言模型如何协作?**
客服
商务合作
小程序
服务号
折叠