当前位置:首页 > 报告详情

Self-GC:一种结合前缀缓存约束的多轮 Agent 上下文治理方案.pdf

上传人: 散** 编号:1277156 2026-07-11 35页 3.93MB

1、ENGINEERING BLOGENGINEERING BLOGSelf-GCSelf-GC:非研发:非研发 Agent Agent 普惠时代的普惠时代的运行时上下文成本治理运行时上下文成本治理Token 账单、上下文噪音与长程 Agent 的 Active Context 管理演讲人:郝栩彬公司/职位:小红书质效研发部 AI工程架构师AiConAiCon全球软件开发技术大会InfoQ InfoQ 极客邦科技极客邦科技目录目录AiConAiCon0101Agent 普惠后的成本账非研发场景、输入 Token、模型路由与行为退化0202成本治理指标与策略Avg Input Tokens、Comp

2、action Reset、三类工程策略0303Self-GC 运行时机制ContextObject、Plan/Commit、生命周期动作0404Context Injection 与数据飞轮旁路 Copilot、Session 清洗、Benchmark/SFT/RL0505评测结果与 Workload 洞察Hard Set、A/B、办公与 Coding 场景差异0606总结与展望三点结论、边界与开源方向Agent Agent 普惠后的成本账普惠后的成本账从非研发使用规模到长上下文账单硬着陆AiConAiConInfoQ 极客邦科技白领白领 Agent Agent 普惠:成本问题开始变成企业问题

3、普惠:成本问题开始变成企业问题AGENT ADOPTION MAKES CONTEXT COST A BUSINESS PROBLEMAiConAiCon探索 AI 应用边界InfoQ 极客邦科技起源起源 过去 Agent 体感最强的场景多在 Coding Agent;白领人群的渗透相较于25年初 依然是 豆包、元宝、DeepSeek 为主进展缓慢,直到今年小龙虾的爆火,XX Work XX Claw 大量涌现。此外,Coding 任务大多有交付物/Diff Patch,围绕编码的 Git、编译环境、存储 均是强鲁棒性的运行环境;与此对立白领任务探索空间更广,浏览器、APP、Office,存在

4、大量的无效 token 被浪费 白领任务步长相对短,但用户基数更大、使用频率更高,配套工具大量未经专门优化,工具 tokens 效率低,推理流量会被放大到新的量级。规模放大逻辑规模放大逻辑白领任务白领任务高频使用高频使用低鲁棒低鲁棒 Agent Agent无效上下文无效上下文企业账单企业账单80k+80k+Avg Input Tokens100:1100:1Input/Output Ratio150:1150:1高压场景比例500800500800常见输出 TokensToken Token 管理不再只是管理不再只是“别爆窗口别爆窗口”,而是企业级,而是企业级 Capacity Plannin

5、g Capacity Planning。长程白领长程白领 Agent Agent 的输入吞吐计算的输入吞吐计算CAPACITY PLANNING AND MODEL ROUTINGAiConAiCon探索 AI 应用边界InfoQ 极客邦科技10001000人企业的并发容量账人企业的并发容量账 按峰值并发计算:千人公司,同一时间 100 名员工运行 OpenClawAVGAVG TPMTPM 1 1千人公司千人公司 =1 1 kwkw tokenstokens /minmin 每个连续任务平均 5 次模型调用,非定时任务 瞬时输入吞吐可达 23 kw Input tokens/min。Back

6、bone ModelBackbone Model每分钟输入每分钟输入价格价格每分钟输出每分钟输出价格价格8h8h成本成本2222天成本天成本海外旗舰模型海外旗舰模型$7.45$447$3,576$78,672qwen3.7 plusqwen3.7 plus$0.97$58$464$10,208deepseek V4 prodeepseek V4 pro$0.53$31.54$252$5,551为什么不能全部切到低价模型为什么不能全部切到低价模型 Browser-First 任务离不开多模态:截图、交互态 DOM、Office 报告,第一眼看错会一路跑偏。用户意图经常模糊,模型需要澄清、追问并避

word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
1. **成本问题**:白领Agent普惠后,输入Token激增(如千人企业峰值达2-3 kw tokens/min),长上下文导致模型行为退化(如复读机、工具调用死循环)。 2. **治理指标**:核心指标为Avg Input Tokens,需通过三类策略降低:源头裁剪工具输出、过程裁剪Active View、训练模型自主压缩。 3. **Self-GC机制**:将上下文对象化(ContextObject),通过异步Planner决策FOLD/MASK/PRUNE,延迟提交保护缓存,实现增量GC。 4. **效果**:生产环境输入Token降10%-20%,评测中43.95%剪枝率下无影响率达84.85%。 5. **结论**:上下文需生命周期管理,模型判断与系统约束闭环,未来推进开源与端到端评测。
**Agent成本高?** **上下文如何管?** **Self-GC是什么?**
客服
商务合作
小程序
服务号
折叠