您的当前位置:首页 > 标签 > 大模型安全评测
中国工业互联网研究院:2026面向人工智能系统的体系化安全检测与风险评估方法研究报告(27页).pdf
2026大模型安全评测:提示词注入攻击成首要威胁,行业安全水位整体偏低|安全研究所
安全研究所深度分析大模型安全评测:提示词注入居风险首位、253个攻击脚本检测、OpenClaw被工信部通报、Anthropic模型被出口管制,附跨层级量化评测方法与案例。
 2026-07-29
 AI产业
 27页
9张图表
数据来源:
中国工业互联网研究院:2026面向人工智能系统的体系化安全检测与风险评估方法研究报告(27页) 查看报告
当Anthropic的旗舰模型Fable5上线三日即因安全缺陷被实施出口管制,当OpenClaw因提示词注入漏洞被工信部紧急通报,当最先进的模型也无法完全抵御安全攻击——大模型的安全评测已不是“要不要做”的问题,而是“怎么做才能跟得上风险演化的速度”的紧迫课题。安全研究所这份报告基于253个攻击脚本的检测能力和跨层级量化模型,对大模型安全评测的方法论与实践进行了系统梳理。

大模型安全评测的时代背景

大模型的安全风险正从“技术隐患”升级为“战略博弈的焦点”。2026年6月,Anthropic发布的旗舰模型Fable5和Mythos5上线仅三日,就因存在严重安全隐患,被美商务部以国家安全为由实施紧急出口管制,最终被迫全面暂停相关服务。曾爆火的OpenClaw(“龙虾”)智能体因存在提示词注入、远程代码执行、恶意插件投毒等严重安全隐患,工信部、国家互联网应急中心等部门发布安全提醒,部分企业明令禁用。

这些事件表明,大模型安全评测已从学术研究议题上升为产业合规和国家安全的战略需求。

大模型安全评测的技术体系

多层级安全检测架构

研究团队提出了AI多层级安全体系架构,覆盖从基础架构层到智能交互层的全栈安全检测。在智能交互层,提示词注入威胁最为突出——技术门槛低、危害性大,攻击者仅需输入精心设计的自然语言即可绕过安全防护。基于此架构,团队自研了安全风险评测工具,构建了253个攻击脚本的检测能力。

工业智能体Skills安全评测

Skill(技能)是大模型执行特定任务的模块化单元,在OpenClaw、Hermes等智能体中广泛应用。经测评,54.7%的Skills存在安全缺陷,暴露五大类风险:代码安全风险、提示词注入风险、内容安全风险、权限过度配置风险、供应链安全风险。即使表现最好的模型也未能完全抵御攻击,行业安全水位整体偏低。

跨层级动态量化评测方法

从“定性判断”到“定量决策”

研究团队提出了AI系统七层技术体系架构,为跨层级威胁传导分析与量化评估提供框架基础。三大模型形成了量化闭环:威胁识别模型识别跨层级的威胁传导路径,风险评估模型量化各层级的风险指数,防御优化模型计算不同防御措施的成本效益比。

案例验证:CVE-2024-0132

通过CVE-2024-0132(英伟达高危漏洞)案例验证了评测方法的有效性。三种防御措施——容器工具包补丁升级(成本效益比0.052)、数据存储加密+访问审计(成本效益比0.018)、模型签名与完整性校验(成本效益比0.024)——的成本效益可量化比较,使安全管理者能够基于数据做出最优的防御资源分配决策。

大模型安全评测的未来方向

大模型安全评测正从单点检测走向体系化评估,从静态检测走向动态量化分析,从技术判断走向可执行的处置决策。未来发展方向包括:覆盖更全面的攻击面——从提示词注入扩展到多模态安全、Agent安全、供应链安全等新兴风险;更高效的安全评测流程——实现自动化、标准化的安全“体检”;风险与防御的量化闭环——让每次评测结果都能直接指导防御资源的优化配置。
客服
商务合作
小程序
服务号
折叠