本文来自微信公众号“启元洞见”。

导语:2026年7月10日,英国科学、创新与技术部委托兰卡斯特大学完成并发布了题为《人工智能安全专题回顾与差距分析》(Thematic Review and Gap Analysis on AI Security)的研究报告。报告系统梳理了2021年1月至2026年1月间全球人工智能系统网络安全领域9109篇同行评议文献,旨在客观评估该领域的研究覆盖程度,识别尚未得到充分关注的“盲区”,并为政府、学术界和产业界提供投资与政策方向的参考依据。分析表明尽管该领域在近五年内取得了爆发式增长,但主题分布极不均衡,且存在若干关乎系统全生命周期安全的严重研究缺口,亟待政策制定者与科研共同体协同应对。
01
研究主题覆盖格局:
集中与分散并存的学科面貌
根据语义匹配结果,9109篇论文被归入12个研究主题,其覆盖程度呈现明显的金字塔结构。
处于塔尖的是“训练时安全”与“数据与隐私风险”,分别占据全部论文的约41%和26%,构成当前人工智能系统网络安全研究的两大支柱。训练时安全聚焦于敌手在模型学习阶段实施的投毒、后门植入、标签翻转等攻击,以及相应的防御策略;数据与隐私风险则关注成员推理、模型反转、数据泄露等对训练数据机密性的威胁。这两大主题之所以获得压倒性关注,既源于其技术成熟度较高(如对抗性机器学习已有十余年积累),也反映出学术界对基础安全属性的持续重视。
第二层级包含供应链漏洞、对齐问题以及推理时安全,各占约8%的论文份额。供应链漏洞涉及第三方组件、开源模型库(如Hugging Face)带来的风险;对齐问题探讨模型行为与人类意图偏离所引发的安全隐患;推理时安全涵盖对抗性扰动、提示注入、越狱等部署阶段的实时攻击。这三个主题虽获中等关注,但与前两者差距悬殊。
第三层级则由剩余七个主题构成,合计占比不足20%,其中包括系统基础设施安全(约1.5%)、自主智能体安全(约1%)、终端用户安全风险(约1%)、生命周期末与处置风险(约0.8%)、资产追踪失效风险(约0.3%)、模型与系统设计安全(约0.6%)以及安全治理与监管(约0.2%)。这一分布清晰揭示出,当前研究高度集中于模型开发与推理阶段的技术性攻防,而对系统集成、运维、退役以及人机交互等更广泛安全场景的重视严重不足。
02
量化特征与地域分布:
中美主导下的研究生态
从时间维度看,人工智能安全论文发表量在2021至2022年间年均约500篇,2023年起急剧攀升,2024与2025年均突破3000篇,反映出该领域在生成式人工智能浪潮推动下的迅猛扩张。值得注意的是,2025年出版量略有回落,主要源于会议论文的周期性波动,但整体增长趋势未改。
按作者机构类型划分,纯学术机构产出的论文常年占据总量半数以上,而包含企业作者或政企混合作者的论文在2024年达到900余篇,显示产业界参与度显著提升。
资助来源方面,中国和美国位列前两位,韩国、澳大利亚、新加坡及欧洲多国紧随其后,英国居第七位。地域分布与资助格局高度一致,中美两国作者贡献了绝大多数论文,英国、澳大利亚等亦占有相当份额。这一分布既反映了人工智能系统网络安全研究的全球竞争态势,也暗示不同国家的研究优先级可能受其本国技术战略与监管框架影响。
从所涉人工智能系统类型看,深度学习和机器学习系统遥遥领先,生成式人工智能和计算机视觉相关论文各在1000至2000篇之间,而以智能体为对象的论文仅122篇,尽管其2025年同比增长率达216%,是增速最快的子领域,但绝对数量仍显单薄。这一发现尤为重要,因为智能体被广泛预期将在未来两三年内大规模部署,其安全研究储备与实际需求之间可能存在显著落差。
03
五大关键研究空白
报告通过关键词缺口分析、主题覆盖率评估及专家研判,提炼出五个亟待填补的研究空白,它们分别对应人工智能系统生命周期的不同阶段,且相互关联。
第一个研究空白涉及数据完整性保障。现有大量研究聚焦于攻击类型与防御手段,却极少探索形式化方法或可验证机制来确保训练数据及模型权重的安全性与真实性。仅有不足1%的论文涉及数据完整性验证,这意味着目前缺乏一种类似密码学哈希或数字签名的强保证手段,来证明数据未被篡改或来源可靠。随着第三方数据集的广泛使用,这一缺失将严重削弱供应链信任基础。
第二个研究空白关乎系统基础设施安全,尤其针对智能体系统。虽然针对传统机器学习部署环境的网络安全研究已有一定积累(如云配置、API安全),但这些工作大多未考虑大语言模型和智能体所特有的扩展攻击面,例如工具调用链、内存污染、多智能体通信协议漏洞等。目前仅有约1.5%的论文归于该主题,且其中89%仍聚焦于非生成式、非智能体系统,这使得新兴架构的安全防护缺乏理论支撑和最佳实践。
第三个研究空白是终端用户自身行为引发的安全风险。现有文献多将用户视为攻击的受害者或防护对象,而较少审视用户因自动化偏见、过度信任或误判模型输出而主动引入的脆弱性。例如,执行大模型生成的恶意代码、依据幻觉结果作出关键决策、或因“影子人工智能”(即组织内部“未登记、未报备、脱离安全团队监管”的人工智能模型与使用行为)的使用而绕过安全监控——这些场景仅被极少数论文提及(不足1%)。鉴于“氛围编程”(vibe coding)等新范式的普及,用户端风险将急速放大,亟需结合认知科学与社会技术视角开展系统研究。
第四个研究空白是数据与模型来源追溯。随着开源模型库成为主流供应渠道,模型来源的安全性(如是否包含后门、是否被微调过恶意数据)直接影响下游系统的风险水平。然而,关于自动化追踪、验证模型谱系与溯源的研究仅占很小比例(约2-3%),且缺乏标准化的元数据格式和检测工具,远不及恶意软件领域成熟的签名库与信誉系统。
第五个研究空白是模型安全退役与处置。尽管机器遗忘(Machine Unlearning)在传统机器学习中受到一定关注(约13%的论文),但对于前沿大模型和智能体,其参数量庞大、训练数据复杂,安全删除特定样本或彻底销毁模型实例尚无可行方案。直接提及“模型处置”的论文为零,而标准规范(如ETSI EN 304 223)已将其列为必要环节,这一脱节意味着大量退役系统可能遗留敏感信息或残余能力,成为潜在攻击跳板。
此外,报告特别强调,智能体安全是一个横跨多个缺口的系统性薄弱环节,涉及智能体自身、工具环境、智能体间协作等新增攻击面。尽管其论文增速最快,但从绝对数量看仍属于“低覆盖”领域,且绝大多数现有工作尚未针对生成式智能体的特有脆弱性(如间接提示注入、记忆污染)展开深入探讨。
04
政策启示和行动建议
基于上述分析,报告为政策制定者提出了若干方向性建议:
一是在于认识到研究覆盖度本身并非衡量安全水平的唯一标尺。对于安全治理与监管、模型设计安全等主题,即便论文数量稀少,也可能因为关键性标准或框架(如NIST AI RMF、ISO/IEC 42001)已提供充分指引而无需大量学术产出。然而,对于数据完整性、基础设施安全、终端用户风险、来源追溯和模型处置这五大缺口,低发表量直接映射出知识储备的严重匮乏,必须通过专项资助、跨学科合作和公共基准建设予以弥补。
二是建立类似通用漏洞披露(CVE)的人工智能系统漏洞公开数据库。当前虽有AVID、LM安全数据库等先行尝试,但记录数量极为有限且使用率不高。一个权威、开放、可互操作的漏洞知识库,将有助于从碎片化的个案报告转向系统化风险管理,也为合规审计和保险评估提供依据。报告同时指出,资助机构应平衡对传统热点(如训练时安全)的持续投入与对新缺口的前瞻布局,尤其要关注自主智能体在2-3年内的快速落地,避免安全研究滞后于技术扩散。
综上所述,报告通过对近五年文献的系统审视,勾勒出一幅人工智能安全研究“热于局部、冷于全局”的图景。技术攻防细节被过度开采,而系统集成、运营维护、用户行为、退役处置等全生命周期环节却长期被边缘化。英国政府借助此项独立研究,不仅为国内科研拨款与政策设计提供了实证基础,也为国际社会敲响警钟:人工智能系统网络安全的真正韧性和不取决于最擅长的攻击防御领域有多强,而取决于最薄弱的环节能否及时补上。随着人工智能系统日益嵌入关键基础设施和日常生活,将这些研究缺口转化为实际行动,已从学术议题上升为国家安全和社会稳定的紧迫任务。报告最后强调,当前正是将原则性认识转化为可执行标准、将零散努力整合为协同战略的最佳窗口期,任何拖延都将在技术指数级演进的背景下放大未来的治理成本。
参考来源:人工智能安全专题回顾与差距分析
参考题目:Thematic review and gap analysis on AI security
参考链接:https://www.gov.uk/government/publications/thematic-review-and-gap-analysis-on-ai-security/thematic-review-and-gap-analysis-on-ai-security
