适合负责 AI 应用、云安全、研发平台和企业风控的读者。核心结论是:新一轮 AI 滥用并不主要依靠一句明显危险的提示,而是把侦察、写代码、排错和数据处理拆成许多看似正常的小任务,再用 Agent 串成完整流程。企业若只检查单次输入,已经不足以识别真实风险。
发生了什么
Anthropic 于 2026 年 9 月 10 日发布新一期威胁情报报告,披露其在 2025 年 12 月至 2026 年 8 月间识别并处置的异常使用案例,范围包括网络攻击、监控、影响力行动、武器相关软件和高风险生物研究。本文更新于 2026 年 9 月 16 日,不把这些跨数月调查的案例包装成当天突发新闻。
报告中的个案与归因主要来自 Anthropic 自身平台观测。美联社的独立报道确认了报告发布时间、调查范围与公司采取的封禁和防护措施,但这不等于每个行为结果都获得外部复现。阅读这类厂商威胁报告时,应同时重视第一手遥测的价值和自报数据的边界。
真正的变化不是“AI 会写恶意代码”
更值得警惕的是工作方式变化。Anthropic 披露,一些行为者把项目拆成多个会话,以普通的软件开发、测试和故障排查请求逐步获得所需组件。报告还指出,直接呈现为恶意的请求往往会被拒绝,但碎片化、跨会话的任务可能更难被单点规则识别。
Google Threat Intelligence Group 在 9 月 8 日发布的同期观察给出了相似方向:攻击者正在从简单提示转向 Agent 工作流与自动化。在一个案例中,攻击者借助预设指令,在不到六小时内完成规划、构建和大规模凭据收集。Google 还观察到攻击者试图欺骗代码助手和大模型安全扫描器,并将模型、提示、源代码、API 凭据与云算力本身作为盗窃目标。
两份报告来自不同厂商和遥测体系,不能简单合并成统一统计,但共同说明了一个趋势:AI 更像攻击链的加速器和编排层,而不只是生成一段文本的工具。危险可能藏在一连串单独看来合理的动作里。
企业最容易漏掉的三条边界
第一,账号边界。只在注册时做身份和地区检查不够,还要识别同一操作者跨账号、跨组织和跨会话持续推进同一任务的行为。异常并发、相似工具链、重复基础设施和快速重建账号,都比某一个关键词更有信号价值。
第二,凭据边界。攻击者不仅使用 AI,也会直接窃取 API 密钥、开发者账号和云配额。企业应让密钥短命、窄权、可轮换,不把长期令牌写进仓库、日志或 Agent 可读文件;同时监控调用地点、模型、频率与费用的突然变化。
第三,工具边界。代码执行、浏览器、邮件、云控制台和外部连接一旦组合起来,风险会远高于单一聊天窗口。应按任务开放最少工具,对发送、删除、付款、权限变更和生产写入保留人工确认,并限制运行时长、并发数、网络出口和可访问数据。
从“内容审核”升级为“行为序列监控”
团队可以先建立四层检测:输入层判断明确违规意图;会话层识别逐步拼装的高风险项目;账号层关联并发会话、重复失败与身份变化;基础设施层观察凭据、网络、文件和工具调用。任何一层都不应单独决定结论,而应把风险信号合并后再限速、暂停或转人工复核。
日志也要能回答完整链路:谁在什么时间调用了哪个模型和工具,读取了哪些数据,产生了什么外部副作用,审批人是谁,最终是否回滚。仅保存最终回复,无法还原 Agent 在中间做过的搜索、执行和重试。
一份可执行的七日检查清单
- 盘点所有模型 API 密钥、Agent 服务账号和云角色,撤销长期未使用权限。
- 为生产写入、对外发送、下载敏感数据和权限变更增加独立审批。
- 给 Agent 设置网络允许列表、调用上限、运行时限与紧急停止开关。
- 把跨会话、跨账号的相似工具调用纳入异常检测,而不只扫描提示词。
- 对代码助手生成的脚本继续执行依赖扫描、密钥扫描和人工审查。
- 准备凭据泄露演练,验证轮换后旧密钥确实失效且影响范围可查。
- 明确哪些日志可以交给外部模型分析,先脱敏再上传,并保留人工复核。
不应过度推断
报告挑选的是最显著、最新颖的案例,不代表普通 AI 使用的平均风险,也不能据此断言某个模型独立完成了全部攻击。部分个案的身份和最终影响仍来自厂商判断,正文中也存在无法核实的行为者自述。
但这些限制并不削弱防守启示:当 Agent 能长时间运行、调用多种工具并自行排错时,安全控制必须覆盖完整流程。拒绝危险提示仍然重要,但真正可靠的防线还需要最小权限、跨会话关联、工具隔离、实时监控和可演练的响应机制。