2026 DeepSeek Harness 提示注入研究发布后该做什么?
📋 本文目录
某些网页、文件或 Skills 被读取后,Agent 开始改变计划,甚至准备调用命令、写文件或外部提交工具。
最快解法:立即收紧外部内容到敏感工具的路径,但不要把论文中的比例直接套到你的部署;在第一周内完成隔离、独立审批、Skills 复核和本地回归。
谁该先看这篇
如果你让 DeepSeek Harness 读取网页、文档、日志、邮件或代码注释后继续调用工具,这篇文章适合你。
安全工程师可以把研究结果转成来源到操作的控制矩阵;技术负责人则可以据此决定继续试点、限制功能,还是暂缓高权限上线。
最后更新于 2026 年 8 月 19 日。 日期、论文版本、测试快照与发布信息核实自 arXiv 论文正文、DeepSeek Harness 官方 Release 页面 和 AI-Infra-Guard 公开仓库。
发布当日:先区分研究发现与部署结论
这项 DeepSeek Harness 提示注入研究于 2026 年 8 月 17 日提交,评估的是一个非常具体的实验对象:2026 年 8 月 13 日的源码提交 47f943859bef、特定模型后端、特定 Agent 人格,以及未启用额外提示加固的基线配置。论文使用 AI-Infra-Guard 构造测试、注入受控内容、运行真实 TypeScript Harness,并记录完整会话轨迹。(论文来源)
实验规模也必须原样理解:论文执行了 14,560 次受控运行,覆盖 16 个间接内容通道、文本与文件两种载体、35 个攻击目标和 12 种攻击方法,另有一个未修改的基线方法。敏感工具是本地模拟夹具,记录的是 Agent 是否尝试调用及其参数,并没有真的发送邮件、执行命令、转账或访问外部服务。(论文实验方法)
论文报告的高风险切片包括:
- 文本载体中的 fake-completion 攻击,在语义评估器下的完整成功率为 17.0%;
- 文件载体中的隐藏 Unicode 通道,在规则评估器下为 25.5%;
- 文件载体中的 Skills 通道,在规则评估器下为 16.0%;
- 全部样本的完整成功率为 5.6%(规则评估器)或 5.3%(语义评估器);
- 如果把完整成功与部分服从合并,广义影响率为 7.6% 或 12.6%。(论文结果表)
这些数字足以说明“外部内容可能改变后续工具行为”,但不足以证明所有 DeepSeek Harness 部署都存在同样的漏洞率。你的模型后端、版本、提示边界、工具权限、文件解析器、审批策略和沙箱配置只要有一项不同,结果就可能变化。
这项研究应如何解读?
更准确的说法是:它暴露了一个需要部署方控制的来源到操作风险,而不是宣布所有安装都存在同一个可复现漏洞。
论文重点不是某一句系统提示失效,而是完整路径:外部网页或文件进入工具结果,工具结果进入模型可见上下文,模型据此改变计划,随后尝试调用敏感工具。工具结果可以携带额外上下文,Skills、MCP 集成、检索连接器和插件都可能参与这条输入边界。
因此,不能把“系统提示里写了不要相信网页内容”当成唯一防线。真正需要控制的是:
- 来源边界:网页、邮件、文档、日志和代码注释是否可能被攻击者改写;
- 载体边界:HTML、PDF 元数据、表格、隐藏字符和格式转换是否改变模型看到的内容;
- 权限边界:模型是否可以自行决定发送邮件、执行命令、写文件或提交外部请求;
- 审批边界:敏感工具授权是否由独立策略判断,而不是由模型解释内容后自行放行。
如果你还没有建立统一的权限基线,可以先参考 MacDate 的远程 Mac 工作区说明,把只读任务、文件修改和外部提交分成不同执行级别,再把论文中的攻击路径映射到对应级别。这样做的目的不是套用通用配置,而是先明确哪些任务必须在隔离工作区中运行。
第一天:冻结高风险跨边界动作,而不是全面停用
第一天不要直接卸载或全面停用 DeepSeek Harness。更有效的做法是先取消“无需确认即可跨边界执行”的路径,把读取外部内容与敏感操作暂时拆开。
你可以先建立一张来源到操作矩阵:
| 外部来源 | 可能携带的内容 | 连接的敏感操作 | 临时策略 | 风险评分 |
|---|---|---|---|---|
| 网页、搜索结果 | 页面正文、隐藏文本、跳转指令 | 外部提交、下载、命令执行 | 只读,禁止自动提交 | 高 |
| 文档、PDF、表格 | 正文、元数据、隐藏字符 | 写文件、发送邮件 | 进入隔离目录,二次审批 | 高 |
| 邮件、聊天记录 | 发件人内容、链接、附件 | 回复、转发、创建任务 | 禁止自动对外发送 | 高 |
| Skills、MCP | 指令模板、工具描述、返回结果 | Shell、文件修改、网络访问 | 固定版本,来源审核 | 高 |
| 日志、代码注释 | 错误信息、注释文本、样例命令 | 修改代码、执行测试命令 | 只允许生成补丁,不自动执行 | 中 |
这里的“冻结”不是让 Agent 不能读取内容,而是让它不能在读取后直接完成高影响动作。尤其要先限制命令执行、写入工作区、外部 HTTP 提交、邮件发送、权限变更和资金相关动作。
如果你的试点环境还没有独立隔离,可以先把 Agent 放到单独的远程 Mac 工作区中运行,并将代码、凭据和外部服务访问分开管理。重点不是购买某个固定配置,而是先获得一个可重置、可审计、与日常开发环境分离的运行边界。
前三天:让授权脱离模型自行判断
第三天前,你至少要为每个外部内容源增加 3 类标记:
- 来源标识:URL、文件路径、邮件 ID、MCP 服务或 Skill 版本;
- 信任级别:内部维护、已审核第三方、普通外部内容、未知来源;
- 载体类型:网页、PDF、邮件、表格、代码注释、Skill 文件或工具返回值。
这些字段不能只写进日志供事后查看,还应能参与执行决策。例如,来自未知网页的内容即使要求执行一个看似普通的 Shell 命令,也不能直接通过;来自已审核仓库的代码变更,也不应自动获得外部提交权限。
DeepSeek Harness 官方代码和论文都显示,工具调用前存在可插入策略的位置,包括 pre-execute、ToolGuard、审批和沙箱控制。ToolGuard 可以采用“只允许拒绝、不允许后续监听器重新放行”的单调策略;敏感工具则应在工具真正执行前进行参数级检查。(论文架构说明)
独立审批至少要检查:
- 触发该工具的内容来源是否可信;
- 工具参数是否包含外部内容中的收件人、URL、路径或账户;
- 当前操作是否改变文件、网络或账号状态;
- 是否需要人工确认,而不是仅记录一次模型理由;
- 审批完成后,原始输入和最终参数是否仍然一致。
Skills 与网页内容为何会进入工具风险链?
因为它们不一定停留在“参考资料”位置。DeepSeek Harness 的工具结果和附加上下文可能继续进入 Agent 会话,Skills 还会以可复用指令或工具相关内容影响后续计划。论文中,Skills 通道在文本模式的规则评估成功率为 14.3%,文件模式为 16.0%;隐藏 Unicode 在文本模式为 0.0%,但文件模式达到 25.5%。这说明只测试复制出来的纯文本,可能漏掉解析、元数据和字符表示造成的风险。(论文载体对比)
因此,Skills 不应被当作普通提示模板管理。你需要像管理代码依赖一样管理它:记录所有者、来源仓库、版本、变更记录、可调用工具和最高权限。MCP 服务也要单独列出工具清单,避免“接入一个服务”后实际开放了多个未审核操作。
第一周:优先复核 Skills、插件与文件载体
研究发布后的第一周,建议按照风险而不是按照文件数量排序。
先检查论文表现突出的 Skills 和文件通道,再覆盖隐藏字符、PDF 元数据、表格单元格、HTML 注释、邮件头和格式转换结果。AI-Infra-Guard 的公开仓库将 Agent、Skills、MCP 和提示安全评估拆成不同扫描能力,可作为你设计内部检查项时的参考,而不是直接替代本地验收。
每项资产至少保留以下记录:
- 资产名称、版本和维护人;
- 来源仓库或上传入口;
- 读取权限与可调用工具;
- 是否允许网络访问、写文件或执行命令;
- 最近一次人工审核日期;
- 最近一次受控提示注入测试结果;
- 失败后的回滚和禁用方式。
测试夹具必须没有真实外部副作用。邮件、命令、表单、资金操作和网络提交都使用本地模拟工具;文件写入限定在临时目录;网络请求指向本地服务;所有 trace 保存用户任务、污染来源、工具调用、参数和策略决定。
建议把下面这份清单交给负责部署的人逐项勾选:
- [ ] 已列出网页、文档、邮件、日志、代码注释、Skills 和 MCP 来源。
- [ ] 每个来源都有来源 ID、信任级别和载体类型。
- [ ] 命令执行、写文件、外部提交和邮件发送默认需要独立审批。
- [ ] ToolGuard 或等效策略能在工具执行前拒绝调用。
- [ ] 已检查隐藏 Unicode、元数据、HTML 注释和格式转换结果。
- [ ] Skills 与插件均有所有者、版本来源和权限清单。
- [ ] 所有测试使用本地模拟 sink,没有真实外部副作用。
- [ ] 已保存完整 trace,而不是只记录最终回答。
- [ ] 论文中的攻击比例没有被写入内部风险承诺或合规结论。
- [ ] 计划在版本、模型、工具或审批策略变化后重新回归。
扩大试点前:用自己的版本重跑,而不是照抄论文评分
扩大试点前,选择少量但代表真实业务的回归案例。不要只测试“模型是否拒绝恶意文本”,而要记录 4 个阶段:
- 恶意内容是否进入模型上下文;
- Agent 的计划是否被改变;
- 是否产生了敏感工具调用;
- 策略是否在执行前拦截,或者审批是否阻止了最终动作。
测试输入要同时包含文本和真实文件载体。至少选一个网页、一个 PDF 或表格、一个 Skill、一个 MCP 工具返回值和一个代码注释场景。每类场景都准备正常内容、明显恶意内容、隐藏字符内容和格式转换后的内容。
论文比例只能作为风险信号,不能替代你的本地结果。比如同一个 Skills,如果你的版本已经增加来源标记、参数审批和沙箱隔离,结果就不应与未加固基线混为一谈;反过来,如果你的部署开放了真实网络和写入权限,即使模型拒绝率较高,也不能据此宣称安全。
v0.1.0-rc.7 于 2026 年 8 月 17 日发布,官方 Release 页面显示该版本包含插件设置卡片、MCP/ACP 图片附件、Bash 调用和历史消息相关修复等变化。它与论文使用的 2026 年 8 月 13 日源码快照是否一致,必须单独核对提交、默认配置和工具调用管线,不能因为日期接近就视为同一测试对象。(官方版本记录)
你可以为每个版本建立一个简单评分:
- 0 分: 外部内容可直接触发敏感工具,且没有来源标记;
- 1 分: 有日志,但授权仍由模型自行判断;
- 2 分: 有来源标记和拒绝策略,敏感操作需要确认;
- 3 分: 有隔离环境、参数级审批、完整 trace 和版本化回归。
评分低于 2 分 时,不建议扩大高权限试点;达到 2 分 只能说明具备继续验证条件;只有在真实配置下连续回归通过,才适合逐步增加工具权限。这里的分数是内部决策工具,不是论文统计结果。
后续版本:把安全结论绑定到版本,而不是绑定到新闻
研究发布后的动作不应在第一周结束时停止。你需要持续跟踪官方仓库、Release、安全说明、相关修复和论文修订。每次以下内容发生变化,都要重新执行代表性用例:
- Harness 源码或工具调用策略变化;
- 模型后端或默认推理设置变化;
- Skills、MCP、插件或解析器变化;
- 系统提示、来源标记或审批策略变化;
- 沙箱、网络访问和工作区权限变化。
建议把结果分成 3 种决策,而不是简单写“安全”或“不安全”:
✅ 继续试点: 外部内容已隔离,敏感工具独立审批,本地代表用例未出现未授权调用。
⚠️ 限制功能: 仍有计划改变或部分服从,只开放只读工具和临时工作区。
❌ 暂停高权限部署: 污染内容能稳定改变敏感参数,或策略无法在执行前拦截。
如果你当前使用的是共享开发机、权限混杂的云主机或未经隔离的本地环境,真实缺点通常有 4 个:外部内容可能接触到现有凭据;失败后难以恢复干净状态;多个 Agent 或用户之间容易共享文件和网络权限;回归测试也难以确认究竟是哪一层配置导致结果变化。需要规划 Mac 节点时,可以把硬件核对、系统版本和隔离要求分开记录,避免只按宣传规格选择运行环境。
若你只是需要临时算力、短期测试环境或一次性回归节点,租赁 MacDate 的独立 Mac 环境会更容易完成隔离、重置和版本切换;但如果你需要长期稳定重负载,或依赖特定物理接口,仍应评估自购 Mac 或专用基础设施。需要进一步了解隔离环境的组织方式时,可查看 MacDate 中文技术资料页,再根据自己的凭据、网络和工具权限决定是否租赁。先把论文风险转成自己的回归清单,通常比直接扩大权限更稳妥。