2026 DeepSeek Harness 提示注入研究发布后该做什么?

2026 DeepSeek Harness 提示注入研究发布后该做什么?

某些网页、文件或 Skills 被读取后,Agent 开始改变计划,甚至准备调用命令、写文件或外部提交工具。

最快解法:立即收紧外部内容到敏感工具的路径,但不要把论文中的比例直接套到你的部署;在第一周内完成隔离、独立审批、Skills 复核和本地回归。

谁该先看这篇

如果你让 DeepSeek Harness 读取网页、文档、日志、邮件或代码注释后继续调用工具,这篇文章适合你。

安全工程师可以把研究结果转成来源到操作的控制矩阵;技术负责人则可以据此决定继续试点、限制功能,还是暂缓高权限上线。

最后更新于 2026 年 8 月 19 日。 日期、论文版本、测试快照与发布信息核实自 arXiv 论文正文DeepSeek Harness 官方 Release 页面AI-Infra-Guard 公开仓库

发布当日:先区分研究发现与部署结论

这项 DeepSeek Harness 提示注入研究于 2026 年 8 月 17 日提交,评估的是一个非常具体的实验对象:2026 年 8 月 13 日的源码提交 47f943859bef、特定模型后端、特定 Agent 人格,以及未启用额外提示加固的基线配置。论文使用 AI-Infra-Guard 构造测试、注入受控内容、运行真实 TypeScript Harness,并记录完整会话轨迹。(论文来源)

实验规模也必须原样理解:论文执行了 14,560 次受控运行,覆盖 16 个间接内容通道、文本与文件两种载体、35 个攻击目标和 12 种攻击方法,另有一个未修改的基线方法。敏感工具是本地模拟夹具,记录的是 Agent 是否尝试调用及其参数,并没有真的发送邮件、执行命令、转账或访问外部服务。(论文实验方法)

论文报告的高风险切片包括:

  • 文本载体中的 fake-completion 攻击,在语义评估器下的完整成功率为 17.0%
  • 文件载体中的隐藏 Unicode 通道,在规则评估器下为 25.5%
  • 文件载体中的 Skills 通道,在规则评估器下为 16.0%
  • 全部样本的完整成功率为 5.6%(规则评估器)或 5.3%(语义评估器);
  • 如果把完整成功与部分服从合并,广义影响率为 7.6%12.6%。(论文结果表)

这些数字足以说明“外部内容可能改变后续工具行为”,但不足以证明所有 DeepSeek Harness 部署都存在同样的漏洞率。你的模型后端、版本、提示边界、工具权限、文件解析器、审批策略和沙箱配置只要有一项不同,结果就可能变化。

这项研究应如何解读?

更准确的说法是:它暴露了一个需要部署方控制的来源到操作风险,而不是宣布所有安装都存在同一个可复现漏洞。

论文重点不是某一句系统提示失效,而是完整路径:外部网页或文件进入工具结果,工具结果进入模型可见上下文,模型据此改变计划,随后尝试调用敏感工具。工具结果可以携带额外上下文,Skills、MCP 集成、检索连接器和插件都可能参与这条输入边界。

因此,不能把“系统提示里写了不要相信网页内容”当成唯一防线。真正需要控制的是:

  • 来源边界:网页、邮件、文档、日志和代码注释是否可能被攻击者改写;
  • 载体边界:HTML、PDF 元数据、表格、隐藏字符和格式转换是否改变模型看到的内容;
  • 权限边界:模型是否可以自行决定发送邮件、执行命令、写文件或提交外部请求;
  • 审批边界:敏感工具授权是否由独立策略判断,而不是由模型解释内容后自行放行。

如果你还没有建立统一的权限基线,可以先参考 MacDate 的远程 Mac 工作区说明,把只读任务、文件修改和外部提交分成不同执行级别,再把论文中的攻击路径映射到对应级别。这样做的目的不是套用通用配置,而是先明确哪些任务必须在隔离工作区中运行。

第一天:冻结高风险跨边界动作,而不是全面停用

第一天不要直接卸载或全面停用 DeepSeek Harness。更有效的做法是先取消“无需确认即可跨边界执行”的路径,把读取外部内容与敏感操作暂时拆开。

你可以先建立一张来源到操作矩阵:

外部来源 可能携带的内容 连接的敏感操作 临时策略 风险评分
网页、搜索结果 页面正文、隐藏文本、跳转指令 外部提交、下载、命令执行 只读,禁止自动提交
文档、PDF、表格 正文、元数据、隐藏字符 写文件、发送邮件 进入隔离目录,二次审批
邮件、聊天记录 发件人内容、链接、附件 回复、转发、创建任务 禁止自动对外发送
Skills、MCP 指令模板、工具描述、返回结果 Shell、文件修改、网络访问 固定版本,来源审核
日志、代码注释 错误信息、注释文本、样例命令 修改代码、执行测试命令 只允许生成补丁,不自动执行

这里的“冻结”不是让 Agent 不能读取内容,而是让它不能在读取后直接完成高影响动作。尤其要先限制命令执行、写入工作区、外部 HTTP 提交、邮件发送、权限变更和资金相关动作。

如果你的试点环境还没有独立隔离,可以先把 Agent 放到单独的远程 Mac 工作区中运行,并将代码、凭据和外部服务访问分开管理。重点不是购买某个固定配置,而是先获得一个可重置、可审计、与日常开发环境分离的运行边界。

前三天:让授权脱离模型自行判断

第三天前,你至少要为每个外部内容源增加 3 类标记:

  1. 来源标识:URL、文件路径、邮件 ID、MCP 服务或 Skill 版本;
  2. 信任级别:内部维护、已审核第三方、普通外部内容、未知来源;
  3. 载体类型:网页、PDF、邮件、表格、代码注释、Skill 文件或工具返回值。

这些字段不能只写进日志供事后查看,还应能参与执行决策。例如,来自未知网页的内容即使要求执行一个看似普通的 Shell 命令,也不能直接通过;来自已审核仓库的代码变更,也不应自动获得外部提交权限。

DeepSeek Harness 官方代码和论文都显示,工具调用前存在可插入策略的位置,包括 pre-execute、ToolGuard、审批和沙箱控制。ToolGuard 可以采用“只允许拒绝、不允许后续监听器重新放行”的单调策略;敏感工具则应在工具真正执行前进行参数级检查。(论文架构说明)

独立审批至少要检查:

  • 触发该工具的内容来源是否可信;
  • 工具参数是否包含外部内容中的收件人、URL、路径或账户;
  • 当前操作是否改变文件、网络或账号状态;
  • 是否需要人工确认,而不是仅记录一次模型理由;
  • 审批完成后,原始输入和最终参数是否仍然一致。

Skills 与网页内容为何会进入工具风险链?

因为它们不一定停留在“参考资料”位置。DeepSeek Harness 的工具结果和附加上下文可能继续进入 Agent 会话,Skills 还会以可复用指令或工具相关内容影响后续计划。论文中,Skills 通道在文本模式的规则评估成功率为 14.3%,文件模式为 16.0%;隐藏 Unicode 在文本模式为 0.0%,但文件模式达到 25.5%。这说明只测试复制出来的纯文本,可能漏掉解析、元数据和字符表示造成的风险。(论文载体对比)

因此,Skills 不应被当作普通提示模板管理。你需要像管理代码依赖一样管理它:记录所有者、来源仓库、版本、变更记录、可调用工具和最高权限。MCP 服务也要单独列出工具清单,避免“接入一个服务”后实际开放了多个未审核操作。

第一周:优先复核 Skills、插件与文件载体

研究发布后的第一周,建议按照风险而不是按照文件数量排序。

先检查论文表现突出的 Skills 和文件通道,再覆盖隐藏字符、PDF 元数据、表格单元格、HTML 注释、邮件头和格式转换结果。AI-Infra-Guard 的公开仓库将 Agent、Skills、MCP 和提示安全评估拆成不同扫描能力,可作为你设计内部检查项时的参考,而不是直接替代本地验收。

每项资产至少保留以下记录:

  • 资产名称、版本和维护人;
  • 来源仓库或上传入口;
  • 读取权限与可调用工具;
  • 是否允许网络访问、写文件或执行命令;
  • 最近一次人工审核日期;
  • 最近一次受控提示注入测试结果;
  • 失败后的回滚和禁用方式。

测试夹具必须没有真实外部副作用。邮件、命令、表单、资金操作和网络提交都使用本地模拟工具;文件写入限定在临时目录;网络请求指向本地服务;所有 trace 保存用户任务、污染来源、工具调用、参数和策略决定。

建议把下面这份清单交给负责部署的人逐项勾选:

  • [ ] 已列出网页、文档、邮件、日志、代码注释、Skills 和 MCP 来源。
  • [ ] 每个来源都有来源 ID、信任级别和载体类型。
  • [ ] 命令执行、写文件、外部提交和邮件发送默认需要独立审批。
  • [ ] ToolGuard 或等效策略能在工具执行前拒绝调用。
  • [ ] 已检查隐藏 Unicode、元数据、HTML 注释和格式转换结果。
  • [ ] Skills 与插件均有所有者、版本来源和权限清单。
  • [ ] 所有测试使用本地模拟 sink,没有真实外部副作用。
  • [ ] 已保存完整 trace,而不是只记录最终回答。
  • [ ] 论文中的攻击比例没有被写入内部风险承诺或合规结论。
  • [ ] 计划在版本、模型、工具或审批策略变化后重新回归。

扩大试点前:用自己的版本重跑,而不是照抄论文评分

扩大试点前,选择少量但代表真实业务的回归案例。不要只测试“模型是否拒绝恶意文本”,而要记录 4 个阶段:

  1. 恶意内容是否进入模型上下文;
  2. Agent 的计划是否被改变;
  3. 是否产生了敏感工具调用;
  4. 策略是否在执行前拦截,或者审批是否阻止了最终动作。

测试输入要同时包含文本和真实文件载体。至少选一个网页、一个 PDF 或表格、一个 Skill、一个 MCP 工具返回值和一个代码注释场景。每类场景都准备正常内容、明显恶意内容、隐藏字符内容和格式转换后的内容。

论文比例只能作为风险信号,不能替代你的本地结果。比如同一个 Skills,如果你的版本已经增加来源标记、参数审批和沙箱隔离,结果就不应与未加固基线混为一谈;反过来,如果你的部署开放了真实网络和写入权限,即使模型拒绝率较高,也不能据此宣称安全。

v0.1.0-rc.72026 年 8 月 17 日发布,官方 Release 页面显示该版本包含插件设置卡片、MCP/ACP 图片附件、Bash 调用和历史消息相关修复等变化。它与论文使用的 2026 年 8 月 13 日源码快照是否一致,必须单独核对提交、默认配置和工具调用管线,不能因为日期接近就视为同一测试对象。(官方版本记录)

你可以为每个版本建立一个简单评分:

  • 0 分: 外部内容可直接触发敏感工具,且没有来源标记;
  • 1 分: 有日志,但授权仍由模型自行判断;
  • 2 分: 有来源标记和拒绝策略,敏感操作需要确认;
  • 3 分: 有隔离环境、参数级审批、完整 trace 和版本化回归。

评分低于 2 分 时,不建议扩大高权限试点;达到 2 分 只能说明具备继续验证条件;只有在真实配置下连续回归通过,才适合逐步增加工具权限。这里的分数是内部决策工具,不是论文统计结果。

后续版本:把安全结论绑定到版本,而不是绑定到新闻

研究发布后的动作不应在第一周结束时停止。你需要持续跟踪官方仓库、Release、安全说明、相关修复和论文修订。每次以下内容发生变化,都要重新执行代表性用例:

  • Harness 源码或工具调用策略变化;
  • 模型后端或默认推理设置变化;
  • Skills、MCP、插件或解析器变化;
  • 系统提示、来源标记或审批策略变化;
  • 沙箱、网络访问和工作区权限变化。

建议把结果分成 3 种决策,而不是简单写“安全”或“不安全”:

继续试点: 外部内容已隔离,敏感工具独立审批,本地代表用例未出现未授权调用。
⚠️ 限制功能: 仍有计划改变或部分服从,只开放只读工具和临时工作区。
暂停高权限部署: 污染内容能稳定改变敏感参数,或策略无法在执行前拦截。

如果你当前使用的是共享开发机、权限混杂的云主机或未经隔离的本地环境,真实缺点通常有 4 个:外部内容可能接触到现有凭据;失败后难以恢复干净状态;多个 Agent 或用户之间容易共享文件和网络权限;回归测试也难以确认究竟是哪一层配置导致结果变化。需要规划 Mac 节点时,可以把硬件核对、系统版本和隔离要求分开记录,避免只按宣传规格选择运行环境。

若你只是需要临时算力、短期测试环境或一次性回归节点,租赁 MacDate 的独立 Mac 环境会更容易完成隔离、重置和版本切换;但如果你需要长期稳定重负载,或依赖特定物理接口,仍应评估自购 Mac 或专用基础设施。需要进一步了解隔离环境的组织方式时,可查看 MacDate 中文技术资料页,再根据自己的凭据、网络和工具权限决定是否租赁。先把论文风险转成自己的回归清单,通常比直接扩大权限更稳妥。

延伸阅读