2026 DeepSeek Harness 提示注入研究發布後該做什麼?

2026 DeepSeek Harness 提示注入研究發布後該做什麼?

症狀:Agent 讀完網頁、檔案或 Skills 後,開始提出原本任務沒有要求的命令、寄信或外部提交。

最快解法:立即收緊外部內容到敏感工具的路徑,但不要把論文中的成功率當成所有 DeepSeek Harness 部署的通用漏洞率。 第一週先隔離不可信來源、獨立審批敏感操作、複查 Skills 與整合來源,再用你自己的版本和設定重跑代表性案例。

誰該看這篇:

  • Agent 開發者:讓 Harness 讀取網頁、文件、日誌或程式碼註解後繼續呼叫工具。
  • 安全工程師:需要把論文結果轉成可執行的來源到敏感操作控制。
  • 技術負責人:需要決定繼續試點、限制範圍,還是暫緩高權限上線。

最後更新於 2026 年 8 月 19 日;日期、版本與研究數字核對自 arXiv 研究頁面與正文DeepSeek Harness 官方儲存庫官方 Release 清單AI-Infra-Guard 公開復現程式碼論文版本頁面

研究警報 vs 上線結論:先分清楚論文測試了什麼

這篇 DeepSeek Harness 提示注入研究不是一般聊天機器人的單句越獄測試,而是針對 Agent 從外部內容讀取資料,再決定是否呼叫敏感工具的來源到目的地路徑。研究於 2026 年 8 月 17 日提交,測試的是 2026 年 8 月 13 日特定 DeepSeek Harness 程式碼快照、特定模型後端、特定 Agent 人格與未啟用額外提示強化的基線設定。這些日期和測試邊界均以論文版本記錄為準,不能用後續 Release 名稱取代。

研究以 AI-Infra-Guard 建立受控測試,涵蓋 14,560 次執行、16 個間接內容通道、文字與檔案兩種載體、35 個攻擊目標,以及未修改基線和 12 種攻擊方法。外部內容來源包括網頁、文件、電子郵件、聊天訊息、程式碼註解、日誌、Skills、試算表、PDF 中繼資料和隱藏 Unicode。這些數字不是本站實測,而是論文正文描述的研究條件。

但敏感工具是本地模擬夾具。記錄到的寄信、命令、表單提交或資金轉移,只代表 Agent 嘗試呼叫工具,不是真實寄信、執行 Shell、轉帳或連線到外部端點。這是最重要的解讀邊界:研究記錄的是受控環境中的行為,不是實際業務損失。

DeepSeek Harness 提示注入研究說明它不安全嗎?

它足以說明:只要你的部署允許外部內容進入模型可見上下文,並讓模型自行決定後續敏感工具,這條路徑就應被視為高風險。它不足以證明所有 DeepSeek Harness 版本、模型後端、工具清單和審批設定都具有相同風險。

以研究中的結果來看,規則評估器判定完整成功率為 5.6%,語意評估器判定為 5.3%;若把完整成功與部分遵從合併,兩者分別為 7.6%12.6%。這些數字是受控基線下的描述性結果,不是你的部署預測值,來源為論文的評估結果

發布當日:研究數字 vs 你的實際風險

發布當日不要先問「要不要全面停用 Harness」,先問四件事:

  1. 研究使用的程式碼提交是否就是你目前執行的提交。
  2. 你使用的模型後端、Agent 人格與提示設定是否一致。
  3. 研究中的來源通道和你的實際輸入是否重疊。
  4. 研究中的模擬目的地,是否對應你環境裡的真實高權限工具。

你應把風險拆成三段,而不是只看模型是否「拒絕提示注入」:

  • 來源段:網頁、文件、郵件、日誌、Skills、MCP 回傳值或程式碼註解是否可能被攻擊者控制。
  • 上下文段:工具結果是否被直接追加到模型對話,是否保留來源、信任等級和載體類型。
  • 工具段:模型是否能直接執行命令、修改檔案、發送外部請求或提交交易。

研究指出,DeepSeek Harness 的工具結果可以進入工作階段,而結果附帶的額外上下文也可能被接受到模型可見輸入。這不代表介面本身已被證明有缺陷,而是表示部署者必須在工具執行前、審批處和沙箱邊界放置獨立控制。工具註冊與執行架構可再對照官方儲存庫的程式碼說明

論文中的攻擊成功率能不能套到自己的部署?

不能直接套用。你可以把它當成風險排序訊號,不能當成服務等級指標或漏洞率。只要模型、程式碼提交、工具權限、載體解析方式或審批策略不同,結果就可能改變。

研究本身也顯示載體表示方式會影響結果:檔案模式的規則完整成功率為 6.2%,文字模式為 5.1%;檔案模式記錄到 387 次目的地工具呼叫,文字模式為 254 次。因此只用純文字複製內容測試,可能漏掉格式解析、中繼資料、編碼和隱藏字元造成的風險。這些比較數字來自同一份研究的載體分析。

第一天:全面停用 vs 先凍結跨邊界自動執行

第一天的正確動作不是把所有 DeepSeek Harness 任務停掉,而是先取消「不需要人工確認的跨邊界自動執行」。讀取與分析任務可以保留;命令執行、檔案寫入、外部提交、權限變更、寄信和資金相關動作先改成拒絕或人工核准。

你可以用以下對照方式設定臨時限制:

  • 網頁、郵件、外部文件 → Shell、外部 HTTP、寄信:預設拒絕
  • 本地受控專案檔案 → 測試目錄寫入:可以保留,但限縮路徑並記錄差異。
  • 未審查 Skills 或 MCP → 任何高權限工具:先停用
  • 已標記來源、由內部維護的固定規格 → 模擬工具:可進入低風險試點。
  • 任何涉及真實外部副作用的工具:要求獨立審批,不接受模型自行判斷「這項操作安全」。

這個限制要放在工具授權邏輯,而不是只新增一段系統提示。你應在工具註冊、工具執行前掛鉤、審批器和沙箱邊界分別記錄與阻擋高風險操作。版本變更則應持續核對官方 Release 的提交、權限預設和工具管線。

前三天:模型判斷 vs 獨立審批

第三天前,你至少要讓每個外部內容帶著三項標記走完整條路徑:

  • 來源:哪個網頁、檔案、郵件、Skill 或 MCP 服務提供。
  • 信任等級:內部維護、已審查第三方、未知外部或使用者上傳。
  • 載體類型:HTML、PDF、郵件標頭、Markdown、試算表、純文字或中繼資料。

當內容影響到敏感工具時,審批器要檢查實際工具名稱、引數、目的地、檔案路徑和來源信任等級。不能只顯示「Agent 想執行命令」,而要顯示「哪一份外部文件進入上下文後,導致它提出哪一個命令」。

Skills 和網頁內容為什麼會影響敏感工具呼叫?

因為它們不只是被動參考資料。網頁內容可能被工具結果帶回;Skill 可能包含可重用的工作流程、工具描述或操作規則;MCP 整合則可能改變可用工具和回傳資料格式。當這些內容進入模型可見上下文,模型的計畫和下一個工具選擇就可能受到影響。

研究中的 Skills 通道在規則評估器下,文字模式完整成功率為 14.3%,檔案模式為 16.0%。隱藏 Unicode 在文字模式是 0.0%,但檔案模式達 25.5%,正好說明格式和解析路徑不能被純文字測試取代。以上數字均來自研究中的通道與載體分析。

因此,系統提示裡的「外部內容只是資料」警告不能當成唯一防線。你需要在內容正規化、來源標記、工具授權和人工審批各放一道控制。

第一週:只讀取研究結果 vs 真的重跑代表用例

第一週優先複查 Skills、外掛、MCP 連線和檔案載體。建立一份資產清單,至少包含:

  • 資產所有者與維護團隊。
  • 來源儲存庫、版本或提交識別碼。
  • 可讀取的資料範圍。
  • 可呼叫的工具與權限。
  • 是否能寫入檔案、執行命令或連線外部服務。
  • 最近一次安全審查和回退方式。

測試時不要使用真實客戶檔案、真實郵件或真實外部端點。建立隔離夾具,讓目的地工具只記錄名稱和引數。這樣你可以觀察 Agent 是否走到敏感操作邊界,又不會把回歸測試變成真正的寄信、刪檔或提交。

你可以在擴大試點前完成以下可勾選清單:

  • [ ] 固定目前 DeepSeek Harness 的提交、模型後端、Agent 設定與工具清單。
  • [ ] 為網頁、文件、郵件、Skills、MCP 和程式碼註解各準備一個受控惡意樣本。
  • [ ] 同時測試純文字與原始檔案格式,包含中繼資料、格式轉換和隱藏字元。
  • [ ] 為命令、寫檔、外部提交和寄信建立不具外部副作用的模擬目的地。
  • [ ] 記錄惡意內容是否進入上下文、是否改變計畫、是否觸發工具、是否被政策攔截。
  • [ ] 將規則判定和語意判定分開保存,保留完整工作階段追蹤。
  • [ ] 對每次提示、工具、Skill、MCP 或模型版本變更重新執行代表案例。
  • [ ] 未通過來源標記、獨立審批或沙箱檢查前,不擴大高權限試點。

若你需要把回歸環境放到獨立的雲端 Mac 節點,應先確認工作區、工具權限、測試資料和真實專案完全分離,再選擇合適的執行環境。隔離環境的價值不在於自動修復提示注入,而在於讓測試資料、工具權限和真實工作區分開;需要比較硬體規格和成本時,可先參考繁體中文 Mac mini M4 方案指南

如果你的團隊需要先整理整體驗收流程,可把這份清單和繁體中文安全驗收內容一起納入內部審查文件;相關的工作區與執行環境說明可在繁體中文內容索引中查找。站內資料只能協助你安排隔離與執行環境,不能取代對 Harness 版本、工具政策和提示注入結果的本地驗證。

擴大試點前:版本標籤 vs 可重現配置

如果你使用的是 v0.1.0-rc.7,不要只因為版本標籤相同,就認定它和論文測試快照一致。你要逐項核對官方 Release 的提交、發布日期、預設權限、工具呼叫管線、Skills 載入方式和模型設定,再判斷是否需要重跑全部案例或只重跑受影響的切片。

研究使用的是 2026 年 8 月 13 日提交快照;論文則於 2026 年 8 月 17 日提交。這兩個日期不能被簡化成「同一版本的安全報告」。你應保留版本差異,並為每次回歸記錄:

  • 版本提交與依賴版本。
  • 工具註冊方式和授權策略。
  • 外部內容的解析器與正規化方式。
  • 模型後端和 Agent 人格。
  • 研究案例在本地的完整、部分和未觸發結果。

若你的真實配置中,外部內容只進入唯讀分析工具,且所有敏感操作都需要人工核准,可以考慮繼續小規模試點。若來源標記缺失、Skills 未審查、工具可直接連線外部服務,或審批仍由模型自行決定,就應限制功能或暫緩高權限部署。

後續版本:重寫新聞 vs 持續更新控制結論

這篇 DeepSeek Harness 提示注入研究不應只被當成一次性新聞。你要追蹤官方 Release、安全公告、研究修訂、公開復現程式碼和工具呼叫架構變化。每次 Harness 的提示邊界、Skills 載入、MCP 整合、ToolGuard、工具政策或預設權限改變,都要更新原有回歸清單。

DeepSeek Harness 使用者現在應暫停哪些任務?

先暫停四類任務:讀取不可信網頁後自動執行命令、讀取外部文件後直接寄信或提交表單、載入未審查 Skills 或 MCP 後使用高權限工具,以及把真實客戶資料放入尚未完成隔離的回歸環境。單純的本地唯讀分析、無外部副作用的測試和人工逐項核准流程,不必因論文比例而全部停止。

編輯判斷評分如下:

  • 外部內容直接連到敏感工具:高風險,5/5
  • Skills、MCP 未有所有者和版本審查:高風險,4/5
  • 只有系統提示、沒有獨立審批:高風險,4/5
  • 已有來源標記、工具白名單、隔離夾具和人工審批:中低風險,2/5
  • 純唯讀任務、無真實外部副作用:較低風險,1/5

如果你目前把所有內容讀取、工具執行和工作區寫入放在同一個長期運作環境,問題通常不只是提示詞,而是權限邊界、稽核追蹤和回退成本。與其直接在既有工作區反覆試錯,不如先使用獨立的 Mac 執行環境完成版本化回歸;若要長時間保留固定配置,再根據資料敏感度、外部連線需求和工具權限選擇自建或租用方案。

研究給你的最佳行動不是「永遠停用 DeepSeek Harness」,也不是「看到成功率就照單全收」,而是把外部內容和敏感工具拆開,讓授權不依賴模型自行判斷,再在自己的版本和配置上取得可重現結果。這樣你才有足夠證據決定繼續試點、限制功能,還是暫緩高權限上線。

延伸閱讀