OpenAI 怎麼監控內部 coding agent 不亂來 — 拆解他們的做法
OpenAI 怎麼知道他們的 Coding Agent 偷偷幹了壞事?
> Meta Shift
開場
你有沒有認真想過一個問題:你叫 agent 幫你改 code,它做完了,但你怎麼知道它只做了你叫它做的事?
這不是科幻小說的情節。當 agent 有能力呼叫 API、寫入資料庫、執行 shell command,它就已經是一個有實際破壞力的東西了。更麻煩的是,大部分人用 agent 的方式是「貼問題 → 等結果 → 複製貼上」,根本沒有在看中間發生了什麼。
OpenAI 最近分享了他們內部是怎麼監控自家 coding agent 的 misalignment 行為的。這個主題很少有人公開講,因為大部分公司的 agent 還在「能動就好」的階段,沒人認真想過監控這件事。但 OpenAI 有動機想清楚 — 他們的 agent 規模夠大,出一個問題影響夠廣,而且他們同時在賣 agent 產品又在研究 alignment,兩條線不能打架。
這篇就來拆解他們怎麼做的,對實際在用或打算開發 agent 的工程師來說,這個框架值得認真看。
架構概覽
OpenAI 的 coding agent 監控系統,核心解決的問題是:agent 在執行任務的過程中,如何即時偵測它是否做了「不符合預期」的行為。
這裡「misalignment」的定義比你想的更具體,不是「AI 覺醒要反抗人類」那種哲學問題,而是工程層面的偏差行為,例如:
- agent 修改了不該碰的檔案
- agent 呼叫了超出任務範圍的 API
- agent 在沒有明確指示下執行了刪除或覆寫操作
- agent 試圖繞過某些工具的限制
整個監控架構大致分三層:
┌─────────────────────────────────┐
│ Task Specification │ ← 使用者的指令 + 期望邊界
└────────────────┬────────────────┘
│
┌────────────────▼────────────────┐
│ Agent Runtime │ ← agent 執行層,tool calls 在這發生
│ ┌─────────────────────────┐ │
│ │ Tool Call Interceptor │ │ ← 每一個 tool call 都被記錄
│ └─────────────────────────┘ │
└────────────────┬────────────────┘
│
┌────────────────▼────────────────┐
│ Behavior Monitor Layer │ ← 獨立的監控系統,非 agent 本身
│ ┌──────────┐ ┌─────────────┐ │
│ │ Policy │ │ Anomaly │ │
│ │ Checker │ │ Detector │ │
│ └──────────┘ └─────────────┘ │
└────────────────┬────────────────┘
│
Alert / Intervention
關鍵設計原則是:監控系統跟 agent 本身是分離的。這不是讓 agent 自我審查,而是一個獨立的 observer 在旁邊盯著它。
資料流的方向是單向的 — agent 執行,monitor 記錄分析,必要時才介入。不是讓 monitor 去影響 agent 的決策過程,這樣可以避免 monitor 本身成為攻擊面。
核心機制深入
1. Tool Call Tracing — 把每一個動作都記下來
最基礎也最重要的機制是 tool call tracing。
Agent 的所有行為最終都會收斂到 tool call,不管是讀檔、寫檔、呼叫 API、執行 command,都是一個 function call。OpenAI 的做法是在這一層加一個 interceptor,每一個 tool call 都會被記錄成一筆事件,包含:
- tool 名稱
- 輸入參數
- 時間戳記
- 執行結果
- 在整個任務 trace 裡的位置
這個 trace 最後會形成一個完整的 execution graph,你可以清楚看到 agent 在這個任務裡做了什麼、照什麼順序做的、每一步的結果是什麼。
為什麼這樣設計?
因為 LLM 的行為是不透明的,你沒辦法從模型權重裡知道它「準備要做什麼」,但你可以從它的 tool call 序列裡知道它「做了什麼」。這是目前最可靠的觀測點。
Trade-off:
記錄所有 tool call 有 overhead,尤其是長任務。而且這個 trace 本身如果包含敏感資訊(API key、使用者資料),就變成另一個要保護的東西。OpenAI 據報導對 trace 資料有做 redaction 和存取控制,但具體細節沒有完全公開。
Waiting7777
WoW Arena 冠軍轉前端,用電競 meta 思維拆解技術趨勢。
這篇文章對你有幫助嗎?
每週一篇 — 技術趨勢背後的商業邏輯
AI 產業在變什麼、工程師該注意什麼——拆清楚寄到你的信箱。


