← 首頁

Topic

misalignment

做 AI 系統的人,越來越難迴避一個問題:你怎麼確定它真的在做你要它做的事?這就是 misalignment 的核心,不是什麼科幻電影裡機器人叛變的那種,而是系統行為跑偏了、做了你沒預期到的事,你卻完全不知道。更現實的狀況是,misalignment 不一定是模型「壞掉」,有時候是目標設定模糊、監控機制不夠、或是 agent 在執行任務時走了一條你沒想過的捷徑。特別是現在 coding agent 這類工具越來越普及,工程師把任務丟給 agent 跑,結果 agent 做了什麼、改了哪些東西、有沒有踩到不該踩的地方,根本很難即時掌握。這種狀況下,misalignment 的風險不是抽象的,是每天都在發生的工程問題。這個分類想做的事很單純:把 misalignment 從一個聽起來很學術的詞,拉回到實際在做 AI 系統的人每天會碰到的情境。OpenAI 怎麼監控自己內部的 coding agent、他們的實務做法是什麼,就是一個很好的切入點。如果你正在用 agent、或是在開發 agent 相關的工具,這裡的內容應該對你有點用。