2026 LLM 發展到底發生了什麼?年中整理加我的評分
2026 LLM 年中快照:哪些是真的有感,哪些是在嘩眾取寵
> Meta Shift
先說結論:2026 是 coding agent 真正「能用」的元年,不是「可以玩」,是「能用在正式工作上」。
Simon Willison 在 WeAreDevelopers World Congress 的 closing keynote 做了一個年中整理,骨架很清楚,但他本人很克制,大部分都是陳述事實、不太給評價。我就來做他沒做的部分——哪些進展真的重要,哪些你可以先不用理。
2025 年我就一直在說 coding agent 還不夠穩,錯誤率太高,在 production 用反而會出事。但從 2025 年底的 Claude Opus 4.5 和 GPT-5.1 開始,這個判斷需要更新了。這兩個模型的出現,讓 Claude Code 和 Codex 從「demo 起來很帥、真的用很痛苦」跨過了一條線,變成「值得每天用」。
這條線很微妙,但很關鍵。
發生了什麼事
Simon 的整理以時間軸為主,從 2025 年 11 月開始算,幾個關鍵節點:
第一個節點:2025 年 11 月,模型跨門檻
Claude Opus 4.5 和 GPT-5.1 幾乎同時間發布。Simon 用他自己的 benchmark——「Generate an SVG of a pelican riding a bicycle」——來評估,這個 benchmark 很笨,但確實能看出 spatial reasoning 和 instruction following 的整合能力。結果是:兩個模型都還不完美(Claude 的腳踏車還是有問題),但整體代碼生成的可靠性,已經夠用在日常工作上了。(來源:Simon Willison 的 keynote slides)
Simon 自己說了,他原本每年的新年目標都是「stay focused, take on less」,2026 年他反過來說:「我要多接 project,讓 coding agent 幫我做。」這句話很有代表性,因為 Simon 是個非常謹慎的人,他不亂 hype。
第二個節點:一個叫「Warelay」的 GitHub repo
2025 年 11 月出現了第一個 commit。Simon 說「我們後面再來談這個」,但原始摘錄沒有後續內容,所以這部分的全貌我現在沒辦法給你。這裡先埋個記號,等完整 talk 出來再補。
第三個節點:開發者的年末假期效應
12 月假期,工程師開始用新模型亂搞。1 月回來,集體發現「欸這個真的不一樣了」。這種現象我很熟悉——當一個工具突然跨過 good enough 的門檻,第一波有感的永遠是個人開發者,因為他們沒有 org 的慣性阻力。
第四個節點:Agent security 成為主議題
Simon 提到,在這次的 277 場 sessions 裡,有大約 40 場觸及了 sandboxing 或 agent security。這個比例(約 14%)說明業界已經認真在處理 agent 進入 production 的風險問題,而不是繼續停留在「這東西很酷」的階段。(來源:WeAreDevelopers World Congress 議程統計)
為什麼 2026 是轉折點
我想從三個面向來拆解。
技術面:invisible threshold 的概念
Simon 講了一個我很認同的說法:模型改進不是線性的,而是會突然跨過「某條隱形的線」,讓某個能力從 broken 變成 usable。這讓我想到 2022 年的 Stable Diffusion 1.5 到 2.0 的那個跳躍——突然間生成的人手不再是噩夢,工作流開始可以建立在上面。
Coding agent 的這條線,核心問題不是模型夠不夠聰明,而是錯誤率和自我修正能力。一個 agent 如果完成一個 task 需要 20 步,每步錯誤率 10%,整體成功率只有 12%。但如果每步錯誤率降到 3%,整體成功率變成 54%——這已經是質變,不是量變。Claude Opus 4.5 和 GPT-5.1 大概就是在這個區間發生了跳升。
商業面:誰出錢、誰受益
這一波 coding agent 的爆發,背後有一個很清楚的商業邏輯:Anthropic 和 OpenAI 都在用 Claude Code / Codex 搶 B2B 企業客戶,這是比 chatbot subscription 更高 ARPU 的市場。每個工程師每個月花 20 美元訂 ChatGPT 是 consumer,但一個 enterprise 買 500 個 Claude Code seat 就是完全不同的量級。
這也解釋了為什麼兩家公司幾乎同時發布能用的 coding agent——不是巧合,是競爭節奏逼出來的。
值得注意的是,Simon 在 2026 年初的預測裡提到了一個沒發生的 Challenger disaster——他擔心 coding agent 會被 hijack、造成真實世界的經濟損害。這件事還沒發生,但業界顯然很認真看待這個風險,所以 14% 的 sessions 在談 sandboxing。從投資者的角度來看,agent security 這個賽道現在非常值得盯,它的市場需求是剛性的,而且隨著 agent 滲透率上升,問題只會更嚴重,不會更少。
工程師行為面:plumber 心態的興起
Simon 說他決定「多接 project,用 coding agent 做」,這個心態轉變很重要。過去寫 code 的瓶頸是腦力和時間,現在的瓶頸開始轉向「你敢不敢想一個夠大的問題」和「你有沒有能力 review agent 產出的結果」。
這跟電競的 meta 轉換很像。以前打 WoW Arena 你要自己每個 GCD 都精確操作,現在如果有工具幫你 handle 一半的 rotation,你的精力就要放在 positioning 和 decision-making 上。底層技術不消失,但焦點轉移了。
Meta 判讀
判定:Meta Shift
原因很明確:coding agent 從 experimental 到 daily driver 這個轉變,會根本改變工程師的工作方式。不是「你可以用 AI 輔助」,而是「不用 AI 的人生產速度會差很多」。
這不是在說工程師要被取代。恰恰相反——會用 coding agent 的工程師,能做的事情範圍會大幅擴張。Simon 自己就是例子:他今年多接了很多 project,以前這樣做會 burn out,現在他在看能做到哪裡。
但有兩個地方我覺得被過度炒作了:
第一,「AI 完全自主寫 production code」這個敘事還是太超前。現在的 coding agent 需要工程師在旁邊 review、糾錯、定方向。它更像一個很快、但需要 senior 帶的 junior dev,而不是一個可以放著讓他自己跑的 system。
第二,multimodal 的進展。雖然 Simon 提到了,但在實際工作中,我還沒有在工程 workflow 裡看到足以改變工作流的 multimodal use case。圖生圖、影片生成這些在 creative 領域很有感,在軟體工程裡目前還是邊緣角色。
我的建議
如果你是工程師,現在應該做這幾件事:
馬上做:把 Claude Code 或 Codex 真的用進日常工作
不是玩玩,是真的找一個你正在做的 task 讓它跑。評估的指標很簡單:這個任務,如果自己做要花幾小時,用 agent 做要花多久?如果差距超過 3 倍,你的工作流就值得重構。
建立你自己的評估 benchmark
Simon 的 pelican benchmark 很笨,但它有效,因為它是他熟悉的測試。你應該有自己的測試題——你熟悉的 domain 裡,LLM 容易在哪裡出錯?不要只靠別人的評測結果做判斷,自己跑一輪。
現在不需要做:深入學某個特定的 agent framework
LangChain、CrewAI、這些框架現在還在快速變動,進入壁壘很低但 churn 也很高。除非你要做 agent infra 本人,不然先觀望,等 interface 穩定再學。
值得盯的方向:agent security 和 sandboxing
這個問題的解法還沒有 winner。如果你在找接下來一兩年的技術投資方向,這裡有真實的市場需求,而且問題確實很難。277 場 sessions 裡有 40 場在講這個,不是沒有原因的。
2026 年還沒結束,Simon 說「year isn't over yet」,我也這樣覺得。下半年能不能有更大的 breakthrough,現在還很難說。但到目前為止,這一年的進展是真的有感的,不是在炒作。
延伸閱讀
Waiting7777
WoW Arena 冠軍轉前端,用電競 meta 思維拆解技術趨勢。
相關文章
LLM開源+40.8B、30ms、在家就能跑 自練 decision model
從這個 GitHub 專案出發,聊「在家訓練自己的小模型」這件事的技術門檻現在降到哪裡了,以及 decision model 這個方向對開發者有什麼實際應用價值。
2026年10月2日 · HW SHU · 8 分鐘閱讀
繼續閱讀 →
GitHub CopilotAI Agents+5GitHub 用 AI 自動跑 fuzzing — 資安測試要被取代了嗎?
AI 做 fuzzing 這件事的意義不只是「測試更快」,而是把過去需要資安專家才能做的事民主化了。拆解 Taskflow Agent 的工作流程,評估它實際上能取代多少人工、局限在哪。
2026年9月25日 · Waiting7777 · 7 分鐘閱讀
繼續閱讀 →
GPTAI+2AI 第三時代:「永遠在線的 AI 同事」這個概念是真的嗎?
從「AI 同事」這個框架切入,評估這個概念是真實趨勢還是產品行銷話術 — 什麼樣的工作場景真的需要 persistent AI,什麼場景還是用工具就夠了。
2026年9月20日 · Waiting7777 · 7 分鐘閱讀
繼續閱讀 →這篇文章對你有幫助嗎?
每週一篇 — 技術趨勢背後的商業邏輯
AI 產業在變什麼、工程師該注意什麼——拆清楚寄到你的信箱。