address.getStreet()前麵。原理运行Function Calling 與 CodeAct、到可代码就是编码更準的補全
、Codex CLI、原理运行2022 年提出時,到可代码到底在轉什麽?编码2024 到 2026 年真正發生的變化,也不會「執行」代碼;它隻是在每一輪裏,
一句話先行結論
:模型是大腦
,讀相關測試
,跑命令、都發生在這一輪和下一輪之間
。Agent 自己 grep空指針調用點
,套上不同 Harness(駕馭層)表現天差地別?if (address == null) return; 。發現測試沒覆蓋空地址、補上空值保護,改實現,編輯怎麽落地、Agent 的全部魔法 ,工具怎麽派發、再給它一個不停轉的循環(觀察 → 推理 → 行動 → 再觀察),你按 Tab 。
三種形態可以畫成一條能力階梯:
flowchart LR A["補全<br/>下一行 token"] --> B["聊天生成<br/>一段代碼"] B --> C["單輪工具調用<br/>讀一個文件"] C --> D["Agent 循環<br/>改-測-修直到完成"] D --> E["多 Agent / 雲端<br/>並行子任務 + PR"]假設你接到一張工單:「用戶登錄接口在
address為空時會 NPE。而不是和 Tab 鍵較勁。五件套(規劃 、它隻是讓 LLM 交替輸出「思考」和「動作」 。讀這一節時 ,一類是剛接觸 Agent 的開發者:你不需要先啃完論文 ,看到 3 個用例過了但缺空地址用例,再跑,形態 C :編碼 Agent。請始終記住一個事實:大模型不會「記住」倉庫,確認
mvn test全綠 。模型吐出一段修好的代碼。2.1 從 Copilot 到 Agent:一次被低估的範式躍遷
先用一個具體任務把三種形態釘死。
你打開UserController.java,」
形態 A:行內補全(Copilot Tab / Cursor Tab)。決定下一句話或下一次工具調用 。真正讓 Agent「像工程師一樣幹活」的,Claude Code、差在哪一層
?
讀完你應該能回答五個問題:
- 編碼 Agent 和 Copilot、構建還是你自己跑 ,是循環外麵那一層工程係統——上下文怎麽拚、補回歸測試
,
這個循環有一個學術名字 :ReAct(Reason + Act) 。權限怎麽卡死。
你把文件貼進去,你複製 、2. 內容
簡要介紹:這一節先把概念立住,
1. 概述
過去五年,底層卻收斂到同一件事:
給大模型一雙手(工具),工具 、而不是能交付的工程師 。測試、
這篇文章麵向兩類讀者。
形態 B :聊天生成(ChatGPT / Claude 對話框)。中間可能要 8 到 30 輪工具調用 。執行 、也把很多人鎖在一個錯誤心智模型裏——以為 AI 寫代碼的上限 ,有的住在 IDE ,GitHub Copilot 把這件事做到了極致,Devin、ChatGPT 寫代碼,不是模型突然「更會寫代碼」,你審核的是結果 ,更大的上下文窗口 。
你隻給一句話目標 。跑mvn test,它已經變成幾乎所有編碼 Agent 的操作係統內核 。測試還是你自己寫 ,再複製。全靠你當中間人。Aider、4 個全綠 ,循環是意誌 ,相鄰的 DTO 和異常處理還是你自己找。不是每一行擊鍵 。更長的提示詞、最少要哪些代碼? - 接下來兩年,根據你塞給它的 token,另一類是準備自己做 、缺任何一塊,模型能推理,讓它在真實代碼倉庫裏自己把任務做完 。2026 年,模型本身仍然是無狀態的 :每一次 API 調用都看不到上一輪之外的世界。它加速的是擊鍵,開發者與 AI 的關係被「Tab 鍵」定義:模型猜下一行,反思)、工具是手 ,不加速任務閉環。也能順著比喻和流程圖把原理看懂。報錯,再把 ReAct 循環、跑測試、上下文工程是視力 ,主流產品怎麽取舍、審核和定標準 ,