1. 概述
過去五年
,原理运行更大的到可代码上下文窗口。確認 mvn test全綠 。编码構建還是原理运行你自己跑,也把很多人鎖在一個錯誤心智模型裏——以為 AI 寫代碼的到可代码上限,Agent 自己 grep空指針調用點,编码而不是原理运行和 Tab 鍵較勁。安全沙箱是到可代码良心 。或準備把現有工具用到極限的工程師 :你會看到生產級架構怎麽分層、是循環外麵那一層工程係統——上下文怎麽拚、編輯怎麽落地、跑命令 、它隻是讓 LLM 交替輸出「思考」和「動作」
。就是更準的補全 、Claude Code 、決定下一句話或下一次工具調用。倉庫、
這個循環有一個學術名字:ReAct(Reason + Act)。測試還是你自己寫 ,差在哪一層 ?
給大模型一雙手(工具) ,以及一份可以直接跑的實現 。請始終記住一個事實 :大模型不會「記住」倉庫,再複製。而不是能交付的工程師 。報錯,不是模型突然「更會寫代碼」,再補測試,根據你塞給它的 token,再把 ReAct 循環、主流產品怎麽取舍、
形態 C :編碼 Agent。再把原理拆開 。Cline 這些工具表麵長得不一樣:有的住在終端,更長的提示詞 、執行、2026 年 ,
2024 到 2026 年真正發生的變化 ,」
形態 A:行內補全(Copilot Tab / Cursor Tab)
。循環是意誌
,上下文工程是視力 ,有的住在 IDE,ChatGPT 寫代碼,再回去問模型、工具 、
你打開 UserController.java,模型猜出 if (address == null) return; 。
形態 B:聊天生成(ChatGPT / Claude 對話框)。也不會「執行」代碼;它隻是在每一輪裏,但沒有手 。模型吐出一段修好的代碼 。Codex CLI 、有的住在雲端虛擬機 。不是每一行擊鍵。發現測試沒覆蓋空地址 、
這篇文章麵向兩類讀者。測試 、你複製 、另一類是準備自己做 、補回歸測試,
三種形態可以畫成一條能力階梯 :
flowchart LR A["補全<br/>下一行 token"] --> B["聊天生成<br/>一段代碼"] B --> C["單輪工具調用<br/>讀一個文件"] C --> D["Agent 循環<br/>改-測-修直到完成"] D --> E["多 Agent / 雲端<br/>並行子任務 + PR"]審核和定標準,權限怎麽卡死。最少要哪些代碼?讀完你應該能回答五個問題:
- 編碼 Agent 和 Copilot
、先用三個日常場景區分「補全 / 聊天寫代碼 / 編碼 Agent」,再給它一個不停轉的循環(觀察 → 推理 → 行動 → 再觀察),Devin、你得到的都隻是會說話的補全
,讀相關測試
,模型能推理,
2. 內容
簡要介紹 :這一節先把概念立住 ,Aider、再跑,讀這一節時,Agent 的全部魔法 ,
2.1 從 Copilot 到 Agent :一次被低估的範式躍遷
先用一個具體任務把三種形態釘死 。
你隻給一句話目標。而是產品形態從生成器變成了執行器 。你審核的是結果,Function Calling 與 CodeAct 、Cursor Agent、到底在轉什麽 ? - 為什麽同樣一個模型
,GitHub Copilot 把這件事做到了極致,假設你接到一張工單
:
「用戶登錄接口在
address為空時會 NPE。粘貼、
一句話先行結論 :模型是大腦
,不加速任務閉環
。跑 mvn test,中間可能要 8 到 30 輪工具調用。
你把文件貼進去,看到 3 個用例過了但缺空地址用例 ,它加速的是擊鍵
,光標停在 address.getStreet()前麵。2022 年提出時,最後給出 diff 或直接開 PR。模型本身仍然是無狀態的:每一次 API 調用都看不到上一輪之外的世界
。記憶、上下文工程
、都發生在這一輪和下一輪之間
。跑測試、工具是手,真正讓 Agent「像工程師一樣幹活」的,全靠你當中間人
。五件套(規劃
、