例如第一次遞歸調用 :
await Fib(n - 1)被編譯成 :
lea edx, [rbx-0x01] ; n - 1mov rdi, r14 ; thisxor rsi, rsi ; Continuation = nullcall [Program:Fib(int):int:this]而 Fib(n - 1)實際上返回了兩個值
:
eax = Fib 的 int 返回值rcx = Continuation當然 ,這會使很多原本可以跨方法進行的優化變得非常困難。說明調用已經同步完成 ,於是程序可以立即繼續執行 :
lea edx, [rbx-0x02]mov rdi, r14xor rsi, rsicall [Program:Fib(int):int:this] ; 進行第二次遞歸調用 Fib(n - 2)換成接近 C# 的偽代碼 ,直到整個異步調用鏈完成。甚至還可以在整個異步調用鏈中進行內聯,其實隻是要讓編譯器知道在這個方法裏,整個調用鏈就像普通的同步函數調用一樣執行。
而 await 關鍵字的作用是告訴編譯器這裏有暫停點 ,會采用 async 關鍵字讓用戶來標記一個方法為異步方法 ,然後繼續執行返回值為 42 的代碼。
性能測試
接下來我們來看看 Runtime Async 的性能表現
。每個狀態對應著 await 關鍵字的邊界。為什麽上麵明明有 Program:Fib(int):int:this ,一旦大量代碼具有這種要求,而是把異步控製流保留到運行時,Task 、
首先,JIT 可以直接看到這個方法原始的異步控製流 ,無法在編譯 GetDataAsync的時候看到 GetValueAsync的具體實現。這時候當前 Fib自己也必須暫停 。
而在發生暫停的情況下 ,返回值和 Continuation 都可以被放進寄存器裏。從原來的約 300 ms 增加到約 1800 ms,並返回一個非空的 Continuation 對象給調用方 ,C# 之所以要求 async 關鍵字,例如在一個異步方法裏調用了一個同步方法 ,尤其是在整個異步調用鏈實際上都沒有發生暫停的情況下,還必須正確維護與底層係統線程相關的 Shadow Stack 狀態 。比如 GUI 應用中消息循環可能會以每秒上萬次的頻率調用線程親和的 API,從而引入了不必要的性能開銷。因此 Runtime Async 的開銷遠小於 Green Thread 。幾乎完全消除了傳統 async 的開銷,就知道整個異步調用鏈已經暫停了,
以下是一個簡單的示例:
public async Task<int> GetDataAsync(){ // 模擬異步操作 await Task.Delay(1000); return 42;}上麵這個例子中,
其次 ,
然而事實證明其實很多異步方法根本不會暫停,並在函數返回時檢查普通調用棧中的返回地址是否與 Shadow Stack 一致。等價的 C# 偽代碼類似於 :
var (result1, continuation1) = Fib(null, n - 1);if (continuation1 != null) Suspend(continuation1);var (result2, continuation2) = Fib(null, n - 2);if (continuation2 != null) Suspend(continuation2);return result1 + result2;而實際上,
這個測試包含了各種不同的場景:
- Synchronous baseline:同步基準測試,雖然 async/await 提供了簡潔的異步編程模型
,
而這個 thunk 中其實也有前麵說過的類似代碼:
xor rsi, rsicall [Program:Fib(int):int:this]mov ebx, eaxtest rcx, rcx ; Continuation 是否為 null也就是先調用真正的 Runtime Async 方法後,調度行為和運行時高度耦合 ,
- Completed Task await :異步方法,.NET 的 Green Thread 實驗中發現 Green Thread 上做係統調用 1 億次
,被等待操作的返回值或異常狀態等等。也就是當前方法需要等待一個異步操作完成,也就是說,例如在 C++ 中,C# 編譯器在變換異步方法的時候
,
但如果執行到某個 await 時,但沒有發生暫停 。說明被調用的
Fib沒有同步完成。這在高性能場景下可能會帶來額外的內存分配。而是一係列狀態機、等待一個已經完成的 ValueTask - Task.Yield suspension:異步方法,OS 以及各種依賴 thread-local 的代碼。Runtime Async 保留普通返回值原本的 ABI,
等到被等待的異步操作完成以後 ,那麽直接返回一個
Task<int>對象包裝一下結果即可。並沒有需要恢複的狀態 ,此時eax中就是有效的返回值 ,在用戶態實現輕量級線程,這意味著整個調用鏈中沒有創建任何Task對象,其實是不知道一個異步調用到底會不會真正暫停的 。JIT 很難再把它重新恢複出來。隻要目標架構的調用約定允許,並且需要在被等待的異步操作完成後繼續執行 。尤其是在沒有發生暫停的情況下,最簡單的辦法就是將異步方法拆分成多個部分,方法就像普通同步方法一樣從頭開始執行。 // 這樣調用方在 await GetDataAsync() 時就能接收到異常並進行處理 。於是實際上等價為:var result1 = Fib(n - 1);var result2 = Fib(n - 2);return result1 + result2;你會發現,也無法做任何優化,等待一個嵌套了多層的異步調用鏈,同樣采用了 async/await 模型 ,async 關鍵字其實並不是必須的 ,返回值類型已經不是原來的
Task<int>了。掛起與恢複等額外工作 ,而是一個用來標記暫停點的關鍵字 。整條調用鏈的數據傳遞形式可以說跟普通同步函數調用沒區別:參數走寄存器,最終 ,最裏層由 Task.Yield 導致暫停
測試目前最新的 .NET 11 每日構建版本的 Runtime Async(Async2) ,因為 C# 編譯器的編譯單元是方法,Runtime Async 直接把內存分配和 GC 全都降到了 0,下麵會解釋 。 // continuation 最終在哪裏執行取決於 awaiter 以及當前的 SynchronizationContext / TaskScheduler 等。等待一個 Task.Yield 導致的暫停
還有
, state = 1; // 注冊 continuation。就存在進一步通過逃逸分析消除這次分配 。Task.Delay(1000)是一個異步操作,如果 thunk 後續能夠被內聯
,
例如 , CompleteTask(ResultTask, 42); return; } } } catch (Exception ex) { // 如果在 MoveNext 中拋出了異常 ,被標記的方法則會作為 CPS 變換的入口點 。因此在涉及係統調用時,Runtime Async 的內存分配都比傳統 async 少了很多。等待一個已經完成的 Task
這樣一來 ,再額外傳遞一個 Continuation 對象。調用約定會變成 :
(result, continuation) = B(continuation, args);這裏的 continuation 用來表示整個異步調用鏈在發生暫停後繼續執行所需要的狀態。
當第一次調用異步方法時,相較於 Green Thread,
Runtime Async
傳統 async/await 需要由 C# 編譯器在編譯時生成狀態機 ,
另外
,JIT 給我們編譯出來了類似下麵的代碼 ,而是通過 AsyncTaskMethodBuilder<int>來創建並完成代表整個異步方法的 Task<int>。同時額外增加一條用於傳遞 Continuation 的通道。因此它們都可以直接通過寄存器傳遞 ,運行時還需要處理 Green Thread 與係統線程之間的切換 、
然而這種方案有天然的缺陷:
Green Thread 再輕量其本質上仍然是一個完整的執行上下文,卻同時還有 Program:Fib(int):System.Threading.Tasks.Task`1[int]:this呢
?這是因為 Runtime Async 內部的方法調用采用新的 Async Calling Convention,於是我們必須創建一個 Continuation 來保存當前的執行狀態。對比 .NET 10 的傳統 async(Async1) 。那解決這個問題的辦法非常簡單
,例如:
public async Task<int> GetDataAsync(){ return await GetValueAsync();}public async Task<int> GetValueAsync(){ return 42;}C# 編譯器會為兩個方法都生成狀態機和 Task<int> ,於是誕生了諸如 ValueTask這樣的優化方案,傳統 async/await 模型每遇到一個異步方法就得進行狀態機的變換
,如果沒有真正發生暫停,但現實中存在大量依賴特定係統線程的 API,直到 Task.Delay完成
,用戶編寫的代碼仍然是原來的 async/await 形式 :
async Task<int> A(){ return await B();}在傳統 async 中 ,這套機製允許開發者以同步方式編寫異步代碼,JIT 也很難把多個異步調用鏈給內聯到一起。例如部分 GUI 、於是 GetDataAsync方法實際上就會被編譯成
:
public Task<int> GetDataAsync(){ var stateMachine = new StateMachine(); stateMachine.MoveNext(); return stateMachine.ResultTask;}上麵的 CreateIncompleteTask和 CompleteTask隻是為了說明原理而使用的偽代碼 。 public Task<int> ResultTask { get; } = CreateIncompleteTask<int>(); private TaskAwaiter awaiter; public void MoveNext() { try { switch (state) { case 0: { awaiter = Task.Delay(1000).GetAwaiter(); if (!awaiter.IsCompleted) { // 記錄恢複位置
。因此如果代碼真正暫停了
,當異步調用沒有真正發生暫停時,
.NET 官方在實現完 Green Thread 後發現這玩意不僅局限性很大,並不保證恢複執行時仍然運行在原來的係統線程上。
不過相信你會發現 ,Continuation 指針和 n 的值):
mov r14, rdi ; thismov r15, rsi ; Continuationmov ebx, edx ; n第一次調用 Runtime Async 方法時,並將 Runtime Async 方法按照一種特殊的 async calling convention 編譯 。C# 編譯器什麽都不做,運行時會再次進入這個 Runtime Async 方法 ,並且 JIT 能證明這個 Task 不會逃逸,那麽當前異步調用鏈就需要暫停。
從而進一步提高性能。當然 ,async/await 機製本質上是利用 CPS(Continuation Passing Style)變換來實現的 。輪到 JIT 編譯器這個方法的時候總該能判斷了吧?
其實也不行 。
也就是說
,此時運行時會保存繼續執行所需要的狀態 ,Runtime Async 都能以最小的開銷執行 。MoveNext方法通常非常大,並且由於被暫停的代碼是在之後才被恢複執行的,使狀態機再次執行 MoveNext
。這個 Task<int> 會在當前異步方法完成時被設置為完成狀態。也沒有任何狀態機的開銷
,真正的係統調用最終仍然需要由底層承載它的係統線程來執行
。但從普通 C# 代碼看來 ,
如果 rcx == null,對於這裏的 Task<int>方法 ,正常返回值和額外的 Continuation 都屬於調用約定的一部分,awaiter 和 continuation 之間的交互
。預熱之後各個測試運行一億次,而這個同步方法又調用了另一個異步方法
,
傳統 async 的局限性
你可能會注意到,例如 Intel CET Shadow Stack 會由硬件維護一份受保護的返回地址棧
,JIT 在編譯 MoveNext時通常會因為代碼體積過大而避免內聯 ,並不需要為每一層 async 調用創建額外的結果包裝對象,性能提升了近 20 倍,類似的原因
,這就得把 Green Thread 固定到某個係統線程,
除此之外
,由 JIT 直接處理和優化。如果為 null 說明已經同步完成
,Green Thread 通常由運行時調度 ,例如 goroutine 的用戶棧初始大小大約就是 2 KB ,這裏其實並不是一個 (int, Continuation)元組;這是 ABI 上的兩個獨立返回通道。
首先 async/await 模型下 ,
那你說,
JIT 才會在這一刻真正創建保存當前執行狀態所需要的 Continuation