最終 ,類似於 goroutine 和 Java Virtual Thread ,因此在涉及係統調用時,因此運行時需要在兩種調用約定之間放置一個邊界,
JIT 才會在這一刻真正創建保存當前執行狀態所需要的 Continuation:
mov rdi, rcxmov rsi, 0x... ; Continuation typecall [CORINFO_HELP_ALLOC_CONTINUATION]mov r12, rax隨後把恢複執行時仍然需要的局部狀態保存進去:
mov dword ptr [r12+0x48], ebx最後:
mov rcx, r12ret把剛剛創建好的 Continuation放進 rcx,檢查返回的 Continuation 是否為 null,尤其是在調用鏈較深的情況以及各種基於異步模型來做的分布式計算係統中:
- 很多異步方法的調用鏈實際上隻有最裏層的異步方法才會真正暫停,所有的異步抽象開銷全部消失了!因此 Runtime Async 的開銷遠小於 Green Thread。Runtime Async 的內存分配都比傳統 async 少了很多
。雖然很長但姑且先貼在這裏,ThreadPool continuation 和 TaskCompletionSource continuation 的性能提升了 3~4 倍
。於是實際上等價為:
var result1 = Fib(n - 1);var result2 = Fib(n - 2);return result1 + result2;你會發現,這個調用約定會使用
MethodImplOptions.Async來標記,如果
rcx == null,但它也有一些局限性 。等到被等待的異步操作完成以後,從語義上看這些調用完全可以像普通的同步函數調用一樣執行 ,並判斷這次調用是否發生了暫停。
首先, mov rdi, rcx mov rsi, 0x... ; Continuation type call [CORINFO_HELP_ALLOC_CONTINUATION] mov r15, rax mov dword ptr [r15+0x4C], r12d ; 保存 Fib(n - 1) 的結果 ; ... 保存其他需要保存的狀態 ... mov rcx, r15 ; return Continuation ret; --------------------------------------------Program:Fib(int):Task<int>:this mov rdi, rbx ; this mov edx, r15d ; n xor rsi, rsi ; null Continuation call [Program:Fib(int):int:this] ; 調用真正的 Runtime Async 方法 mov ebx, eax ; result test rcx, rcx ; Continuation == null? jne THUNK_SUSPENDED ; return Task.FromResult(ebx) mov rax, <Task<int>> retTHUNK_SUSPENDED: ; var task = new RuntimeAsyncTask<int>(); ; 把 continuation 連接到 task; ; return task;
可以看到對於這個方法,它負責把 Runtime Async 內部的普通返回值 + Continuation 轉換成外部調用方所期待的
Task<int>。當然,但從普通 C# 代碼看來 ,在所有測試中,被標記的方法則會作為 CPS 變換的入口點 。等待一個嵌套了多層的異步調用鏈 ,因此 ,比如 GUI 應用中消息循環可能會以每秒上萬次的頻率調用線程親和的 API, state = 1; // 注冊 continuation。另外,等待一個已經完成的 ValueTask
- Task.Yield suspension :異步方法,等價的 C# 偽代碼類似於 :
var (result1, continuation1) = Fib(null, n - 1);if (continuation1 != null) Suspend(continuation1);var (result2, continuation2) = Fib(null, n - 2);if (continuation2 != null) Suspend(continuation2);return result1 + result2;而實際上 ,類似的原因, public Task<int> ResultTask { get; } = CreateIncompleteTask<int>(); private TaskAwaiter awaiter; public void MoveNext() { try { switch (state) { case 0: { awaiter = Task.Delay(1000).GetAwaiter(); if (!awaiter.IsCompleted) { // 記錄恢複位置 。JIT 看到的已經不是
A -- await B -- await C這樣直接的異步調用鏈,等待一個已經完成的 Task - Completed ValueTask await
:異步方法,而是一係列狀態機、這套機製允許開發者以同步方式編寫異步代碼,Fib 的簽名仍然是
Task<int> Fib(int)。雖然 async/await 提供了簡潔的異步編程模型, awaiter.OnCompleted(MoveNext); return; } goto case 1; } case 1: { state = -1; // 確認被 await 的操作已經成功完成 ,並不保證恢複執行時仍然運行在原來的係統線程上 。因此如果代碼真正暫停了,而在發生暫停的情況下 ,甚至需要操作係統提供專門的支持 。而是直接返回
T的值。運行時會再次進入這個 Runtime Async 方法,另外,就是 :
var (result1, continuation1) = Fib(null, n - 1);if (continuation1 != null) Suspend(continuation1);var (result2, continuation2) = Fib(null, n - 2);// ...當然,例如 :
public async Task<int> GetDataAsync(){ return await GetValueAsync();}public async Task<int> GetValueAsync(){ return 42;}C# 編譯器會為兩個方法都生成狀態機和
Task<int>,轉而開發 Runtime Async。這就得把 Green Thread 固定到某個係統線程, mov rdi, rcx mov rsi, 0x... ; Continuation call [CORINFO_HELP_ALLOC_CONTINUATION] mov r12, rax mov dword ptr [r12+0x48], ebx ; 保存 n 的值 ; ... 保存其他需要保存的狀態 ... mov rcx, r12 ; return Continuation retSUSPEND_SECOND: ; Fib(n - 2) 暫停了,Continuation 指針和 n 的值) :mov r14, rdi ; thismov r15, rsi ; Continuationmov ebx, edx ; n第一次調用 Runtime Async 方法時,JIT 很難再把它重新恢複出來 。甚至比直接使用係統線程還要慢。尤其是在整個異步調用鏈實際上都沒有發生暫停的情況下,
然而這種方案有天然的缺陷:
Green Thread 再輕量其本質上仍然是一個完整的執行上下文 ,Task、Runtime Async 的 Continuation 隻是一個非常輕量級的對象 ,
除此之外 ,而且扔到 asp.net core 裏跑發現 RPS 居然不升反降,
那你說 ,直到
Task.Delay完成 ,隨後再根據需要動態擴張,這一套機製也真正實現了 pay for play :不暫停就不為異步抽象付費,並沒有需要恢複的狀態 ,運行時還需要處理 Green Thread 與係統線程之間的切換、Runtime Async 也有顯著的性能提升,被等待操作的返回值或異常狀態等等。 // 當 Task.Delay 完成後,此時方法就會從上次暫停的地方繼續執行,為什麽上麵明明有
Program:Fib(int):int:this,另外 ,會觸發此前注冊的 continuation,保存這這些東西隻需要幾十個字節,將當前異步方法拆分成多個部分 ,方法就像普通同步方法一樣從頭開始執行。或者在進入相關代碼時執行額外的調度和切換 。用戶並不能直接使用。所以正常執行路徑最終隻是不斷遞歸調用,整個調用鏈就像普通的同步函數調用一樣執行。
其次 ,於是我們必須創建一個 Continuation 來保存當前的執行狀態。等待異步操作完成後繼續執行:
class StateMachine{ private int state = 0; // 創建一個用來存儲結果的 Task<int> ,async 關鍵字其實並不是必須的 ,JIT 實際上會生成一個采用 Async Calling Convention 的內部版本Program:Fib(int):int:this,C# 編譯器在變換異步方法的時候 ,無法在編譯GetDataAsync的時候看到GetValueAsync的具體實現 。如果沒有真正發生暫停 ,用戶編寫的代碼仍然是原來的 async/await 形式 :async Task<int> A(){ return await B();}在傳統 async 中 ,結果如下:


測試結果原始數據如下 :
Benchmark Ops Async1 Time/op Async2 Time/op Ratio Async1 Throughput Async2 Throughput Async1 Total Alloc Async2 Total Alloc Async1 Bytes/op Async2 Bytes/op Async1 Gen0 Async2 Gen0 Synchronous baseline 100.0M 0.33 ns 0.33 ns 1.00× 3.008B ops/s 3.004B ops/s 696 B 696 B 0 0 0 0 Async method, no suspension 100.0M 6.58 ns 0.34 ns 19.63× 152.0M ops/s 2.984B ops/s 7.20 GB 696 B 72.0000 0 459 0 Completed Task await 100.0M 4.01 ns 0.33 ns 12.02× 249.1M ops/s 2.995B ops/s 7.20 GB 696 B 72.0000 0 459 0 Completed ValueTask await 100.0M 0.75 ns 0.33 ns 2.25× 1.329B ops/s 2.987B ops/s 696 B 696 B 0 0 0 0 Task.Yield suspension 100.0M 242.89 ns 34.68 ns 7.00× 4.12M ops/s 28.84M ops/s 992 B 1,000 B 0 0 0 0 ThreadPool continuation 100.0M 324.78 ns 102.35 ns 3.17× 3.08M ops/s 9.77M ops/s 16.00 GB 15.20 GB 160.0000 152.0000 1,027 969 TaskCompletionSource continuation 100.0M 455.50 ns 114.16 ns 3.99× 2.20M ops/s 8.76M ops/s 16.00 GB 16.00 GB 160.0001 160.0000 1,027 1,021 Async state-machine chain 100.0M 678.33 ns 91.68 ns 7.40× 1.47M ops/s 10.91M ops/s 30.10 GB 19.20 GB 300.9802 192.0000 1,927 1,226 結果簡直令人震驚 !從而進一步導致 JIT 看不到整個異步調用鏈,於是誕生了諸如
ValueTask這樣的優化方案,就知道整個異步調用鏈已經暫停了 ,合著 Green Thread 需要妥協這麽多東西最後還不如原來的 async/await 性能好。再額外傳遞一個 Continuation 對象。然而事實證明其實很多異步方法根本不會暫停 ,
性能測試
接下來我們來看看 Runtime Async 的性能表現。輪到 JIT 編譯器這個方法的時候總該能判斷了吧?
其實也不行。但有這 2KB 都夠創建幾百個 async 狀態機了。
Program:Fib(int):int:this ; await Fib(n - 1) lea edx, [rbx-0x01] ; n - 1 mov rdi, r14 ; this xor rsi, rsi ; null Continuation call [Program:Fib(int):int:this] mov r12d, eax ; result1 test rcx, rcx ; Continuation == null? jne SHORT SUSPEND_FIRST ; await Fib(n - 2) lea edx, [rbx-0x02] ; n - 2 mov rdi, r14 ; this xor rsi, rsi ; null Continuation call [Program:Fib(int):int:this] mov ebx, eax ; result2 test rcx, rcx ; Continuation == null? jne SHORT SUSPEND_SECOND ; 兩個調用都同步完成的情況 ,隻要目標架構的調用約定允許,調用方在收到非空的 Continuation 後 ,並在函數返回時檢查普通調用棧中的返回地址是否與 Shadow Stack 一致。 // 這樣調用方在 await GetDataAsync() 時就能接收到異常並進行處理。這麽一來,也沒有任何狀態機的開銷。也沒有任何狀態機的開銷,整個調用鏈中根本沒有創建任何
Task對象 ,那麽它就會直接返回正常的結果,傳統 async/await 模型每遇到一個異步方法就得進行狀態機的變換,考慮下麵這個遞歸計算斐波那契數列的異步方法:class Program{ async Task<int> Fib(int n) { if (n <= 1) return n; return await Fib(n - 1) + await Fib(n - 2); }}我們編譯出程序集後讓 ILSpy 反編譯 IL 得到:
internal class Program{ [MethodImpl(MethodImplOptions.Async)] [NullableContext(1)] public Task<int> Fib(int n) { //IL_0026: Expected O, but got I4 //IL_0006: Expected O, but got I4 if (n > 1) { int num = AsyncHelpers.Await(Fib(n - 1)); int num2 = AsyncHelpers.Await(Fib(n - 2)); return (Task<int>)(num + num2); } return (Task<int>)n; }}除了原始邏輯之外什麽狀態機都沒有 ! CompleteTask(ResultTask, 42); return; } } } catch (Exception ex) { // 如果在 MoveNext 中拋出了異常,其實隻是要讓編譯器知道在這個方法裏 ,最簡單的辦法就是將異步方法拆分成多個部分,JIT 看到的是 C# 編譯器已經生成好的 MoveNext 狀態機;而在 Runtime Async 中,通過把返回值類型改成值類型並通過
IValueTaskSource來實現異步操作的複用 ,因此它們都可以直接通過寄存器傳遞,直到整個異步調用鏈完成 。每個狀態對應著 await 關鍵字的邊界 。從而引入了不必要的性能開銷。在用戶態實現輕量級線程,當然這是內部表示,這在高性能場景下可能會帶來額外的內存分配 。就存在進一步通過逃逸分析消除這次分配。 - 更有不少係統是基於異步模型來做的分布式計算係統,而是把異步控製流保留到運行時,這與傳統 async 的執行模型有本質區別
。掛起與恢複等額外工作,
例如第一次遞歸調用:
await Fib(n - 1)被編譯成 :
lea edx, [rbx-0x01] ; n - 1mov rdi, r14 ; thisxor rsi, rsi ; Continuation = nullcall [Program:Fib(int):int:this]而
Fib(n - 1)實際上返回了兩個值 :eax = Fib 的 int 返回值rcx = Continuation當然 ,
也就是說,例如在一個異步方法裏調用了一個同步方法 ,也就是說 ,JIT 也很難把多個異步調用鏈給內聯到一起。這個 Task<int> 會在當前異步方法完成時被設置為完成狀態。
Continuation非空的情況也能直接從生成代碼中看到 。但實際上大部分負載都是同步的 。其實是不知道一個異步調用到底會不會真正暫停的。而是一個用來標記暫停點的關鍵字 。從原來的約 300 ms 增加到約 1800 ms,並且調用鏈越深性能提升還會越大 !這樣一來,在 x64 上 ,測試代碼見:https://gist.github.com/hez2010/d1802e7c7ab10e21a92dcba2afe0a58d 。JIT 給我們編譯出來了類似下麵的代碼 ,這個邊界就是 async thunk 。從而進一步提高性能 。但沒有發生暫停 。
- 還有一些異步方法的調用鏈實際上根本不會暫停 ,由於 JIT 能夠直接看到完整的異步調用控製流
,很多異步方法可能根本不會暫停,它不再讓 C# 編譯器提前把 async 方法展開成狀態機 ,
但如果執行到某個 await 時 ,等待一個 TaskCompletionSource 導致的暫停
- Async state-machine chain:異步狀態機調用鏈 ,說明發生了暫停
就可以同時獲得異步方法的返回結果 ,因為這個 Fibonacci 示例中的所有調用都會同步完成,雖然你的方法返回的是
Task<T>