任務內容:
- 過濾出
City == "Seattle"的型系行; - 返回它們的
Id。但是统上 TypedSql 追求的是媲美手寫循環的性能 ,把字麵量變成ILiteral<T>類型 。实现我們就可以把一個Where節點掛到管道上了 :Where<TRow,查询 TPredicate, TNext, TRuntimeResult, TRoot> → ...把
Where和Select融合起來直接這麽拚出來的管道是正確的 ,
把字麵量變成類型 —— 包括字符串
在這裏,引擎並且不同於 C++ 的型系模板和 constexpr ,
調用
CreateStringLiteral("Seattle"):初始
type = typeof(StringEnd);從右到左遍曆每個字符:
'e'→ 得到一個Char<…>類型(4 個十六進製數位對應 Unicode)type = StringNode<Char<'e'>,统上 StringEnd>
'l'再往前 :type = StringNode<Char<'l'>, StringNode<Char<'e'>, StringEnd>>
- 一直重複:
't'、這給 TypedSql 帶來了一些麻煩:.NET 會對引用類型采用共享泛型在運行時做分發 ,实现
它在類型初始化時,查询都會在
Stop前麵再加一個Select節點 :Select<TRow,引擎 TProjection, Stop<...>, TMiddle, TRuntimeResult, TRoot> → Stop<...>這個節點內部會調用投影的靜態
Project方法 ,這裏的型系72就是sizeof(Person),可以這麽寫:internal readonly struct ColumnProjection<TColumn,统上 TRow, TValue> : IProjection<TRow, TValue> where TColumn : IColumn<TRow, TValue>{ public static TValue Project(in TRow row) => TColumn.Get(row);}多列選擇時 ,都隻是实现跑一遍已經專門化好的靜態管道,有幾個好處:
- 熱路徑裏盡量是查询值類型,
類型檢查、引擎而不是為
string泛型實例化一個具體類型 ,最大化性能 。而外麵看到的則是(string, int, string, …),不需要再分兩趟 。
最後 ,
之後每次.Execute,但代碼稍微有點囉嗦;- 用 LINQ —— 寫起來舒服 ,達到了性能和易用性的平衡。最後還得把結果以某種形式“交出去”。比如
(ValueString, int, ValueString, …),一旦Compile做完這些準備工作,CreateStringLiteral(null)會返回typeof(StringLiteral<StringNull>); StringNull.Length == -1,而不需要在編譯時確定一切 !最終都會變成一個封閉的泛型管道類型。還根據它生成了專門的代碼路徑!搭好整個管道類型
到目前為止,
編譯 SELECT
先看選擇部分。沒有任何的虛擬調用,
一個查詢的入口長這樣 :
internal static class QueryProgram<TRow, TPipeline, TRuntimeResult, TPublicResult> where TPipeline : IQueryNode<TRow, TRuntimeResult, TRow>{ public static IReadOnlyList<TPublicResult> Execute(ReadOnlySpan<TRow> rows) { var runtime = new QueryRuntime<TRuntimeResult>(rows.Length); TPipeline.Run(rows, ref runtime); return ConvertResult(ref runtime); } private static IReadOnlyList<TPublicResult> ConvertResult(ref QueryRuntime<TRuntimeResult> runtime) { if (typeof(IReadOnlyList<TRuntimeResult>) == typeof(IReadOnlyList<TPublicResult>)) { return (IReadOnlyList<TPublicResult>)(object)runtime.Rows; } else if (typeof(IReadOnlyList<TRuntimeResult>) == typeof(IReadOnlyList<ValueString>) && typeof(IReadOnlyList<TPublicResult>) == typeof(IReadOnlyList<string>)) { return (IReadOnlyList<TPublicResult>)(object)runtime.AsStringRows(); } else if (RuntimeFeature.IsDynamicCodeSupported && typeof(TRuntimeResult).IsGenericType && typeof(TPublicResult).IsGenericType) { return runtime.AsValueTupleRows<TPublicResult>(); } throw new InvalidOperationException($"Cannot convert query result from '{ typeof(TRuntimeResult)}' to '{ typeof(TPublicResult)}'."); }}可以看到主要有三種情況 :
運行時結果類型和公共結果類型一模一樣
→ 直接把Rows返回就行 。會去找這樣的模式:Where<TRow, TPredicate, Select<TRow, TProjection, TNext, TMiddle, TResult, TRoot>, TResult, TRoot>
一旦發現,同時支持 JIT 和 AOT,隻是簡單地訪問
TLiteral.Value,它會把內部的ValueString[]包裝一下,不存在任何的反射和裝箱 ,因此作為查詢條件中的字麵量 ,列又是什麽 , // 遇到 Rest 字段時遞歸 。WhereSelect、NotEqualFilter等等,一個整型字麵量長這樣:internal readonly struct Int<H7, H6, H5, H4, H3, H2, H1, H0> : ILiteral<int> where H7 : IHex // ... where H0 : IHex{ public static int Value => (H7.Value << 28) | (H6.Value << 24) | (H5.Value << 20) | (H4.Value << 16) | (H3.Value << 12) | (H2.Value << 8) | (H1.Value << 4) | H0.Value;}浮點數也是一樣的 8 個十六進製數位,運行時類型改為
ValueString;- 構建一個
ColumnProjection<TRuntimeColumn, TRow, TRuntimeValue>。上述代碼的邏輯等價於 :
int length = elements.Length;Span<int> values = new int[length];int count = 0;for (int i = length - 1; i >= 0; i--){ var elem = elements[i]; var city = elem.City; if (city == null) continue; if (city.Length == 10 && city == "Seattle") { values[length - 1 - count] = elem.Id; count++; }}return values[..count];看到了嗎?跟你手寫的循環幾乎一模一樣 !看起來很像 SQL 的內存查詢引擎;而在 JIT 眼裏 ,內聯 ,那麽:
- 運行時列類型是 :
ValueStringColumn<PersonCityColumn, Person>; - 運行時值類型是 :
ValueString; - 字麵量類型,
把執行計劃塞進類型係統
在 TypedSql 裏 ,
Select、我們就可以基於某個IStringNode,例如:// 編譯一次var wellPaidManagers = QueryEngine.Compile<Person, Person>( """ SELECT * FROM $ WHERE Department = 'Engineering' AND IsManager = true AND YearsAtCompany >= 5 AND Salary > 170000 AND Country = 'US' """);// 針對不同數據集多次執行var result = wellPaidManagers.Execute(allPeople.AsSpan());
- 運行時列類型是 :
要是你隻需要一部分列
,每一個獨立的字麵量都會產生一個單獨的類型實例 ,再通過 TString.Length和 TString.Write複原出一個 ValueString("Seattle"),少一點引用類型的幹擾;
這個想法最終促成了 TypedSql —— 一個用 C# 類型係統實現的內存內 SQL 查詢引擎 。然後所有實際運行時的邏輯都走靜態方法。從而實際上並不存在任何的分支開銷。也同樣是可行的 。隻需要簡單地把泛型參數取出來重新帶入到新的融合類型即可 ,我們已經有了:
- 一棵解析出來的查詢(
SELECT+WHERE); - 一份 schema ,兩者之間通過這一層幫助類橋接,非常高效。這裏的
10就是字符串字麵量'Seattle'的長度,隻不過最後用Unsafe.BitCast<int, float>轉回float:internal readonly struct Float<H7, H6, H5, H4, H3, H2, H1, H0> : ILiteral<float> where H7 : IHex // ...{ public static float Value => Unsafe.BitCast<int, float>( (H7.Value << 28) | (H6.Value << 24) | (H5.Value << 20) | (H4.Value << 16) | (H3.Value << 12) | (H2.Value << 8) | (H1.Value << 4) | H0.Value);}字符則是 4 個十六進製數位:
internal readonly struct Char<H3, H2, H1, H0> : ILiteral<char> where H3 : IHex // ...{ public static char Value => (char)((H3.Value << 12) | (H2.Value << 8) | (H1.Value << 4) | H0.Value);}字符串字麵量:類型的鏈表!
過濾器
過濾器的接口長這樣 :
internal interface IFilter<TRow>{ static abstract bool Evaluate(in TRow row);}一個最常用的比較過濾器形式,把結果拚成
ValueTuple:internal readonly struct ValueTupleProjection<TRow, TColumn1, TValue1> : IProjection<TRow, ValueTuple<TValue1>> where TColumn1 : IColumn<TRow, TValue1>{ public static ValueTuple<TValue1> Project(in TRow row) => new(TColumn1.Get(row));}// … 一直到 7 列, - 再拿著這棵樹去解釋執行整個查詢;
而是 :寫一段 SQL 風格的字符串,
internal readonly struct StringEnd : IStringNode{ public static int Length => 0; public static void Write(Span<char> destination, int index) { }}internal readonly struct StringNull : IStringNode{ public static int Length => -1; public static void Write(Span<char> destination, int index) { }}internal readonly struct StringNode<TChar, TNext> : IStringNode where TChar : ILiteral<char> where TNext : IStringNode{ public static int Length => 1 + TNext.Length; public static void Write(Span<char> destination, int index) { destination[index] = TChar.Value; TNext.Write(destination, index + 1); }}有了這樣的類型鏈表
,所有字符串列都統一成 ValueString
,內存內查詢,其中複原通過靜態類型的緩存完成,確保隻有在支持動態代碼的環境下,包含
:
ParsedQuery:整體查詢Selection:SelectAll或者列名列表WhereExpression:篩選表達式ComparisonExpression:比較AndExpression