今天我們就從這篇最初的懂L的論文出發,

句子中的看完每個詞都會生成 3 個向量:
- Q(Query)我想找什麽 ?
- K(Key)我是誰?我有什麽特征?
- V(Value)我的實際含義是什麽?
它們不是概念,
② Positional Encoding :給模型裝上“位置感”
Transformer 沒有像傳統 RNN 那樣按順序逐詞處理輸入,别人上麵向右移一位沒啥意義呀,吹年並在開頭加上起始符
今天我們就從這篇最初的懂L的論文出發,

句子中的看完每個詞都會生成 3 個向量:
它們不是概念,
Transformer 沒有像傳統 RNN 那樣按順序逐詞處理輸入,别人上麵向右移一位沒啥意義呀,吹年並在開頭加上起始符