Transformer、Seq2Seq 與注意力機制
-
Transformer 是現代神經機器翻譯(NMT)的主流架構,但它的設計基礎來自 Seq2Seq(Encoder-Decoder)模型與注意力機制。
-
了解這兩個概念,有助於理解 Transformer 的設計動機、優勢與運作原理。
-
機器翻譯技術的發展脈絡:從規則式、統計式(SMT),到神經網路(NMT),Seq2Seq 和注意力機制是關鍵里程碑。
-
Transformer 以注意力機制為核心,徹底取代了傳統的 RNN,帶來更高效的平行運算與更好的翻譯品質。
Seq2Seq 模型是什麼?
-
Seq2Seq(Sequence to Sequence)是一種神經網路,用來把一串東西(像英文句子)轉換成另一串東西(像中文句子)。
-
它有兩個主要角色:
-
Encoder(編碼器):先讀完整個輸入,把重要資訊壓縮成一個向量。
-
Decoder(解碼器):根據這個向量,一個一個地生出目標語言的詞。
-
運作方式
-
Encoder 讀入整個英文句子,把意思濃縮成一個「代表整句話」的向量。
-
Decoder 依序產生中文詞,每產生一個詞就參考這個向量,直到遇到結束符號。
問題
- 如果句子很長,全部資訊都塞進一個向量,容易漏掉細節,翻譯會變差。
注意力機制是什麼?
-
注意力機制讓 Decoder 在翻譯每個詞的時候,可以「回頭看」Encoder 輸入的每個詞,決定要特別關注哪些詞。
-
換句話說,不再只靠一個向量,而是每次都能動態取得最重要的資訊。
運作方式
-
Decoder 想產生一個詞時,會跟 Encoder 的每個詞「比對」看看誰比較重要。
-
算出每個詞的「權重」(誰該被注意)。
-
根據這些權重,把 Encoder 的資訊加總成一個 context,幫助 Decoder 產生更準確的詞。
好處
-
長句子也能抓到重點,不容易遺漏重要資訊。
-
翻譯結果更自然、正確。
總結
-
Seq2Seq 是「先讀完、再翻譯」的基本架構。
-
注意力機制讓翻譯過程更靈活,能隨時回頭找重點。
-
這兩個概念是 Transformer 這種現代機器翻譯模型的基礎。