Transformer、Seq2Seq 與注意力機制

  • Transformer 是現代神經機器翻譯(NMT)的主流架構,但它的設計基礎來自 Seq2Seq(Encoder-Decoder)模型與注意力機制。

  • 了解這兩個概念,有助於理解 Transformer 的設計動機、優勢與運作原理。

  • 機器翻譯技術的發展脈絡:從規則式、統計式(SMT),到神經網路(NMT),Seq2Seq 和注意力機制是關鍵里程碑。

  • Transformer 以注意力機制為核心,徹底取代了傳統的 RNN,帶來更高效的平行運算與更好的翻譯品質。

Seq2Seq 模型是什麼?

  • Seq2Seq(Sequence to Sequence)是一種神經網路,用來把一串東西(像英文句子)轉換成另一串東西(像中文句子)。

  • 它有兩個主要角色:

    • Encoder(編碼器):先讀完整個輸入,把重要資訊壓縮成一個向量。

    • Decoder(解碼器):根據這個向量,一個一個地生出目標語言的詞。

運作方式

  1. Encoder 讀入整個英文句子,把意思濃縮成一個「代表整句話」的向量。

  2. Decoder 依序產生中文詞,每產生一個詞就參考這個向量,直到遇到結束符號。

問題

  • 如果句子很長,全部資訊都塞進一個向量,容易漏掉細節,翻譯會變差。

注意力機制是什麼?

  • 注意力機制讓 Decoder 在翻譯每個詞的時候,可以「回頭看」Encoder 輸入的每個詞,決定要特別關注哪些詞。

  • 換句話說,不再只靠一個向量,而是每次都能動態取得最重要的資訊。

運作方式

  1. Decoder 想產生一個詞時,會跟 Encoder 的每個詞「比對」看看誰比較重要。

  2. 算出每個詞的「權重」(誰該被注意)。

  3. 根據這些權重,把 Encoder 的資訊加總成一個 context,幫助 Decoder 產生更準確的詞。

好處

  • 長句子也能抓到重點,不容易遺漏重要資訊。

  • 翻譯結果更自然、正確。


總結

  • Seq2Seq 是「先讀完、再翻譯」的基本架構。

  • 注意力機制讓翻譯過程更靈活,能隨時回頭找重點。

  • 這兩個概念是 Transformer 這種現代機器翻譯模型的基礎。