ข้ามไปยังเนื้อหาหลัก

ทรานส์ฟอร์เมอร์ทำงานอย่างไร: เจาะลึกสถาปัตยกรรม Transformer อย่างละเอียด

สำรวจสถาปัตยกรรมของทรานส์ฟอร์เมอร์ โมเดลที่ปฏิวัติการจัดการข้อมูลด้วยกลไก self-attention
อัปเดตแล้ว 26 ส.ค. 2569  · 15 นาที อ่าน

สำรวจด้วย AI

ChatGPTClaudePerplexity

ทำความเข้าใจสถาปัตยกรรม Transformer รวมถึง self-attention โครงแบบ encoder–decoder และ multi-head attention และวิธีที่ขับเคลื่อนโมเดลอย่าง GPT ของ OpenAI

สรุปแบบย่อ

  • Transformers คือสถาปัตยกรรมโครงข่ายประสาทที่ใช้กลไก self-attention เพื่อประมวลผลข้อมูลลำดับแบบขนาน แทนความจำเป็นต้องมีความวนซ้ำ (recurrence)
  • องค์ประกอบหลัก: input embeddings, positional encoding, multi-head self-attention, โครงข่าย feed-forward และ layer normalization พร้อม residual connections
  • โครงสร้าง encoder-decoder: encoder สร้างตัวแทนเชิงบริบท; decoder สร้างลำดับผลลัพธ์แบบ autoregressive
  • สายพันธุ์สมัยใหม่: GPT-5, Claude, Llama และ Gemini สำหรับภาษา; Vision Transformers (ViT) สำหรับภาพ; โมเดลมัลติโหมดสำหรับอินพุตผสม
  • นวัตกรรมด้านประสิทธิภาพ: Flash Attention, Rotary Position Embeddings (RoPE) และตัวแปร linear attention แก้คอขวดความซับซ้อนกำลังสอง

แวดวงดีปเลิร์นนิงกำลังเปลี่ยนแปลงอย่างใหญ่หลวงด้วยการเกิดขึ้นและพัฒนาอย่างรวดเร็วของโมเดล Transformer

สถาปัตยกรรมอันล้ำสมัยเหล่านี้ไม่เพียงยกระดับมาตรฐานในงานประมวลผลภาษาธรรมชาติ (NLP) แต่ยังก้าวไกลไปสู่หลายแขนงของปัญญาประดิษฐ์

ด้วยกลไกความสนใจที่เป็นเอกลักษณ์และความสามารถในการประมวลผลแบบขนาน โมเดล Transformer เป็นหลักฐานของการก้าวกระโดดเชิงนวัตกรรมในการทำความเข้าใจและสร้างภาษามนุษย์ด้วยความแม่นยำและประสิทธิภาพที่ไม่เคยมีมาก่อน

ปรากฏครั้งแรกในปี 2017 ในบทความ “Attention is all you need” ของ Google สถาปัตยกรรมทรานส์ฟอร์เมอร์คือหัวใจของโมเดลก้าวล้ำอย่าง ChatGPT จุดประกายความตื่นตัวระลอกใหม่ในวงการ AI มีบทบาทสำคัญในโมเดลภาษาแนวหน้าของ OpenAI และเป็นกุญแจสำคัญใน AlphaStar ของ DeepMind

ในยุคสมัยแห่งการเปลี่ยนผ่านของ AI นี้ ความสำคัญของโมเดล Transformer ต่อผู้ใฝ่เรียนด้านวิทยาศาสตร์ข้อมูลและผู้ปฏิบัติงาน NLP นั้นมากเกินกว่าจะประเมินต่ำได้

ในฐานะหนึ่งในแกนกลางของก้าวกระโดดทางเทคโนโลยีล่าสุด บทความนี้มุ่งถอดรหัสความลับเบื้องหลังโมเดลเหล่านี้

Transformers คืออะไร

Transformer ถูกพัฒนาขึ้นครั้งแรกเพื่อแก้ปัญหา sequence transduction หรือ neural machine translation ซึ่งหมายความว่ามีเป้าหมายเพื่อแก้โจทย์ที่แปลงลำดับอินพุตไปเป็นลำดับเอาต์พุตทุกรูปแบบ จึงได้ชื่อว่า “Transformers”

แต่เริ่มจากจุดตั้งต้นกันก่อน

Transformer Models คืออะไร

Transformer model คือโครงข่ายประสาทที่เรียนรู้บริบทของข้อมูลลำดับ และสร้างข้อมูลใหม่จากสิ่งนั้น

พูดให้เข้าใจง่าย:

Transformer คือโมเดล AI ชนิดหนึ่งที่เรียนรู้ทำความเข้าใจและสร้างข้อความคล้ายมนุษย์โดยวิเคราะห์รูปแบบจากข้อมูลข้อความจำนวนมหาศาล

Transformers เป็นโมเดล NLP ชั้นแนวหน้าในปัจจุบันและถือเป็นวิวัฒนาการของสถาปัตยกรรม encoder-decoder อย่างไรก็ดี ขณะที่สถาปัตยกรรม encoder-decoder อาศัยโครงข่ายประสาทแบบเวียนเกิด (RNN) เป็นหลักในการดึงข้อมูลเชิงลำดับ Transformers กลับไม่มีความวนซ้ำนี้เลย

แล้วทำได้อย่างไร?

พวกมันถูกออกแบบมาเพื่อเข้าใจบริบทและความหมายโดยวิเคราะห์ความสัมพันธ์ระหว่างองค์ประกอบต่าง ๆ และพึ่งพาเทคนิคทางคณิตศาสตร์ที่เรียกว่า attention เกือบทั้งหมด

สถาปัตยกรรมทรานส์ฟอร์เมอร์ในมุมมองกล่องดำ

ภาพโดยผู้เขียน

บริบททางประวัติศาสตร์

มีจุดกำเนิดจากงานวิจัยของ Google ในปี 2017 โมเดลทรานส์ฟอร์เมอร์เป็นหนึ่งในพัฒนาการล่าสุดและทรงอิทธิพลของสายแมชชีนเลิร์นนิง โมเดล Transformer ตัวแรกถูกอธิบายในบทความสำคัญ "Attention is All You Need"

แนวคิดบุกเบิกนี้ไม่ใช่เพียงทฤษฎี แต่ถูกนำไปใช้งานจริงอย่างเด่นชัดในแพ็กเกจ Tensor2Tensor ของ TensorFlow นอกจากนี้ กลุ่ม Harvard NLP ยังได้เผยแพร่ ไกด์ฉบับมีคำอธิบายกำกับบทความ พร้อมตัวอย่างใน PyTorch คุณสามารถเรียนรู้เพิ่มเติมเกี่ยวกับ การสร้าง Transformer ตั้งแต่ศูนย์ ในบทเรียนแยกต่างหากของเรา

การเปิดตัวโมเดลนี้จุดชนวนการเติบโตครั้งใหญ่ในสาขา ซึ่งมักเรียกรวมว่า Transformer AI โมเดลปฏิวัตินี้วางรากฐานให้ความก้าวหน้าต่อเนื่องในโลกของโมเดลภาษาขนาดใหญ่ เช่น BERT ภายในปี 2018 พัฒนาการเหล่านี้ถูกยกย่องว่าเป็นหมุดหมายสำคัญของ NLP

ปี 2020 นักวิจัยที่ OpenAI ประกาศ GPT-3 เพียงไม่กี่สัปดาห์ ความอเนกประสงค์ของ GPT-3 ก็ถูกรับรองเมื่อผู้คนใช้มันแต่งบทกวี เขียนโปรแกรม แต่งเพลง สร้างเว็บไซต์ และอื่น ๆ อีกมากมาย สร้างจินตนาการให้ผู้ใช้ทั่วโลก จากการเปลี่ยนแปลงนี้ นักวิชาการสแตนฟอร์ดเผยแพร่บทความปี 2021 ตั้งชื่อโมเดลเหล่านี้ว่า "foundation models" ตอกย้ำบทบาทสำคัญในการพลิกโฉม AI

ขณะที่โมเดลปิดซอร์สดึงดูดความสนใจจากสาธารณะในช่วงแรก การปฏิวัติแบบโอเพ่นซอร์สก็เกิดขึ้นคู่ขนานและทำให้เทคโนโลยีทรานส์ฟอร์เมอร์เข้าถึงได้มากขึ้น แพลตฟอร์มอย่าง Hugging Face กลายเป็นศูนย์กลางสำคัญในการแบ่งปันโมเดล แต่ภูมิทัศน์ได้เปลี่ยนไปอย่างมีนัยในปี 2023 เมื่อ Meta เปิดตัวตระกูล Llama จุดประกายขบวนการ "open-weights" พิสูจน์ว่านักพัฒนาไม่จำเป็นต้องพึ่งระบบปิดของบริษัทยักษ์เพื่อสร้าง AI ชั้นนำอีกต่อไป

ตลอดปี 2024 และ 2025 การพัฒนาโอเพ่นซอร์ส เร่งตัวอย่างดุเดือด โมเดลอย่าง Llama 3.1 ขนาดใหญ่ของ Meta และตระกูล Llama 4 ต่อมา ควบคู่กับสถาปัตยกรรมประสิทธิภาพสูงจากสตาร์ทอัพอย่าง Mistral และโมเดลให้เหตุผลทรงพลังจาก DeepSeek พิสูจน์ว่าโมเดลเปิดเผยน้ำหนักสามารถทัดเทียม และบางครั้งแซงหน้าคู่แข่งปิดซอร์สได้

ขณะเดียวกัน โมเดลปิดซอร์สก็วิวัฒน์ความสามารถซับซ้อนต่อเนื่อง GPT-4 ในปี 2023 ที่แนะนำความสามารถมัลติโหมด และ GPT-4o ในปี 2024 ที่รวมการประมวลผลข้อความ ภาพ และเสียงไว้ในโมเดลเดียว

ช่วงปลายปี 2024 เกิดจุดเปลี่ยนสำคัญอีกครั้งด้วยโมเดลอย่างตระกูล o1 ของ OpenAI และ R1 แบบเปิดของ DeepSeek ที่นำเสนอ 'ห่วงโซ่ความคิด' ภายใน เพื่อให้เหตุผลเชิงตรรกะและคณิตศาสตร์ที่ซับซ้อนก่อนตอบ

ปลายปี 2025 ต่อเนื่องถึง 2026 ภูมิทัศน์เปลี่ยนจากผู้ช่วยสนทนาไปสู่ระบบอัตโนมัติ ด้วยการเปิดตัวตระกูล GPT-5 นำความสามารถวางแผนหลายขั้น ความจำระยะยาว และเวิร์กโฟลว์เชิงตัวแทนที่แข็งแกร่งสู่โครงสร้างพื้นฐานองค์กร

การเปลี่ยนจากโมเดล RNN อย่าง LSTM มาสู่ Transformers สำหรับปัญหา NLP

ในช่วงที่ Transformer เปิดตัว Recurrent Neural Networks (RNNs) เป็นแนวทางยอดนิยมสำหรับข้อมูลลำดับ ที่มีลำดับของอินพุตเฉพาะตัว

RNN ทำงานคล้ายโครงข่ายแบบป้อนหน้า แต่ประมวลผลอินพุตแบบลำดับ ทีละองค์ประกอบ

Transformers ได้แรงบันดาลใจจากสถาปัตยกรรม encoder-decoder ของ RNN อย่างไรก็ตาม แทนการใช้ความวนซ้ำ โมเดล Transformer อาศัยกลไก Attention อย่างสมบูรณ์

นอกจากปรับปรุงประสิทธิภาพของ RNN แล้ว Transformers ยังมอบสถาปัตยกรรมใหม่เพื่อแก้โจทย์อื่น ๆ มากมาย เช่น สรุปความข้อความ ใส่คำบรรยายภาพ และรู้จำเสียงพูด

แล้วปัญหาหลักของ RNN คืออะไร? พวกมันไม่ค่อยมีประสิทธิภาพสำหรับงาน NLP ด้วยสองเหตุผลหลัก:

  • ประมวลผลข้อมูลอินพุตแบบลำดับทีละรายการ กระบวนการวนซ้ำเช่นนี้ไม่ใช้ประโยชน์จาก GPU สมัยใหม่ซึ่งออกแบบมาสำหรับการคำนวณแบบขนาน ทำให้การฝึกโมเดลช้าลงมาก
  • ไร้ประสิทธิภาพเมื่อองค์ประกอบอยู่ห่างกัน เนื่องจากข้อมูลถูกส่งต่อทุกสเต็ป และยิ่งห่วงโซ่ยาว โอกาสที่ข้อมูลสูญหายระหว่างทางยิ่งสูง

การเปลี่ยนจาก RNN อย่าง LSTM มาสู่ Transformers ใน NLP ขับเคลื่อนโดยสองปัญหานี้ และความสามารถของ Transformers ที่รับมือทั้งคู่ด้วยการพัฒนากลไก Attention:

  • ให้ความสนใจกับคำสำคัญ ไม่ว่าจะอยู่ห่างกันเพียงใด
  • เพิ่มความเร็วในการทำงาน

ดังนั้น Transformers จึงเป็นวิวัฒนาการตามธรรมชาติของ RNN

ต่อไป มาดูการทำงานของทรานส์ฟอร์เมอร์

สถาปัตยกรรมของ Transformer

ภาพรวม

เดิมทีถูกออกแบบมาสำหรับ sequence transduction หรือ neural machine translation ทรานส์ฟอร์เมอร์โดดเด่นในการแปลงลำดับอินพุตเป็นลำดับเอาต์พุต นี่คือโมเดล transduction ตัวแรกที่พึ่งพา self-attention อย่างเต็มที่เพื่อคำนวณตัวแทนของอินพุตและเอาต์พุต โดยไม่ใช้ RNN ที่จัดแนวลำดับหรือคอนโวลูชัน ลักษณะแกนกลางของสถาปัตยกรรม Transformers คือการคงแบบจำลอง encoder-decoder

หากมอง Transformer สำหรับแปลภาษาเป็นกล่องดำง่าย ๆ มันจะรับประโยคในภาษาหนึ่ง เช่น อังกฤษ เป็นอินพุต แล้วส่งเอาต์พุตเป็นคำแปลเป็นภาษาอังกฤษ

สถาปัตยกรรมทรานส์ฟอร์เมอร์สำหรับการแปลภาษาในมุมมองกล่องดำ แปลจากอังกฤษเป็นสเปน

ภาพโดยผู้เขียน

หากเจาะลึกลงไป จะเห็นว่ากล่องดำนี้ประกอบด้วยสองส่วนหลัก:

  • Encoder รับอินพุตและส่งออกเมทริกซ์ตัวแทนของอินพุตนั้น เช่น ประโยคภาษาอังกฤษ “How are you?”
  • Decoder รับตัวแทนที่เข้ารหัสนั้นและสร้างเอาต์พุตแบบวนซ้ำทีละขั้น ในตัวอย่างคือคำแปล “¿Cómo estás?”

สถาปัตยกรรมทรานส์ฟอร์เมอร์สำหรับแปลภาษาที่มีสองโมดูลทั่วไป (Encoder และ Decoder)

ภาพโดยผู้เขียน โครงสร้างโดยรวมของ Encoder-Decoder

อย่างไรก็ตาม ทั้ง encoder และ decoder แท้จริงคือกองซ้อนหลายเลเยอร์ (จำนวนเท่ากัน) Encoder ทุกตัวมีโครงสร้างเดียวกัน อินพุตจะเข้าสู่แต่ละตัวและส่งต่อไปตัวถัดไป Decoder ทุกตัวก็มีโครงสร้างเดียวกัน รับอินพุตจาก encoder ตัวสุดท้ายและ decoder ตัวก่อนหน้า

สถาปัตยกรรมดั้งเดิมประกอบด้วย encoder 6 ตัวและ decoder 6 ตัว แต่สามารถทำซ้ำเลเยอร์ได้ตามต้องการ สมมติว่ามี N เลเยอร์ของแต่ละฝั่ง

สถาปัตยกรรมทรานส์ฟอร์เมอร์สำหรับแปลภาษาที่ทำซ้ำโมดูล Encoder และ Decoder อย่างละ N ครั้ง

ภาพโดยผู้เขียน โครงสร้างโดยรวมของ Encoder-Decoder แบบหลายเลเยอร์

เมื่อมีภาพรวมแล้ว มาจดจ่อที่ Encoder และ Decoder เพื่อเข้าใจขั้นตอนการทำงานให้ชัดเจนขึ้น:

เวิร์กโฟลว์ของ Encoder

Encoder เป็นองค์ประกอบพื้นฐานของสถาปัตยกรรม Transformer หน้าที่หลักคือแปลงโทเค็นอินพุตให้เป็นตัวแทนเชิงบริบท ต่างจากโมเดลยุคก่อนที่ประมวลผลโทเค็นอย่างอิสระ Encoder ของ Transformer จับบริบทของแต่ละโทเค็นสัมพันธ์กับทั้งลำดับ

องค์ประกอบโครงสร้างมีดังนี้:

สถาปัตยกรรมของ encoder ของทรานส์ฟอร์เมอร์

ภาพโดยผู้เขียน โครงสร้างโดยรวมของ Encoders

แยกเวิร์กโฟลว์เป็นขั้นตอนพื้นฐาน:

ขั้นตอนที่ 1 - Input Embeddings

การฝังคำเกิดขึ้นเฉพาะใน encoder ชั้นล่างสุด Encoder เริ่มจากการแปลงโทเค็นอินพุต—คำหรือหน่วยย่อย—ให้เป็นเวกเตอร์ด้วยเลเยอร์ embedding ซึ่งจับความหมายเชิงความหมายของโทเค็นและแปลงเป็นตัวเลข

Encoder ทุกตัวรับรายการเวกเตอร์ ขนาดละ 512 (ขนาดคงที่) ใน encoder ล่างสุดคือ word embeddings ส่วน encoder อื่น ๆ จะรับเอาต์พุตจาก encoder ที่อยู่ถัดลงมาโดยตรง

เวิร์กโฟลว์ของ Encoder วิธีทำงานของ input embedding

ภาพโดยผู้เขียน เวิร์กโฟลว์ของ Encoder: Input embedding

ขั้นตอนที่ 2 - Positional Encoding

เนื่องจาก Transformers ไม่มีกลไกความวนซ้ำแบบ RNN จึงใช้ positional encodings ที่บวกกับ input embeddings เพื่อระบุตำแหน่งของแต่ละโทเค็นในลำดับ ทำให้เข้าใจตำแหน่งของแต่ละคำภายในประโยค

นักวิจัยเสนอให้ใช้การผสมผสานฟังก์ชันไซน์และโคไซน์หลายแบบเพื่อสร้างเวกเตอร์ตำแหน่ง ทำให้ใช้ positional encoder กับประโยคยาวเท่าใดก็ได้

ในแนวทางนี้ แต่ละมิติแทนด้วยความถี่และระยะเลื่อนของคลื่นที่เป็นเอกลักษณ์ ค่าอยู่ในช่วง -1 ถึง 1 แทนตำแหน่งแต่ละจุดได้อย่างมีประสิทธิภาพ

เวิร์กโฟลว์ของ Encoder วิธีทำงานของ positional encoding

ภาพโดยผู้เขียน เวิร์กโฟลว์ของ Encoder: Positional encoding

ขั้นตอนที่ 3 - กองซ้อนของเลเยอร์ Encoder

Encoder ของ Transformer ประกอบด้วยกองซ้อนเลเยอร์ที่เหมือนกัน (6 เลเยอร์ในโมเดลดั้งเดิม)

เลเยอร์ encoder ทำหน้าที่แปลงลำดับอินพุตทั้งหมดให้เป็นตัวแทนต่อเนื่องเชิงนามธรรมที่ครอบคลุมข้อมูลที่เรียนรู้จากทั้งลำดับ เลเยอร์นี้ประกอบด้วยสองส่วนย่อย:

  • กลไก attention แบบหลายหัว
  • โครงข่ายเชื่อมต่อเต็ม

นอกจากนี้ยังมีการเชื่อมต่อแบบคงเหลือ (residual) รอบแต่ละซับเลเยอร์ แล้วตามด้วยการทำ layer normalization

เวิร์กโฟลว์ของ Encoder กองซ้อนเลเยอร์ของ encoders

ภาพโดยผู้เขียน เวิร์กโฟลว์ของ Encoder: Stack of Encoder Layers

ขั้นตอนที่ 3.1 กลไก Multi-Headed Self-Attention

ใน encoder กลไก attention แบบหลายหัวใช้ self-attention ช่วยให้โมเดลเชื่อมโยงแต่ละคำในอินพุตเข้ากับคำอื่น ๆ เช่น โมเดลอาจเรียนรู้ให้เชื่อมคำว่า “are” กับ “you”

กลไกนี้ทำให้ encoder โฟกัสส่วนต่าง ๆ ของลำดับอินพุตขณะประมวลผลแต่ละโทเค็น โดยคำนวณคะแนนความสนใจจาก:

  • Query คือเวกเตอร์ที่แทนคำหรือโทเค็นหนึ่ง ๆ จากลำดับอินพุตในกลไก attention
  • Key ก็เป็นเวกเตอร์ในกลไก attention ที่สอดคล้องกับแต่ละคำหรือโทเค็นในลำดับอินพุต
  • แต่ละ Value เชื่อมกับ Key และใช้สร้างเอาต์พุตของเลเยอร์ attention เมื่อ Query และ Key เข้าคู่กันดี (ได้คะแนนความสนใจสูง) Value ที่สอดคล้องกันจะถูกเน้นในเอาต์พุต

โมดูล Self-Attention แรกนี้ช่วยให้โมเดลจับข้อมูลเชิงบริบทจากทั้งลำดับ แทนการทำ attention เพียงครั้งเดียว Queries, Keys และ Values จะถูกฉายเชิงเส้น h ครั้ง บนแต่ละสำเนาที่ฉายเหล่านี้จะทำ attention แบบขนาน ให้ผลลัพธ์มิติ h

สถาปัตยกรรมละเอียดเป็นดังนี้:

เวิร์กโฟลว์ของ Encoder กลไก Multi-head Attention

Matrix Multiplication (MatMul) - ดอทโปรดักต์ของ Query และ Key

เมื่อเวกเตอร์ query, key และ value ผ่านเลเยอร์เชิงเส้นแล้ว จะทำการคูณเมทริกซ์แบบดอทโปรดักต์ระหว่าง queries และ keys เพื่อสร้างเมทริกซ์คะแนน

เมทริกซ์คะแนนกำหนดระดับการเน้นที่แต่ละคำควรให้ความสำคัญกับคำอื่น ๆ ดังนั้นแต่ละคำจะได้คะแนนสัมพันธ์กับคำอื่นภายในช่วงเวลาเดียวกัน คะแนนสูงหมายถึงโฟกัสมาก

กระบวนการนี้จับคู่อย่างมีประสิทธิภาพระหว่าง queries กับ keys

เวิร์กโฟลว์ของ Encoder กลไก Attention - Matrix Multiplication

ภาพโดยผู้เขียน เวิร์กโฟลว์ของ Encoder กลไก Attention - Matrix Multiplication

ลดขนาดความแรงของคะแนนความสนใจ

จากนั้นนำคะแนนไปหารด้วยรากที่สองของมิติของเวกเตอร์ query และ key เพื่อปรับสเกลลง ขั้นตอนนี้ช่วยให้กราดิเอนต์เสถียรขึ้น เพราะการคูณค่าอาจทำให้เกิดผลกระทบที่ใหญ่เกินไป

เวิร์กโฟลว์ของ Encoder ลดคะแนนความสนใจ

ภาพโดยผู้เขียน เวิร์กโฟลว์ของ Encoder ลดคะแนนความสนใจ

ใช้ Softmax กับคะแนนที่ปรับแล้ว

ถัดมาใช้ฟังก์ชัน softmax กับคะแนนที่ปรับสเกลเพื่อได้ค่าน้ำหนักความสนใจ เป็นความน่าจะเป็น 0 ถึง 1 Softmax เน้นคะแนนสูงและลดคะแนนต่ำ ช่วยให้โมเดลตัดสินใจได้ดีขึ้นว่าจะให้ความสนใจกับคำใด

เวิร์กโฟลว์ของ Encoder ใช้ Softmax กับคะแนนที่ปรับแล้ว

ภาพโดยผู้เขียน เวิร์กโฟลว์ของ Encoder Softmax adjusted scores

ผสานผล Softmax กับเวกเตอร์ Value

ขั้นตอนถัดไปของกลไก attention คือนำน้ำหนักจาก softmax คูณกับเวกเตอร์ value ได้เวกเตอร์เอาต์พุต

ในกระบวนการนี้ จะเก็บไว้เฉพาะคำที่ได้คะแนน softmax สูง สุดท้ายส่งเวกเตอร์เอาต์พุตนี้เข้าสู่เลเยอร์เชิงเส้นเพื่อประมวลผลต่อ

เวิร์กโฟลว์ของ Encoder ผสานผล Softmax กับเวกเตอร์ value

ภาพโดยผู้เขียน เวิร์กโฟลว์ของ Encoder ผสานผล Softmax กับเวกเตอร์ value

และนี่คือเอาต์พุตของกลไก Attention!

แล้วทำไมถึงเรียกว่า Multi-Head Attention?

จำได้ไหมว่าก่อนเริ่มกระบวนการ เราแบ่ง queries, keys และ values ออกเป็น h ส่วน กระบวนการ self-attention นี้เกิดแยกกันในสเตจย่อยแต่ละ ‘หัว’ แต่ละหัวทำงานอิสระ สร้างเวกเตอร์เอาต์พุตของตัวเอง

ชุดผลลัพธ์เหล่านี้ผ่านเลเยอร์เชิงเส้นสุดท้าย เปรียบเหมือนตัวกรองที่ปรับจูนการทำงานร่วมกัน จุดเด่นอยู่ที่ความหลากหลายในการเรียนรู้ของแต่ละหัว ทำให้ encoder เข้าใจได้ลึกซึ้งหลายมิติ

หากต้องการเจาะลึกกลไก attention ดูบทเรียนของเราเรื่อง multi-head attention ใน Transformers

ขั้นตอนที่ 3.2 การทำ Normalization และ Residual Connections

ซับเลเยอร์แต่ละตัวในเลเยอร์ encoder จะตามด้วยขั้นตอน normalization นอกจากนี้ เอาต์พุตของแต่ละซับเลเยอร์จะถูกบวกกลับเข้ากับอินพุต (residual connection) เพื่อลดปัญหา vanishing gradient เปิดทางให้โมเดลลึกขึ้น กระบวนการนี้จะทำซ้ำหลังโครงข่าย Feed-Forward ด้วย

เวิร์กโฟลว์ของ Encoder การทำ Normalization และ residual หลัง Multi-Head Attention

ภาพโดยผู้เขียน เวิร์กโฟลว์ของ Encoder การทำ Normalization และ residual หลัง Multi-Head Attention

ขั้นตอนที่ 3.3 โครงข่ายประสาทแบบ Feed-Forward

เอาต์พุตแบบ residual ที่ผ่านการ normalize จะผ่านโครงข่าย feed-forward แบบจุดต่อจุด ซึ่งเป็นช่วงสำคัญสำหรับปรับแต่งเพิ่มเติม

นึกถึงเครือข่ายนี้เป็นเลเยอร์เชิงเส้นสองชั้น มีการกระตุ้นแบบ ReLU คั่นกลาง เมื่อประมวลผลแล้ว เอาต์พุตจะวนกลับมารวมกับอินพุตของโครงข่าย feed-forward แบบจุดต่อจุด

จากนั้นตามด้วยการ normalize อีกครั้ง เพื่อให้ทุกอย่างปรับจูนและพร้อมสำหรับขั้นตอนถัดไป

เวิร์กโฟลว์ของ Encoder ซับเลเยอร์ Feed-Forward Neural Network

ภาพโดยผู้เขียน เวิร์กโฟลว์ของ Encoder: ซับเลเยอร์ Feed-Forward Neural Network

ขั้นตอนที่ 4 - เอาต์พุตของ Encoder

เอาต์พุตของเลเยอร์ encoder สุดท้ายคือชุดเวกเตอร์ที่แทนลำดับอินพุตพร้อมความเข้าใจเชิงบริบทที่เข้มข้น จากนั้นเอาต์พุตนี้จะถูกใช้เป็นอินพุตให้ decoder ในโมเดล Transformer

การเข้ารหัสอย่างพิถีพิถันนี้ปูทางให้ decoder ชี้นำให้สนใจคำที่ถูกต้องในอินพุตเมื่อถึงเวลาถอดรหัส

นึกเหมือนการต่อหอคอย ที่สามารถซ้อนเลเยอร์ encoder ได้ N ชั้น แต่ละชั้นได้โอกาสสำรวจและเรียนรู้แง่มุมต่าง ๆ ของ attention เสมือนชั้นความรู้ สิ่งนี้ไม่เพียงเพิ่มความหลากหลายในการเข้าใจ แต่ยังเพิ่มศักยภาพการพยากรณ์ของเครือข่าย Transformer อย่างมีนัยสำคัญ

เวิร์กโฟลว์ของ Decoder

บทบาทของ decoder คือการประพันธ์ลำดับข้อความ สะท้อนโครงของ encoder โดย decoder มีซับเลเยอร์คล้ายกัน ประกอบด้วยเลเยอร์ attention แบบหลายหัวสองชุด เลเยอร์ feed-forward แบบจุดต่อจุด และมีทั้ง residual connections และ layer normalization หลังแต่ละซับเลเยอร์

โครงสร้างโดยรวมของ Encoders

ภาพโดยผู้เขียน โครงสร้างโดยรวมของ Encoders

องค์ประกอบเหล่านี้ทำงานคล้ายเลเยอร์ของ encoder แต่มีเกร็ดสำคัญ: แต่ละเลเยอร์ attention แบบหลายหัวใน decoder มีภารกิจเฉพาะของตน

ขั้นสุดท้ายของกระบวนการ decoder ผ่านเลเยอร์เชิงเส้น ทำหน้าที่เป็นตัวจำแนก ตามด้วยฟังก์ชัน softmax เพื่อคำนวณความน่าจะเป็นของคำต่าง ๆ

Decoder ของ Transformer มีโครงสร้างที่ออกแบบมาเพื่อสร้างเอาต์พุตด้วยการถอดรหัสข้อมูลที่เข้ารหัสแบบทีละก้าว

ควรสังเกตว่า decoder ทำงานแบบ autoregressive โดยเริ่มต้นด้วย start token ใช้รายการเอาต์พุตที่สร้างมาก่อนหน้าเป็นอินพุต ประกบกับเอาต์พุตจาก encoder ที่อุดมด้วยข้อมูล attention จากอินพุตเริ่มต้น

การถอดรหัสแบบลำดับนี้ดำเนินต่อไปจนกระทั่ง decoder สร้างโทเค็นที่ส่งสัญญาณว่าจบการสร้างเอาต์พุต

ขั้นตอนที่ 1 - Output Embeddings

จุดเริ่มของ decoder กระบวนการเหมือนกับ encoder อินพุตจะผ่านเลเยอร์ embedding ก่อน

ขั้นตอนที่ 2 - Positional Encoding

หลังการฝังคำ เช่นเดียวกับ encoder อินพุตจะผ่านเลเยอร์ positional encoding เพื่อสร้าง positional embeddings

จากนั้น positional embeddings จะถูกป้อนเข้าสู่เลเยอร์ multi-head attention ตัวแรกของ decoder ซึ่งคำนวณคะแนนความสนใจที่จำเพาะกับอินพุตของ decoder

ขั้นตอนที่ 3 - กองซ้อนของเลเยอร์ Decoder

Decoder ประกอบด้วยกองซ้อนเลเยอร์ที่เหมือนกัน (6 เลเยอร์ในโมเดลดั้งเดิม) แต่ละเลเยอร์มีองค์ประกอบย่อยหลักสามส่วน:

ขั้นตอนที่ 3.1 กลไก Masked Self-Attention

คล้าย self-attention ใน encoder แต่ต่างสำคัญตรงที่ห้ามตำแหน่งหนึ่งสนใจตำแหน่งถัดไป หมายความว่าแต่ละคำในลำดับจะไม่ถูกอิทธิพลจากโทเค็นอนาคต

เช่น เมื่อคำนวณคะแนน attention ของคำว่า "are" สำคัญที่ "are" จะต้องไม่แอบดูคำว่า "you" ซึ่งอยู่ถัดไปในลำดับ

เวิร์กโฟลว์ของ Decoder หน้ากาก Multi-Head Attention ตัวแรก

ภาพโดยผู้เขียน เวิร์กโฟลว์ของ Decoder หน้ากาก Multi-Head Attention ตัวแรก

การทำหน้ากากนี้ทำให้การทำนายตำแหน่งหนึ่งขึ้นกับเอาต์พุตที่ทราบแล้วจากตำแหน่งก่อนหน้าเท่านั้น

ขั้นตอนที่ 3.2 - Encoder-Decoder Multi-Head Attention หรือ Cross Attention

ในเลเยอร์ attention แบบหลายหัวตัวที่สองของ decoder จะเกิดปฏิสัมพันธ์พิเศษระหว่างองค์ประกอบของ encoder และ decoder ที่นี่ เอาต์พุตจาก encoder ทำหน้าที่เป็นทั้ง queries และ keys ขณะที่เอาต์พุตจากเลเยอร์ attention ตัวแรกของ decoder ทำหน้าที่เป็น values

การตั้งค่านี้จัดแนวอินพุตของ encoder เข้ากับ decoder ทำให้ decoder ระบุและเน้นส่วนที่เกี่ยวข้องมากที่สุดของอินพุตจาก encoder

จากนั้นเอาต์พุตจากเลเยอร์ attention ตัวที่สองจะถูกปรับแต่งผ่านเลเยอร์ feed-forward แบบจุดต่อจุด เพิ่มประสิทธิภาพการประมวลผลยิ่งขึ้น

เวิร์กโฟลว์ของ Decoder Encoder-Decoder Attention

ภาพโดยผู้เขียน เวิร์กโฟลว์ของ Decoder Encoder-Decoder Attention

ในซับเลเยอร์นี้ queries มาจากเลเยอร์ decoder ก่อนหน้า ส่วน keys และ values มาจากเอาต์พุตของ encoder ทำให้ทุกตำแหน่งใน decoder สามารถสนใจทุกตำแหน่งในลำดับอินพุต บูรณาการข้อมูลจาก encoder เข้ากับข้อมูลใน decoder อย่างมีประสิทธิภาพ

ขั้นตอนที่ 3.3 โครงข่ายประสาทแบบ Feed-Forward

เช่นเดียวกับ encoder แต่ละเลเยอร์ของ decoder มีโครงข่าย feed-forward แบบเชื่อมต่อเต็ม ใช้กับแต่ละตำแหน่งแยกจากกันและเหมือนกันทุกจุด

ขั้นตอนที่ 4 ตัวจำแนกเชิงเส้นและ Softmax สำหรับสร้างความน่าจะเป็นของเอาต์พุต

การเดินทางของข้อมูลในโมเดล Transformer จบลงที่เลเยอร์เชิงเส้นสุดท้ายซึ่งทำหน้าที่เป็นตัวจำแนก

ขนาดของตัวจำแนกสอดคล้องกับจำนวนคลาสทั้งหมด (จำนวนคำในคลังคำศัพท์) เช่น หากมี 1000 คลาสแทน 1000 คำ เอาต์พุตของตัวจำแนกจะเป็นอาร์เรย์ 1000 ค่า

จากนั้นส่งเอาต์พุตนี้เข้าสู่เลเยอร์ softmax ซึ่งแปลงเป็นช่วงคะแนนความน่าจะเป็นระหว่าง 0 ถึง 1 ค่าความน่าจะเป็นสูงสุดคือกุญแจ โดยดัชนีที่สอดคล้องจะชี้ตรงไปยังคำที่โมเดลทำนายว่าเป็นคำถัดไปในลำดับ

เวิร์กโฟลว์ของ Decoder เอาต์พุตสุดท้ายของ Transformer

ภาพโดยผู้เขียน เวิร์กโฟลว์ของ Decoder เอาต์พุตสุดท้ายของ Transformer

Normalization และ Residual Connections

แต่ละซับเลเยอร์ (masked self-attention, encoder-decoder attention, feed-forward network) ตามด้วยขั้นตอน normalization และมี residual connection ล้อมรอบ

เอาต์พุตของ Decoder

เอาต์พุตของเลเยอร์สุดท้ายถูกแปลงเป็นลำดับที่ทำนายได้ โดยทั่วไปผ่านเลเยอร์เชิงเส้นและตามด้วย softmax เพื่อสร้างความน่าจะเป็นเหนือคลังคำศัพท์

ในกระบวนการทำงาน Decoder จะผนวกรวมเอาต์พุตที่เพิ่งสร้างเข้ากับรายชื่ออินพุตที่เพิ่มขึ้น แล้วดำเนินการถอดรหัสต่อ วนซ้ำเช่นนี้จนโมเดลทำนายโทเค็นเฉพาะที่บ่งชี้ว่าเสร็จสมบูรณ์

โทเค็นที่ทำนายได้ด้วยความน่าจะเป็นสูงสุดจะถูกกำหนดให้เป็นคลาสสุดท้าย ซึ่งมักเป็น end token

โปรดจำอีกครั้งว่า decoder ไม่ได้จำกัดเพียงเลเยอร์เดียว สามารถจัดเป็น N เลเยอร์ โดยแต่ละชั้นต่อยอดจากอินพุตที่ได้รับจาก encoder และเลเยอร์ก่อนหน้า สถาปัตยกรรมแบบซ้อนชั้นนี้ทำให้โมเดลกระจายจุดโฟกัสและดึงรูปแบบ attention ที่หลากหลายข้ามแต่ละหัว

แนวทางหลายเลเยอร์เช่นนี้สามารถเพิ่มความสามารถในการพยากรณ์ของโมเดลได้อย่างมาก เนื่องจากพัฒนาเข้าใจชุดผสมผสานของ attention ได้ละเอียดยิ่งขึ้น

สถาปัตยกรรมสุดท้ายมีหน้าตาดังนี้ (จากบทความต้นฉบับ):

โครงสร้างดั้งเดิมของ Transformers

ภาพโดยผู้เขียน โครงสร้างดั้งเดิมของ Transformers

เพื่อเข้าใจสถาปัตยกรรมนี้ให้ดียิ่งขึ้น ขอแนะนำให้ลองสร้าง Transformer ตั้งแต่ต้นตามบทเรียนสร้าง Transformer ด้วย PyTorch นี้

โมเดล Transformer ในโลกจริง

BERT

BERT ที่ Google เปิดตัวในปี 2018 เป็นเฟรมเวิร์กโอเพ่นซอร์สสำหรับ NLP ที่ปฏิวัติวงการด้วยการฝึกแบบสองทิศทาง (bidirectional) ซึ่งทำให้โมเดลทำนายคำถัดไปได้อย่างมีบริบทมากขึ้น

ด้วยการเข้าใจบริบทจากทั้งสองด้านของคำ BERT ทำผลงานเหนือกว่าโมเดลก่อนหน้าในงานอย่างถาม-ตอบและทำความเข้าใจภาษาคลุมเครือ แกนกลางของมันใช้ Transformers เชื่อมองค์ประกอบเอาต์พุตและอินพุตอย่างไดนามิก

BERT ซึ่งผ่านการพรีเทรนบนวิกิพีเดีย ทำได้ดีเยี่ยมในงาน NLP หลากหลาย จน Google นำไปผนวกกับเสิร์ชเอนจินเพื่อรองรับคำค้นตามธรรมชาติมากขึ้น นวัตกรรมนี้จุดประกายการแข่งขันพัฒนาโมเดลภาษาและยกระดับความสามารถด้านความเข้าใจภาษาซับซ้อนของสาขานี้อย่างมาก

ดูเพิ่มเติมเกี่ยวกับ BERT ได้ในบทความแยกที่ แนะนำโมเดล BERT

LaMDA

LaMDA (Language Model for Dialogue Applications) เป็นโมเดลบน Transformer ที่พัฒนาโดย Google ออกแบบมาเพื่อภารกิจสนทนา เปิดตัวในงาน Google I/O 2021 ออกแบบมาเพื่อสร้างคำตอบที่เป็นธรรมชาติและตรงบริบทมากขึ้น ยกระดับประสบการณ์โต้ตอบของผู้ใช้ในหลายแอปพลิเคชัน

การออกแบบของ LaMDA ทำให้เข้าใจและตอบสนองหัวข้อและเจตนาผู้ใช้ที่หลากหลาย เหมาะอย่างยิ่งกับแชตบอต ผู้ช่วยเสมือน และระบบ AI แบบโต้ตอบอื่น ๆ ที่การสนทนาแบบพลวัตคือหัวใจ

การโฟกัสที่ความเข้าใจและการตอบสนองเชิงสนทนานี้ทำให้ LaMDA เป็นก้าวสำคัญใน NLP และการสื่อสารที่ขับเคลื่อนด้วย AI

หากสนใจทำความเข้าใจโมเดล LaMDA เพิ่มเติม อ่านได้จากบทความเกี่ยวกับ LaMDA ของเรา

GPT และ ChatGPT

GPT และ ChatGPT ที่พัฒนาโดย OpenAI เป็นโมเดลเชิงกำเนิดขั้นสูงซึ่งขึ้นชื่อเรื่องความสามารถในการผลิตข้อความที่สอดคล้องและตรงบริบท GPT-1 เป็นรุ่นแรก เปิดตัวมิถุนายน 2018 และ GPT-3 ซึ่งเป็นหนึ่งในรุ่นที่ทรงอิทธิพล เปิดตัวในปี 2020

โมเดลเหล่านี้ชำนาญงานหลากหลาย ทั้งการสร้างคอนเทนต์ การสนทนา การแปลภาษา และอื่น ๆ อีกมากมาย สถาปัตยกรรมของ GPT ช่วยให้สร้างข้อความที่ใกล้เคียงงานเขียนของมนุษย์ เหมาะกับงานเขียนเชิงสร้างสรรค์ สนับสนุนลูกค้า และแม้แต่ช่วยเขียนโค้ด ส่วน ChatGPT ซึ่งปรับให้เหมาะกับบริบทสนทนา โดดเด่นในการสร้างบทสนทนาคล้ายมนุษย์ เหมาะกับแชตบอตและผู้ช่วยเสมือน

Claude

Claude ที่พัฒนาโดย Anthropic เป็นตระกูลผู้ช่วย AI บน Transformer ที่มุ่งเน้นความปลอดภัยและความเป็นประโยชน์ Claude ใช้ Constitutional AI (CAI) แนวทางการฝึกที่ให้โมเดลยึดหลักการชุดหนึ่งเพื่อให้ได้คำตอบที่เป็นประโยชน์ ไม่เป็นอันตราย และซื่อสัตย์

Claude 3 (ออกปี 2024) แนะนำสามระดับโมเดล Haiku, Sonnet และ Opus ให้ทางเลือกแลกเปลี่ยนระหว่างความเร็วกับศักยภาพ โมเดลเด่นด้านการให้เหตุผลละเอียดอ่อน ทำตามคำสั่งซับซ้อนได้ดี และคงบริบทในการสนทนายาว (สูงสุด 200K โทเค็น)

ในปี 2025 และ 2026 Anthropic เปิดตัวโมเดล Claude 4 โดยรุ่นล่าสุด Opus 4.6 และ Sonnet 4.6 ครองอันดับสูงในหลายเกณฑ์วัด LLM 

ความแปรผันอื่น ๆ

ภูมิทัศน์ของ foundation models โดยเฉพาะ transformer ขยายตัวอย่างรวดเร็ว งานศึกษาระบุโมเดลสำคัญกว่า 50 ตัว ขณะที่ กลุ่มสแตนฟอร์ดประเมิน 30 ตัว สะท้อนการเติบโตที่รวดเร็ว NLP Cloud สตาร์ทอัพนวัตกรรมในโครงการ Inception ของ NVIDIA ใช้โมเดลภาษาขนาดใหญ่ราว 25 ตัวเชิงพาณิชย์สำหรับหลายอุตสาหกรรม เช่น สายการบินและร้านขายยา

แนวโน้มเปิดซอร์สเพิ่มขึ้น โดยมีแพลตฟอร์มอย่าง Hugging Face model hub นำหน้า นอกจากนี้ยังมีโมเดลบน Transformer มากมายที่พัฒนาเฉพาะงาน NLP ต่าง ๆ โชว์ความอเนกประสงค์และประสิทธิภาพของโมเดลในงานที่หลากหลาย

เรียนรู้เพิ่มเติมเกี่ยวกับ Foundation Models ทั้งหมดได้ในบทความแยก ว่าคืออะไรและตัวใดที่ใช้งานมากที่สุด

สายพันธุ์ Transformer สมัยใหม่

นับตั้งแต่สถาปัตยกรรมปี 2017 ดั้งเดิม Transformers ได้พัฒนาอย่างมากเพื่อแก้ข้อจำกัดและขยายสู่โดเมนใหม่

Vision Transformers (ViT)

Vision Transformers นำกลไก self-attention ไปใช้กับภาพโดยแบ่งภาพเป็นแพตช์และมองแต่ละแพตช์เป็นโทเค็น วิธีนี้มีประสิทธิภาพสูงสำหรับจัดหมวดภาพ ตรวจจับวัตถุ และสร้างภาพ มักทำผลงานเหนือ CNN แบบดั้งเดิมเมื่อใช้ข้อมูลชุดใหญ่

Multimodal Transformers

โมเดลสมัยใหม่อย่าง GPT-5, Gemini 3 และ Llama 4 ประมวลผลอินพุตหลายชนิด (ข้อความ ภาพ เสียง วิดีโอ) ภายใต้สถาปัตยกรรมเดียว โมเดลมัลติโหมดเหล่านี้ใช้พื้นที่ embedding แบบรวม และกลไก cross-attention เพื่อให้เหตุผลข้ามโหมดต่าง ๆ พร้อมกัน

Efficient Transformers

ความซับซ้อนกำลังสองของ self-attention จำกัดความยาวบริบท นวัตกรรมหลายอย่างแก้โจทย์นี้:

  • Flash Attention: ปรับรูปแบบการเข้าถึงหน่วยความจำเพื่อลดการใช้หน่วยความจำ GPU และเร่งการฝึก 2–4 เท่า
  • Rotary Position Embeddings (RoPE): เข้ารหัสข้อมูลตำแหน่งด้วยเมทริกซ์การหมุน ช่วยให้ขยายไปยังลำดับยาวขึ้นได้ดี
  • ตัวแปร linear attention: Linformer, Performer และ Longformer ลดความซับซ้อนเป็น O(n) เพื่อประมวลผลเอกสารยาวมาก
  • Mixture of Experts (MoE): เปิดใช้งานพารามิเตอร์เพียงบางส่วนต่อโทเค็น ทำให้สร้างโมเดลใหญ่ขึ้นด้วยต้นทุนการคำนวณใกล้เคียงเดิม

เกณฑ์วัดและประสิทธิภาพ

การทดสอบเกณฑ์วัดและประเมินประสิทธิภาพของโมเดล Transformer ในงาน NLP ต้องใช้แนวทางอย่างเป็นระบบเพื่อวัดความมีประสิทธิผลและประสิทธิภาพ

ขึ้นกับลักษณะงาน มีวิธีและทรัพยากรต่างกัน:

งานแปลภาษา (Machine Translation)

สำหรับงานแปลภาษา สามารถใช้ชุดข้อมูลมาตรฐานอย่าง WMT (Workshop on Machine Translation) ที่ระบบแปลพบคู่ภาษาหลากหลายพร้อมความท้าทายเฉพาะ

ตัวชี้วัดอย่าง BLEU, METEOR, TER และ chrF ทำหน้าที่เป็นเข็มทิศ ชี้นำสู่ความแม่นยำและความลื่นไหล

นอกจากนี้ การทดสอบครอบคลุมโดเมนที่หลากหลายอย่างข่าว วรรณกรรม และบทความเทคนิค ช่วยให้ระบบแปลมีความยืดหยุ่นและอเนกประสงค์ เป็นพหุภาษาในโลกดิจิทัลอย่างแท้จริง

เกณฑ์วัด QA

เพื่อประเมินโมเดลถาม-ตอบ ใช้ชุดคำถาม-คำตอบเฉพาะเช่น SQuAD (Stanford Question Answering Dataset), Natural Questions หรือ TriviaQA

แต่ละชุดเหมือนเกมคนละกติกา เช่น SQuAD เน้นหาคำตอบในข้อความที่กำหนด ขณะที่บางชุดเหมือนเกมควิซที่คำถามมาจากที่ไหนก็ได้

เพื่อตรวจวัดผลงาน เราใช้คะแนนอย่าง Precision, Recall, F1 และบางครั้งคะแนน exact match

เกณฑ์วัด NLI

สำหรับงาน Natural Language Inference (NLI) ใช้ชุดข้อมูลเฉพาะอย่าง SNLI, MultiNLI และ ANLI

เหมือนคลังใหญ่ที่รวมความหลากหลายของภาษาและกรณีท้าทาย ช่วยตรวจว่าคอมพิวเตอร์เข้าใจประโยคต่างรูปแบบได้ดีแค่ไหน เราตรวจเป็นหลักที่ความแม่นยำในการตัดสินว่าข้อความสอดคล้อง ขัดแย้ง หรือไม่เกี่ยวข้อง

นอกจากนี้สำคัญที่จะพิจารณาวิธีที่คอมพิวเตอร์จัดการภาษาชวนคิด เช่น การอ้างอิงถึงสิ่งที่กล่าวก่อนหน้า หรือความเข้าใจคำอย่าง ‘not’, ‘all’ และ ‘some’

เปรียบเทียบกับสถาปัตยกรรมอื่น

ในโลกของโครงข่ายประสาท มีโครงสร้างเด่นสองชนิดที่มักนำมาเทียบกับ Transformers แต่ละแบบมีจุดเด่นและความท้าทาย เหมาะกับการประมวลผลข้อมูลแบบต่างกัน ได้แก่ RNN ซึ่งกล่าวถึงหลายครั้งแล้วในบทความนี้ และเลเยอร์คอนโวลูชัน

เลเยอร์แบบเวียนเกิด (Recurrent Layers)

Recurrent Layers ซึ่งเป็นแกนของ RNN เด่นในการจัดการข้อมูลลำดับ จุดแข็งคือความสามารถในการทำงานเชิงลำดับ สำคัญต่อภารกิจอย่างประมวลผลภาษาและอนุกรมเวลา ใน Recurrent Layer เอาต์พุตจากก้าวก่อนหน้าจะถูกป้อนกลับเป็นอินพุตของก้าวถัดไป วงจรนี้ทำให้เครือข่ายจดจำข้อมูลก่อนหน้า ซึ่งจำเป็นต่อการเข้าใจบริบทในลำดับ

อย่างไรก็ดี ดังที่กล่าวไปแล้ว การประมวลผลแบบลำดับมีนัยสำคัญสองประการ:

  • ทำให้เวลาฝึกนานขึ้น เพราะแต่ละก้าวขึ้นกับก้าวก่อนหน้า ทำให้การประมวลผลแบบขนานเป็นเรื่องท้าทาย
  • มักลำบากกับความสัมพันธ์ระยะยาวเพราะปัญหา vanishing gradient เครือข่ายเรียนรู้จากจุดข้อมูลที่อยู่ห่างกันในลำดับได้ยากลง

Transformer แตกต่างจากสถาปัตยกรรมที่ใช้เลเยอร์เวียนเกิดอย่างมีนัยเพราะไม่มีความวนซ้ำ และดังที่เห็นก่อนหน้า เลเยอร์ Attention ของ Transformer รับมือปัญหาทั้งสอง ทำให้เป็นวิวัฒนาการตามธรรมชาติของ RNN สำหรับงาน NLP

เลเยอร์คอนโวลูชัน

อีกด้าน เลเยอร์คอนโวลูชัน ซึ่งเป็นบล็อกพื้นฐานของ CNN มีชื่อเสียงด้านประสิทธิภาพในการประมวลผลข้อมูลเชิงพื้นที่อย่างภาพ

เลเยอร์เหล่านี้ใช้เคอร์เนล (ฟิลเตอร์) สแกนข้อมูลอินพุตเพื่อดึงคุณลักษณะ ปรับความกว้างของเคอร์เนลได้ ทำให้โฟกัสกับคุณลักษณะเล็กหรือใหญ่ขึ้นกับภารกิจ

แม้เลเยอร์คอนโวลูชันจะยอดเยี่ยมในการจับลำดับชั้นเชิงพื้นที่และรูปแบบในข้อมูล แต่เผชิญความท้าทายกับความสัมพันธ์ระยะยาว เพราะโดยพื้นฐานไม่ได้คำนึงถึงข้อมูลเชิงลำดับ ทำให้เหมาะน้อยกว่าสำหรับงานที่ต้องเข้าใจลำดับหรือบริบท

ด้วยเหตุนี้ CNN และ Transformer จึงเหมาะกับข้อมูลและภารกิจต่างชนิดกัน CNN ครองงานคอมพิวเตอร์วิทัศน์เพราะประสิทธิภาพในการประมวลผลข้อมูลเชิงพื้นที่ ขณะที่ Transformers เป็นตัวเลือกหลักสำหรับงานลำดับซับซ้อน โดยเฉพาะใน NLP เพราะเข้าใจความสัมพันธ์ระยะไกลได้ดี

ข้อเสียและข้อจำกัดของ Transformer

แม้ประสบความสำเร็จ Transformers ก็มีข้อจำกัดที่ควรทราบ:

  • ความซับซ้อนกำลังสอง: Self-attention ขยายเป็น O(n²) ตามความยาวลำดับ ทำให้บริบทยาวมากมีต้นทุนคำนวณสูง
  • ความต้องการหน่วยความจำ: โมเดลใหญ่ต้องใช้หน่วยความจำ GPU มาก จำกัดทางเลือกการปรับใช้
  • ความต้องการข้อมูลฝึก: โดยทั่วไป Transformers ต้องการชุดข้อมูลขนาดใหญ่มากเพื่อให้ได้ผลงานดี
  • ขาดการให้เหตุผลอย่างชัดแจ้ง: แม้จะจับรูปแบบได้ทรงพลัง Transformers ไม่ได้ให้เหตุผลเชิงสัญลักษณ์ และอาจแต่งข้อเท็จจริงขึ้นมา
  • ข้อจำกัดของการเข้ารหัสตำแหน่ง: Positional encodings มาตรฐานยากต่อการทำให้ทั่วไปกับความยาวลำดับที่ไม่เคยพบตอนฝึก

งานวิจัยยังคงแก้ข้อจำกัดเหล่านี้ผ่านนวัตกรรมสถาปัตยกรรม เช่น Flash Attention, mixture-of-experts และ retrieval-augmented generation (RAG)

บทสรุป

กล่าวโดยสรุป Transformers ได้กลายเป็นความก้าวหน้าครั้งสำคัญในปัญญาประดิษฐ์และ NLP

ด้วยการจัดการข้อมูลลำดับได้อย่างมีประสิทธิภาพผ่านกลไก self-attention อันเป็นเอกลักษณ์ โมเดลเหล่านี้ทำผลงานเหนือ RNN แบบดั้งเดิม ความสามารถในการจัดการลำยายาวได้ดีกว่าและประมวลผลแบบขนานช่วยเร่งการฝึกอย่างมาก

โมเดลบุกเบิกอย่าง BERT ของ Google และตระกูล GPT ของ OpenAI แสดงให้เห็นผลกระทบเชิงเปลี่ยนผ่านของ Transformers ในการยกระดับเสิร์ชเอนจินและการสร้างข้อความคล้ายมนุษย์

ผลที่ตามมา พวกมันจึงกลายเป็นสิ่งจำเป็นในแมชชีนเลิร์นนิงยุคใหม่ ผลักดันขอบเขตของ AI และเปิดเส้นทางใหม่ ๆ ในความก้าวหน้าทางเทคโนโลยี

หากต้องการเจาะลึก Transformers และการใช้งานจริง บทความของเราเรื่อง Transformers และ Hugging Face คือจุดเริ่มต้นที่ดีเยี่ยม นอกจากนี้ยังเรียนรู้วิธี สร้าง Transformer ด้วย PyTorch ได้จากไกด์ฉบับละเอียดของเรา

หัวข้อ
แมชชีนเลิร์นนิง

เรียนรู้เพิ่มเติมเกี่ยวกับ Transformers และ LLMs!

Courses

แนวคิดของ Large Language Models (LLMs)

2 ชม.
109.7K
ค้นพบศักยภาพเต็มที่ของ LLMs ด้วยคอร์สเชิงแนวคิดที่ครอบคลุมการใช้งาน LLMs วิธีการฝึกอบรม ประเด็นจริยธรรม และงานวิจัยล่าสุด
ดูรายละเอียดRight Arrow
เริ่มหลักสูตร
ดูเพิ่มเติมRight Arrow