ไทย
← กลับหน้าแรก

สถาปัตยกรรมโมเดล

โครงสร้างที่กำหนดวิธีแทนและแปลงข้อมูลของโมเดล

3 รายการ
2017

Transformer

สถาปัตยกรรมโครงข่ายประสาทที่ใช้กลไก attention และประมวลผลตำแหน่งในลำดับแบบขนาน เป็นรากฐานของโมเดลภาษาและโมเดลหลายรูปแบบสมัยใหม่จำนวนมาก

  • self-attention
  • encoder
  • decoder
1991 / 2017 / 2021

Mixture of Experts (MoE)

ตระกูลสถาปัตยกรรมที่กำหนดเส้นทางไปยังเครือข่ายผู้เชี่ยวชาญ รุ่น sparse สมัยใหม่เปิดใช้ผู้เชี่ยวชาญเพียงบางส่วนต่ออินพุต จึงเพิ่มความจุโดยไม่ต้องใช้ทุกพารามิเตอร์กับทุกโทเคน

  • experts
  • router
  • sparse activation
2015 / DDPM 2020

Diffusion Model

โมเดลกำเนิดที่เรียนรู้การย้อนกระบวนการเติมสัญญาณรบกวนทีละน้อย การขจัดสัญญาณรบกวนซ้ำ ๆ กลายเป็นแนวทางสำคัญสำหรับการสร้างภาพ เสียง วิดีโอ และเนื้อหาหลายรูปแบบ

  • forward noise
  • denoising
  • score matching

เฟรมเวิร์กและการแทนข้อมูล

ซอฟต์แวร์และอินเทอร์เฟซข้อมูลสำหรับสร้าง ฝึก และเรียกใช้โมเดล

3 รายการ
2016–2017

PyTorch

เฟรมเวิร์กโอเพนซอร์สสำหรับเทนเซอร์และการเรียนรู้เชิงลึก มีการหาอนุพันธ์อัตโนมัติ โมดูลโครงข่ายประสาท การคอมไพล์ และการทำงานแบบกระจาย ใช้ตั้งแต่งานวิจัยจนถึงการฝึกจริง

  • tensor
  • autograd
  • module
2018–2019

Hugging Face Transformers

ไลบรารีนิยามโมเดลที่เชื่อมสถาปัตยกรรมซึ่งฝึกล่วงหน้ากับระบบนิเวศการฝึกและการอนุมาน ช่วยทำให้การตั้งค่า การเตรียมข้อมูล การโหลด การสร้าง และอินเทอร์เฟซงานเป็นมาตรฐาน

  • model definitions
  • pretrained checkpoints
  • Trainer
2015 / 2018

Tokenization

การแปลงข้อความดิบเป็นหน่วยไม่ต่อเนื่องที่โมเดลประมวลผล การสร้างคำศัพท์และการแบ่งข้อความมีผลต่อความยาวลำดับ การรองรับหลายภาษา ต้นทุน และพฤติกรรมของโมเดล

  • token
  • vocabulary
  • BPE

การฝึกและหลังการฝึก

วิธีขยาย ปรับ และใช้ความพึงพอใจเพื่อกำหนดความสามารถและพฤติกรรม

4 รายการ
2012–present

Distributed Training

เทคนิคที่แบ่งข้อมูล พารามิเตอร์ ค่า activation หรือการคำนวณไปยังอุปกรณ์และโหนดหลายตัว ทำให้ฝึกโมเดลขนาดใหญ่ได้ แต่ต้องแลกกับการสื่อสาร การซิงโครไนซ์ และความทนทานต่อความผิดพลาด

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
2017 / 2022 / 2023

SFT / RLHF / DPO

กลุ่มวิธีหลังการฝึกสำหรับสอนการทำตามคำสั่งและพฤติกรรมที่สอดคล้องกับความพึงพอใจ SFT เรียนจากตัวอย่าง ส่วน RLHF และ DPO ใช้การเปรียบเทียบความพึงพอใจผ่านวิธีปรับให้เหมาะสมต่างกัน

  • supervised fine-tuning
  • preference data
  • reward model
2024 / 2025

Reasoning and test-time compute

กลุ่มวิธีหลังการฝึกที่สอนให้โมเดลสร้างร่องรอยการให้เหตุผลยาว ๆ ก่อนตอบ และใช้การคำนวณมากขึ้นในขั้นอนุมานเมื่อโจทย์ยากขึ้น การเรียนรู้แบบเสริมกำลังด้วยรางวัลที่ตรวจสอบได้ ซึ่งคำตอบที่ตรวจทานได้เป็นตัวให้สัญญาณการฝึก คือสิ่งที่ทำให้แนวทางนี้ทำซ้ำได้นอกห้องปฏิบัติการแบบปิด ข้อแลกเปลี่ยนควรพูดให้ชัด ความแม่นยำมาจากความยาวของการสร้างข้อความ ไม่ใช่จากโมเดลที่ใหญ่ขึ้น และจ่ายด้วยเวลาหน่วงกับต้นทุนการให้บริการ

  • reasoning traces
  • verifiable rewards
  • inference budget
2021 / 2023

LoRA / QLoRA

วิธีปรับแต่งที่ประหยัดพารามิเตอร์ โดยฝึกอะแดปเตอร์อันดับต่ำขนาดเล็กและตรึงน้ำหนักฐานไว้ QLoRA ใช้ร่วมกับโมเดลฐานที่ทำ quantization เพื่อลดหน่วยความจำยิ่งขึ้น

  • low-rank adapters
  • frozen base model
  • 4-bit training

การอนุมานและการนำไปใช้

เทคนิคหน่วยความจำ การจัดตาราง การบีบอัด และรันไทม์สำหรับให้บริการโมเดล

5 รายการ
2015 / LLM PTQ 2022

Quantization

การแทนน้ำหนัก ค่า activation หรือแคชด้วยความแม่นยำเชิงตัวเลขที่ต่ำลง ช่วยลดหน่วยความจำ แบนด์วิดท์ และการคำนวณ โดยต้องแลกกับความแม่นยำและการรองรับฮาร์ดแวร์

  • precision
  • INT8
  • INT4
2017–present

KV Cache

แคชของ key และ value ใน attention จากโทเคนก่อนหน้าระหว่างการสร้างแบบ autoregressive ช่วยเลี่ยงการคำนวณ prefix ทั้งหมดซ้ำ แต่มักใช้หน่วยความจำสูง

  • keys
  • values
  • prefill
2022–2023

Continuous Batching / PagedAttention

เทคนิคการให้บริการที่รับและนำคำขอออกอย่างต่อเนื่อง พร้อมจัดการหน่วยความจำ KV cache เป็นหน้า ช่วยเพิ่มการใช้ทรัพยากรและ throughput เมื่อความยาวงานแตกต่างกัน

  • request scheduling
  • memory paging
  • throughput
2022

Speculative Decoding

วิธีอนุมานที่โมเดลร่างซึ่งเร็วกว่าเสนอหลายโทเคน แล้วโมเดลเป้าหมายตรวจสอบแบบขนาน ช่วยลดเวลาแฝงโดยไม่เปลี่ยนการแจกแจงเป้าหมาย

  • draft model
  • verification
  • latency
2023–present

Open-model Inference Ecosystem

เอนจินและรันไทม์ เช่น vLLM และ llama.cpp เปลี่ยนน้ำหนักโมเดลที่ดาวน์โหลดได้เป็นการอนุมานในเครื่องหรือบนเซิร์ฟเวอร์ โดยให้ความสำคัญต่างกันด้าน throughput การรองรับฮาร์ดแวร์ รูปแบบ และความซับซ้อนในการดูแล

  • vLLM
  • llama.cpp
  • GGUF

APPLICATION LAYER

สถาปัตยกรรมแอปพลิเคชัน

โมเดลกลายเป็นผลิตภัณฑ์ผ่านเวิร์กโฟลว์ เครื่องมือ การแลกเปลี่ยนบริบท ข้อจำกัด และการประเมิน ส่วน MCP และเครื่องมือเดิมครอบคลุมชั้นนี้โดยไม่ทำซ้ำ

กรณีโมเดลเปิด

พิจารณาตระกูลโมเดลผ่านโค้ด น้ำหนัก การเปิดเผยการฝึก และใบอนุญาต

9 รายการ
2023

Llama

ตระกูลโมเดลของ Meta ที่ดาวน์โหลดน้ำหนักได้ช่วยขยายการอนุมานในเครื่องและการปรับแต่งต่อยอด แต่ใช้เงื่อนไขเฉพาะของ Llama จึงควรเรียกว่า น้ำหนักเปิด มากกว่าสรุปว่าเป็นโอเพนซอร์สตามนิยาม OSI

  • open weights
  • community license
  • model family
2023

Qwen

ตระกูล Qwen ของ Alibaba ครอบคลุมโมเดล dense แบบผู้เชี่ยวชาญ หลายภาษา และหลายรูปแบบ เช็กพอยต์จำนวนมากดาวน์โหลดได้ แต่ควรตรวจใบอนุญาตและการเปิดเผยใน model card ของแต่ละรุ่น

  • multilingual
  • dense and MoE
  • open weights
2023

Mistral / Mixtral

ตระกูลของ Mistral AI มีทั้งโมเดล dense Mistral และโมเดล Mixtral แบบผู้เชี่ยวชาญ บางรุ่นใช้ใบอนุญาตแบบผ่อนปรน แต่อีกบางรุ่นไม่ใช่ จึงต้องประเมินความเปิดเป็นรายสิ่งประดิษฐ์

  • dense models
  • MoE
  • open weights
2023

DeepSeek

รุ่นที่ดาวน์โหลดได้ของ DeepSeek ทำให้การออกแบบ MoE การฝึกหลังสำหรับการให้เหตุผล และการให้บริการอย่างมีประสิทธิภาพถูกศึกษาอย่างกว้างขวาง โค้ดกับน้ำหนักอาจใช้ใบอนุญาตต่างกัน และการเปิดเผยข้อมูลฝึกเป็นอีกมิติหนึ่ง

  • MoE
  • reasoning
  • open weights
2024

Gemma

ตระกูลโมเดลของ Google ที่ดาวน์โหลดน้ำหนักได้เชื่อมงานวิจัยจาก Gemini กับการใช้งานในเครื่อง เอดจ์ และแบบโฮสต์ Google เรียกว่าโมเดลเปิด แต่การใช้ยังอยู่ภายใต้เงื่อนไขเฉพาะของ Gemma

  • open weights
  • lightweight models
  • edge deployment
2024

OLMo

Ai2 เผยแพร่ตระกูล OLMo พร้อมข้อมูลก่อนฝึก โค้ดการฝึก จุดตรวจระหว่างทาง และบันทึกการฝึก ควบคู่ไปกับน้ำหนัก OLMo รุ่นแรกออกในเดือนกุมภาพันธ์ 2024 OLMo 2 ในเดือนพฤศจิกายนปีเดียวกัน และ Olmo 3 ในเดือนพฤศจิกายน 2025 พร้อมรุ่น Base Instruct และ Think ขนาด 7B และ 32B ภายใต้สัญญาอนุญาต Apache 2.0 นี่คือกรณีที่สิ่งที่ควรตรวจแยกกันทั้งสี่อย่าง คือ โค้ด น้ำหนัก การเปิดเผยการฝึก และใบอนุญาต ถูกเผยแพร่จริงครบถ้วน จึงใช้เป็นจุดอ้างอิงเทียบกับตระกูลที่เผยแพร่เพียงน้ำหนัก

  • fully open
  • open training data
  • intermediate checkpoints
2025

gpt-oss

gpt-oss-120b และ 20b ของ OpenAI เป็นโมเดลการให้เหตุผลแบบ MoE ที่ดาวน์โหลดได้สำหรับการอนุมานในเครื่องหรือแบบโฮสต์ น้ำหนักและโค้ดอ้างอิงใช้ Apache 2.0 แต่ไม่ได้เผยแพร่ชุดข้อมูลพรีเทรน

  • open weights
  • reasoning
  • MoE
2026

GLM-5

ซีรีส์ GLM-5 ของ Z.ai เป็นตระกูลโมเดลภาษา MoE ขนาดใหญ่สำหรับการให้เหตุผล การเขียนโค้ด และงานเอเจนต์ระยะยาว GLM-5 เปิดตัวในเดือนกุมภาพันธ์ 2026 ตามด้วย 5.1 ในเดือนเมษายน 5.2 ในเดือนมิถุนายนด้วยพารามิเตอร์ 7.53 แสนล้านตัวและหน้าต่างบริบทหนึ่งล้านโทเคน และ 5.3 ในเดือนสิงหาคมบนฐานเดิมด้วยการปรับหลังการฝึก ส่วน GLM-5.3-Flash ที่เล็กกว่าตามมาไม่กี่วันด้วยพารามิเตอร์รวม 3.2 แสนล้านตัวและแอ็กทิฟ 1.8 หมื่นล้านตัว ขนาดของสมาชิกรุ่นใหญ่ทำให้การโฮสต์เองใช้ทรัพยากรมาก

  • open weights
  • MoE
  • long context
2026

Kimi K3

Moonshot AI เปิดตัว Kimi K3 ในเดือนกรกฎาคม 2026 เป็นโมเดลภาษา MoE แบบหลายรูปแบบโดยกำเนิดที่เปิดน้ำหนัก มีพารามิเตอร์รวม 2.8 ล้านล้าน พารามิเตอร์ที่ทำงาน 104 พันล้าน และบริบทหนึ่งล้านโทเคน มุ่งสู่งานเขียนโค้ดระยะยาว งานความรู้ และเอเจนต์ที่ใช้เครื่องมือ แต่การติดตั้งในเครื่องต้องใช้ทรัพยากรสูง

  • open weights
  • MoE
  • long context

นี่คือแผนที่เทคนิคที่คัดสรร ไม่ใช่การอ้างว่าครอบคลุมทั้งหมด