TECHNOLOGY GRAPH
เทคโนโลยี AI
จากสถาปัตยกรรมและการฝึก ไปจนถึงการอนุมาน การนำไปใช้ และกรณีโมเดลน้ำหนักเปิด
แผนที่เชิงบรรณาธิการของชั้นเทคนิคที่เปลี่ยนแนวคิดวิจัยเป็นโมเดลที่ฝึกได้และระบบที่ใช้งานได้ แต่ละรายการเชื่อมโยงบทความ ประวัติศาสตร์ กรณีโมเดล เครื่องมือ และแหล่งข้อมูลปฐมภูมิ
สถาปัตยกรรมโมเดล
โครงสร้างที่กำหนดวิธีแทนและแปลงข้อมูลของโมเดล
Transformer
สถาปัตยกรรมโครงข่ายประสาทที่ใช้กลไก attention และประมวลผลตำแหน่งในลำดับแบบขนาน เป็นรากฐานของโมเดลภาษาและโมเดลหลายรูปแบบสมัยใหม่จำนวนมาก
- self-attention
- encoder
- decoder
Mixture of Experts (MoE)
ตระกูลสถาปัตยกรรมที่กำหนดเส้นทางไปยังเครือข่ายผู้เชี่ยวชาญ รุ่น sparse สมัยใหม่เปิดใช้ผู้เชี่ยวชาญเพียงบางส่วนต่ออินพุต จึงเพิ่มความจุโดยไม่ต้องใช้ทุกพารามิเตอร์กับทุกโทเคน
- experts
- router
- sparse activation
Diffusion Model
โมเดลกำเนิดที่เรียนรู้การย้อนกระบวนการเติมสัญญาณรบกวนทีละน้อย การขจัดสัญญาณรบกวนซ้ำ ๆ กลายเป็นแนวทางสำคัญสำหรับการสร้างภาพ เสียง วิดีโอ และเนื้อหาหลายรูปแบบ
- forward noise
- denoising
- score matching
เฟรมเวิร์กและการแทนข้อมูล
ซอฟต์แวร์และอินเทอร์เฟซข้อมูลสำหรับสร้าง ฝึก และเรียกใช้โมเดล
PyTorch
เฟรมเวิร์กโอเพนซอร์สสำหรับเทนเซอร์และการเรียนรู้เชิงลึก มีการหาอนุพันธ์อัตโนมัติ โมดูลโครงข่ายประสาท การคอมไพล์ และการทำงานแบบกระจาย ใช้ตั้งแต่งานวิจัยจนถึงการฝึกจริง
- tensor
- autograd
- module
Hugging Face Transformers
ไลบรารีนิยามโมเดลที่เชื่อมสถาปัตยกรรมซึ่งฝึกล่วงหน้ากับระบบนิเวศการฝึกและการอนุมาน ช่วยทำให้การตั้งค่า การเตรียมข้อมูล การโหลด การสร้าง และอินเทอร์เฟซงานเป็นมาตรฐาน
- model definitions
- pretrained checkpoints
- Trainer
Tokenization
การแปลงข้อความดิบเป็นหน่วยไม่ต่อเนื่องที่โมเดลประมวลผล การสร้างคำศัพท์และการแบ่งข้อความมีผลต่อความยาวลำดับ การรองรับหลายภาษา ต้นทุน และพฤติกรรมของโมเดล
- token
- vocabulary
- BPE
การฝึกและหลังการฝึก
วิธีขยาย ปรับ และใช้ความพึงพอใจเพื่อกำหนดความสามารถและพฤติกรรม
Distributed Training
เทคนิคที่แบ่งข้อมูล พารามิเตอร์ ค่า activation หรือการคำนวณไปยังอุปกรณ์และโหนดหลายตัว ทำให้ฝึกโมเดลขนาดใหญ่ได้ แต่ต้องแลกกับการสื่อสาร การซิงโครไนซ์ และความทนทานต่อความผิดพลาด
- data parallelism
- tensor parallelism
- pipeline parallelism
SFT / RLHF / DPO
กลุ่มวิธีหลังการฝึกสำหรับสอนการทำตามคำสั่งและพฤติกรรมที่สอดคล้องกับความพึงพอใจ SFT เรียนจากตัวอย่าง ส่วน RLHF และ DPO ใช้การเปรียบเทียบความพึงพอใจผ่านวิธีปรับให้เหมาะสมต่างกัน
- supervised fine-tuning
- preference data
- reward model
Reasoning and test-time compute
กลุ่มวิธีหลังการฝึกที่สอนให้โมเดลสร้างร่องรอยการให้เหตุผลยาว ๆ ก่อนตอบ และใช้การคำนวณมากขึ้นในขั้นอนุมานเมื่อโจทย์ยากขึ้น การเรียนรู้แบบเสริมกำลังด้วยรางวัลที่ตรวจสอบได้ ซึ่งคำตอบที่ตรวจทานได้เป็นตัวให้สัญญาณการฝึก คือสิ่งที่ทำให้แนวทางนี้ทำซ้ำได้นอกห้องปฏิบัติการแบบปิด ข้อแลกเปลี่ยนควรพูดให้ชัด ความแม่นยำมาจากความยาวของการสร้างข้อความ ไม่ใช่จากโมเดลที่ใหญ่ขึ้น และจ่ายด้วยเวลาหน่วงกับต้นทุนการให้บริการ
- reasoning traces
- verifiable rewards
- inference budget
LoRA / QLoRA
วิธีปรับแต่งที่ประหยัดพารามิเตอร์ โดยฝึกอะแดปเตอร์อันดับต่ำขนาดเล็กและตรึงน้ำหนักฐานไว้ QLoRA ใช้ร่วมกับโมเดลฐานที่ทำ quantization เพื่อลดหน่วยความจำยิ่งขึ้น
- low-rank adapters
- frozen base model
- 4-bit training
การอนุมานและการนำไปใช้
เทคนิคหน่วยความจำ การจัดตาราง การบีบอัด และรันไทม์สำหรับให้บริการโมเดล
Quantization
การแทนน้ำหนัก ค่า activation หรือแคชด้วยความแม่นยำเชิงตัวเลขที่ต่ำลง ช่วยลดหน่วยความจำ แบนด์วิดท์ และการคำนวณ โดยต้องแลกกับความแม่นยำและการรองรับฮาร์ดแวร์
- precision
- INT8
- INT4
KV Cache
แคชของ key และ value ใน attention จากโทเคนก่อนหน้าระหว่างการสร้างแบบ autoregressive ช่วยเลี่ยงการคำนวณ prefix ทั้งหมดซ้ำ แต่มักใช้หน่วยความจำสูง
- keys
- values
- prefill
Continuous Batching / PagedAttention
เทคนิคการให้บริการที่รับและนำคำขอออกอย่างต่อเนื่อง พร้อมจัดการหน่วยความจำ KV cache เป็นหน้า ช่วยเพิ่มการใช้ทรัพยากรและ throughput เมื่อความยาวงานแตกต่างกัน
- request scheduling
- memory paging
- throughput
Speculative Decoding
วิธีอนุมานที่โมเดลร่างซึ่งเร็วกว่าเสนอหลายโทเคน แล้วโมเดลเป้าหมายตรวจสอบแบบขนาน ช่วยลดเวลาแฝงโดยไม่เปลี่ยนการแจกแจงเป้าหมาย
- draft model
- verification
- latency
Open-model Inference Ecosystem
เอนจินและรันไทม์ เช่น vLLM และ llama.cpp เปลี่ยนน้ำหนักโมเดลที่ดาวน์โหลดได้เป็นการอนุมานในเครื่องหรือบนเซิร์ฟเวอร์ โดยให้ความสำคัญต่างกันด้าน throughput การรองรับฮาร์ดแวร์ รูปแบบ และความซับซ้อนในการดูแล
- vLLM
- llama.cpp
- GGUF
APPLICATION LAYER
สถาปัตยกรรมแอปพลิเคชัน
โมเดลกลายเป็นผลิตภัณฑ์ผ่านเวิร์กโฟลว์ เครื่องมือ การแลกเปลี่ยนบริบท ข้อจำกัด และการประเมิน ส่วน MCP และเครื่องมือเดิมครอบคลุมชั้นนี้โดยไม่ทำซ้ำ
กรณีโมเดลเปิด
พิจารณาตระกูลโมเดลผ่านโค้ด น้ำหนัก การเปิดเผยการฝึก และใบอนุญาต
Llama
ตระกูลโมเดลของ Meta ที่ดาวน์โหลดน้ำหนักได้ช่วยขยายการอนุมานในเครื่องและการปรับแต่งต่อยอด แต่ใช้เงื่อนไขเฉพาะของ Llama จึงควรเรียกว่า “น้ำหนักเปิด” มากกว่าสรุปว่าเป็นโอเพนซอร์สตามนิยาม OSI
- open weights
- community license
- model family
Qwen
ตระกูล Qwen ของ Alibaba ครอบคลุมโมเดล dense แบบผู้เชี่ยวชาญ หลายภาษา และหลายรูปแบบ เช็กพอยต์จำนวนมากดาวน์โหลดได้ แต่ควรตรวจใบอนุญาตและการเปิดเผยใน model card ของแต่ละรุ่น
- multilingual
- dense and MoE
- open weights
Mistral / Mixtral
ตระกูลของ Mistral AI มีทั้งโมเดล dense Mistral และโมเดล Mixtral แบบผู้เชี่ยวชาญ บางรุ่นใช้ใบอนุญาตแบบผ่อนปรน แต่อีกบางรุ่นไม่ใช่ จึงต้องประเมินความเปิดเป็นรายสิ่งประดิษฐ์
- dense models
- MoE
- open weights
DeepSeek
รุ่นที่ดาวน์โหลดได้ของ DeepSeek ทำให้การออกแบบ MoE การฝึกหลังสำหรับการให้เหตุผล และการให้บริการอย่างมีประสิทธิภาพถูกศึกษาอย่างกว้างขวาง โค้ดกับน้ำหนักอาจใช้ใบอนุญาตต่างกัน และการเปิดเผยข้อมูลฝึกเป็นอีกมิติหนึ่ง
- MoE
- reasoning
- open weights
Gemma
ตระกูลโมเดลของ Google ที่ดาวน์โหลดน้ำหนักได้เชื่อมงานวิจัยจาก Gemini กับการใช้งานในเครื่อง เอดจ์ และแบบโฮสต์ Google เรียกว่าโมเดลเปิด แต่การใช้ยังอยู่ภายใต้เงื่อนไขเฉพาะของ Gemma
- open weights
- lightweight models
- edge deployment
OLMo
Ai2 เผยแพร่ตระกูล OLMo พร้อมข้อมูลก่อนฝึก โค้ดการฝึก จุดตรวจระหว่างทาง และบันทึกการฝึก ควบคู่ไปกับน้ำหนัก OLMo รุ่นแรกออกในเดือนกุมภาพันธ์ 2024 OLMo 2 ในเดือนพฤศจิกายนปีเดียวกัน และ Olmo 3 ในเดือนพฤศจิกายน 2025 พร้อมรุ่น Base Instruct และ Think ขนาด 7B และ 32B ภายใต้สัญญาอนุญาต Apache 2.0 นี่คือกรณีที่สิ่งที่ควรตรวจแยกกันทั้งสี่อย่าง คือ โค้ด น้ำหนัก การเปิดเผยการฝึก และใบอนุญาต ถูกเผยแพร่จริงครบถ้วน จึงใช้เป็นจุดอ้างอิงเทียบกับตระกูลที่เผยแพร่เพียงน้ำหนัก
- fully open
- open training data
- intermediate checkpoints
gpt-oss
gpt-oss-120b และ 20b ของ OpenAI เป็นโมเดลการให้เหตุผลแบบ MoE ที่ดาวน์โหลดได้สำหรับการอนุมานในเครื่องหรือแบบโฮสต์ น้ำหนักและโค้ดอ้างอิงใช้ Apache 2.0 แต่ไม่ได้เผยแพร่ชุดข้อมูลพรีเทรน
- open weights
- reasoning
- MoE
GLM-5
ซีรีส์ GLM-5 ของ Z.ai เป็นตระกูลโมเดลภาษา MoE ขนาดใหญ่สำหรับการให้เหตุผล การเขียนโค้ด และงานเอเจนต์ระยะยาว GLM-5 เปิดตัวในเดือนกุมภาพันธ์ 2026 ตามด้วย 5.1 ในเดือนเมษายน 5.2 ในเดือนมิถุนายนด้วยพารามิเตอร์ 7.53 แสนล้านตัวและหน้าต่างบริบทหนึ่งล้านโทเคน และ 5.3 ในเดือนสิงหาคมบนฐานเดิมด้วยการปรับหลังการฝึก ส่วน GLM-5.3-Flash ที่เล็กกว่าตามมาไม่กี่วันด้วยพารามิเตอร์รวม 3.2 แสนล้านตัวและแอ็กทิฟ 1.8 หมื่นล้านตัว ขนาดของสมาชิกรุ่นใหญ่ทำให้การโฮสต์เองใช้ทรัพยากรมาก
- open weights
- MoE
- long context
Kimi K3
Moonshot AI เปิดตัว Kimi K3 ในเดือนกรกฎาคม 2026 เป็นโมเดลภาษา MoE แบบหลายรูปแบบโดยกำเนิดที่เปิดน้ำหนัก มีพารามิเตอร์รวม 2.8 ล้านล้าน พารามิเตอร์ที่ทำงาน 104 พันล้าน และบริบทหนึ่งล้านโทเคน มุ่งสู่งานเขียนโค้ดระยะยาว งานความรู้ และเอเจนต์ที่ใช้เครื่องมือ แต่การติดตั้งในเครื่องต้องใช้ทรัพยากรสูง
- open weights
- MoE
- long context
นี่คือแผนที่เทคนิคที่คัดสรร ไม่ใช่การอ้างว่าครอบคลุมทั้งหมด