Tiếng Việt
← Quay lại Trang chủ

Kiến trúc mô hình

Cấu trúc quyết định cách mô hình biểu diễn và biến đổi thông tin.

3 mục

Framework và biểu diễn

Phần mềm và giao diện dữ liệu dùng để xây dựng, huấn luyện và chạy mô hình.

3 mục

Huấn luyện và hậu huấn luyện

Phương pháp mở rộng, thích nghi và ưu tiên định hình năng lực và hành vi.

4 mục
2012–present

Distributed Training

Các kỹ thuật chia dữ liệu, tham số, activation hoặc tính toán giữa nhiều thiết bị và nút. Chúng cho phép huấn luyện mô hình lớn nhưng tạo ra đánh đổi về giao tiếp, đồng bộ và chịu lỗi.

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
2017 / 2022 / 2023

SFT / RLHF / DPO

Nhóm phương pháp hậu huấn luyện để dạy mô hình làm theo chỉ dẫn và phù hợp với ưu tiên. SFT học từ minh họa; RLHF và DPO dùng so sánh ưu tiên qua các quy trình tối ưu khác nhau.

  • supervised fine-tuning
  • preference data
  • reward model
2024 / 2025

Reasoning and test-time compute

Một nhóm phương pháp hậu huấn luyện dạy mô hình sinh ra chuỗi suy luận dài trước khi trả lời, và dùng nhiều tính toán hơn ở giai đoạn suy luận khi bài toán khó hơn. Học tăng cường với phần thưởng kiểm chứng được — trong đó một đáp án có thể đối chiếu cung cấp tín hiệu huấn luyện — là điều khiến hướng đi này tái lập được bên ngoài các phòng thí nghiệm đóng. Cái giá nên nói thẳng: độ chính xác đến từ độ dài sinh văn bản chứ không từ mô hình lớn hơn, và phải trả bằng độ trễ cùng chi phí phục vụ.

  • reasoning traces
  • verifiable rewards
  • inference budget
2021 / 2023

LoRA / QLoRA

Các phương pháp tinh chỉnh tiết kiệm tham số, chỉ huấn luyện adapter hạng thấp nhỏ trong khi giữ cố định trọng số nền. QLoRA kết hợp adapter với mô hình nền lượng tử hóa để giảm thêm bộ nhớ.

  • low-rank adapters
  • frozen base model
  • 4-bit training

Suy luận và triển khai

Kỹ thuật bộ nhớ, lập lịch, nén và runtime dùng để phục vụ mô hình.

5 mục

APPLICATION LAYER

Kiến trúc ứng dụng

Mô hình trở thành sản phẩm qua quy trình, công cụ, trao đổi ngữ cảnh, hàng rào an toàn và đánh giá. Các phần MCP và Công cụ hiện có bao phủ lớp này mà không lặp lại nội dung.

Trường hợp mô hình mở

Các dòng mô hình được xem xét theo mã, trọng số, công bố huấn luyện và giấy phép.

9 mục
2023

Llama

Dòng mô hình của Meta có trọng số tải xuống đã mở rộng suy luận cục bộ và tinh chỉnh. Vì dùng điều khoản riêng của Llama, trọng số mở chính xác hơn việc mặc nhiên coi là mã nguồn mở theo OSI.

  • open weights
  • community license
  • model family
2023

Qwen

Dòng Qwen của Alibaba gồm các bản dense, định tuyến chuyên gia, đa ngôn ngữ và đa phương thức. Nhiều checkpoint có thể tải xuống, nhưng cần kiểm tra giấy phép và mức công bố ở từng model card.

  • multilingual
  • dense and MoE
  • open weights
2023

Mistral / Mixtral

Dòng của Mistral AI gồm mô hình dense Mistral và mô hình Mixtral định tuyến chuyên gia. Một số bản có giấy phép rộng, số khác thì không; độ mở phải được đánh giá theo từng hiện vật.

  • dense models
  • MoE
  • open weights
2023

DeepSeek

Các bản tải xuống của DeepSeek thúc đẩy nghiên cứu về MoE, hậu huấn luyện suy luận và phục vụ hiệu quả. Mã và trọng số có thể dùng giấy phép khác nhau; công bố dữ liệu huấn luyện là một chiều riêng.

  • MoE
  • reasoning
  • open weights
2024

Gemma

Dòng mô hình của Google có trọng số tải xuống nối nghiên cứu từ Gemini với triển khai cục bộ, biên và lưu trữ. Google gọi đây là mô hình mở, nhưng việc dùng vẫn theo điều khoản riêng của Gemma.

  • open weights
  • lightweight models
  • edge deployment
2024

OLMo

Ai2 công bố dòng OLMo kèm dữ liệu tiền huấn luyện, mã huấn luyện, các điểm kiểm tra trung gian và nhật ký, chứ không chỉ trọng số. OLMo đầu tiên ra mắt tháng 2 năm 2024, OLMo 2 vào tháng 11 cùng năm, và Olmo 3 vào tháng 11 năm 2025 với các biến thể Base, Instruct và Think cỡ 7B và 32B theo giấy phép Apache 2.0. Đây là trường hợp mà cả bốn thứ cần kiểm tra riêng — mã, trọng số, công bố huấn luyện và giấy phép — đều thực sự được công bố, nên có thể dùng làm mốc đối chiếu với những dòng chỉ phát hành trọng số.

  • fully open
  • open training data
  • intermediate checkpoints
2025

gpt-oss

gpt-oss-120b và 20b của OpenAI là các mô hình suy luận MoE có thể tải xuống để chạy cục bộ hoặc được lưu trữ. Trọng số và bản triển khai tham chiếu dùng Apache 2.0, nhưng bộ dữ liệu tiền huấn luyện không được công bố.

  • open weights
  • reasoning
  • MoE
2026

GLM-5

Dòng GLM-5 của Z.ai là một họ mô hình ngôn ngữ MoE lớn cho suy luận, lập trình và công việc tác tử dài hạn. GLM-5 ra mắt vào tháng 2 năm 2026, 5.1 vào tháng 4, 5.2 vào tháng 6 với 753 tỷ tham số và cửa sổ ngữ cảnh một triệu token, và 5.3 vào tháng 8 trên cùng nền tảng với các thay đổi sau huấn luyện; GLM-5.3-Flash nhỏ hơn theo sau vài ngày với tổng 320 tỷ tham số và 18 tỷ tham số kích hoạt. Quy mô của các thành viên lớn khiến việc tự lưu trữ tốn nhiều tài nguyên.

  • open weights
  • MoE
  • long context
2026

Kimi K3

Moonshot AI phát hành Kimi K3 tháng 7 năm 2026: mô hình ngôn ngữ MoE đa phương thức nguyên bản có trọng số mở, với tổng 2,8 nghìn tỷ tham số, 104 tỷ tham số hoạt động và ngữ cảnh một triệu token. Mô hình hướng đến lập trình dài hạn, công việc tri thức và tác tử dùng công cụ, nhưng triển khai cục bộ đòi hỏi nhiều tài nguyên.

  • open weights
  • MoE
  • long context

Đây là bản đồ kỹ thuật được tuyển chọn, không phải tuyên bố bao quát toàn bộ.