TECHNOLOGY GRAPH
Teknologi AI
Dari arsitektur dan pelatihan model hingga inferensi, penggelaran, dan kasus model berbobot terbuka
Peta terkurasi atas lapisan teknis yang mengubah gagasan penelitian menjadi model yang dapat dilatih dan sistem yang dapat dipakai. Setiap entri menghubungkan konsep dengan makalah, era sejarah, kasus model, perkakas, dan sumber primer.
Arsitektur model
Struktur yang menentukan bagaimana model merepresentasikan dan mengubah informasi.
Transformer
Arsitektur saraf berbasis atensi yang memproses posisi-posisi dalam suatu deret secara paralel. Ia menjadi fondasi bagi banyak model bahasa dan model multimodal masa kini.
- self-attention
- encoder
- decoder
Mixture of Experts (MoE)
Keluarga arsitektur pakar terarah. Varian jarang masa kini hanya mengaktifkan subjaringan pakar terpilih untuk setiap masukan, sehingga kapasitas bertambah tanpa mengaktifkan setiap parameter pada setiap token.
- experts
- router
- sparse activation
Diffusion Model
Model generatif yang belajar membalik proses penambahan derau secara bertahap. Penderauan berulang menjadi pendekatan utama untuk pembangkitan citra, audio, video, dan multimodal.
- forward noise
- denoising
- score matching
Kerangka kerja dan representasi
Antarmuka perangkat lunak dan data yang dipakai untuk membangun, melatih, dan menjalankan model.
PyTorch
Kerangka kerja tensor dan pembelajaran mendalam sumber terbuka dengan diferensiasi otomatis, modul jaringan saraf, kompilasi, dan eksekusi terdistribusi. Ia dipakai luas dari purwarupa riset hingga pelatihan produksi.
- tensor
- autograd
- module
Hugging Face Transformers
Pustaka pendefinisian model yang menghubungkan arsitektur terlatih dengan ekosistem pelatihan dan inferensi. Ia membakukan konfigurasi, prapemrosesan, pemuatan, pembangkitan, dan banyak antarmuka tugas.
- model definitions
- pretrained checkpoints
- Trainer
Tokenization
Pemetaan antara teks mentah dan satuan diskret yang diproses model. Penyusunan kosakata dan pemenggalan memengaruhi panjang deret, cakupan multibahasa, biaya, dan perilaku model.
- token
- vocabulary
- BPE
Pelatihan dan pascapelatihan
Metode penskalaan, adaptasi, dan preferensi yang membentuk kemampuan dan perilaku model.
Distributed Training
Teknik yang membagi data, parameter, aktivasi, atau komputasi ke berbagai perangkat dan simpul. Teknik ini memungkinkan pelatihan model besar, tetapi memunculkan pertukaran pada komunikasi, sinkronisasi, dan toleransi kegagalan.
- data parallelism
- tensor parallelism
- pipeline parallelism
SFT / RLHF / DPO
Keluarga metode pascapelatihan untuk mengajarkan kepatuhan pada instruksi dan perilaku yang selaras dengan preferensi. SFT belajar dari demonstrasi; RLHF dan DPO memakai perbandingan preferensi melalui prosedur optimasi yang berbeda.
- supervised fine-tuning
- preference data
- reward model
Reasoning and test-time compute
Pascapelatihan yang mengajari model menghasilkan jejak penalaran panjang sebelum menjawab, dan membelanjakan lebih banyak komputasi saat inferensi ketika persoalannya lebih sulit. Pembelajaran penguatan dengan imbalan yang dapat diperiksa — ketika jawaban yang bisa dicek memasok sinyal pelatihan — itulah yang membuat pendekatan ini dapat direproduksi di luar laboratorium tertutup. Pertukarannya perlu dikatakan terus terang: ketepatan yang dibeli dengan panjang pembangkitan alih-alih dengan model yang lebih besar, dan dibayar dengan latensi serta biaya penyajian.
- reasoning traces
- verifiable rewards
- inference budget
LoRA / QLoRA
Metode penalaan halus hemat parameter yang melatih adapter berperingkat rendah sembari membekukan bobot dasar. QLoRA memadukan adapter dengan model dasar terkuantisasi untuk menekan pemakaian memori lebih jauh.
- low-rank adapters
- frozen base model
- 4-bit training
Inferensi dan penggelaran
Teknik memori, penjadwalan, kompresi, dan runtime yang dipakai untuk menyajikan model.
Quantization
Merepresentasikan bobot, aktivasi, atau tembolok dengan presisi numerik yang lebih rendah. Cara ini dapat menurunkan biaya memori, lebar pita, dan komputasi, dengan pertukaran pada ketepatan dan dukungan perangkat keras.
- precision
- INT8
- INT4
KV Cache
Tembolok kunci dan nilai atensi dari token-token sebelumnya selama pembangkitan autoregresif. Ia menghindari penghitungan ulang seluruh awalan, tetapi kerap menjadi pemakai memori yang besar.
- keys
- values
- prefill
Continuous Batching / PagedAttention
Teknik penyajian yang terus-menerus menerima dan melepas permintaan sembari mengelola memori tembolok KV dalam laman. Bersama-sama keduanya memperbaiki utilisasi dan keluaran pada beban kerja berpanjang beragam.
- request scheduling
- memory paging
- throughput
Speculative Decoding
Metode inferensi ketika draf yang lebih cepat mengusulkan beberapa token dan model sasaran memverifikasinya secara paralel. Cara ini dapat menurunkan latensi pembangkitan tanpa mengubah distribusi sasaran.
- draft model
- verification
- latency
Open-model Inference Ecosystem
Mesin dan runtime seperti vLLM dan llama.cpp mengubah bobot model yang dapat diunduh menjadi inferensi lokal atau di server. Prioritas keduanya berbeda pada keluaran, keterbawaan perangkat keras, format model, dan kerumitan operasional.
- vLLM
- llama.cpp
- GGUF
APPLICATION LAYER
Arsitektur aplikasi
Model menjadi produk melalui alur kerja, perkakas, pertukaran konteks, pagar pengaman, dan evaluasi. Bagian MCP dan Perkakas yang sudah ada mencakup lapisan aplikasi ini tanpa menggandakannya di sini.
Kasus model terbuka
Keluarga model yang ditelaah melalui kode, bobot, keterbukaan pelatihan, dan lisensi.
Llama
Keluarga model berbobot-unduh dari Meta ikut memperluas inferensi lokal dan penalaan hilir. Rilisnya memakai ketentuan khas Llama, sehingga “bobot terbuka” lebih tepat daripada mengandaikan sumber terbuka menurut definisi OSI.
- open weights
- community license
- model family
Qwen
Keluarga Qwen dari Alibaba mencakup rilis padat, terarah-pakar, multibahasa, dan multimodal. Banyak checkpoint dapat diunduh secara terbuka, tetapi klaim lisensi dan keterbukaan sebaiknya diperiksa pada tingkat kartu model masing-masing.
- multilingual
- dense and MoE
- open weights
Mistral / Mixtral
Keluarga Mistral AI mencakup model Mistral yang padat maupun model Mixtral yang terarah-pakar. Sebagian rilis memakai lisensi permisif dan sebagian tidak, sehingga keterbukaannya harus dinilai per artefak.
- dense models
- MoE
- open weights
DeepSeek
Rilis DeepSeek yang dapat diunduh membuat rancangan MoE, pascapelatihan penalaran, dan penyajian yang efisien banyak dipelajari. Kode dan bobot dapat memakai lisensi berbeda, dan keterbukaan data pelatihan adalah dimensi tersendiri.
- MoE
- reasoning
- open weights
Gemma
Keluarga berbobot-unduh dari Google menghubungkan riset turunan Gemini dengan penggelaran lokal, tepi, dan terkelola. Google menyebutnya keluarga model terbuka, sementara pemakaiannya tetap diatur ketentuan khas Gemma.
- open weights
- lightweight models
- edge deployment
OLMo
Ai2 merilis keluarga OLMo beserta data pralatihnya, kode pelatihan, checkpoint antara, dan lognya, berdampingan dengan bobotnya. OLMo pertama muncul pada Februari 2024, OLMo 2 pada November tahun itu, dan Olmo 3 pada November 2025 dengan varian Base, Instruct, dan Think berukuran 7B serta 32B di bawah Apache 2.0. Inilah kasus ketika keempat hal yang layak diperiksa terpisah — kode, bobot, keterbukaan pelatihan, dan lisensi — benar-benar diterbitkan, sehingga ia menjadi titik rujukan terhadap keluarga yang hanya merilis bobot.
- fully open
- open training data
- intermediate checkpoints
gpt-oss
gpt-oss-120b dan 20b dari OpenAI adalah model penalaran MoE yang dapat diunduh, dirancang untuk inferensi lokal maupun terkelola. Bobot Apache 2.0 dan implementasi rujukannya memperluas akses penggelaran, sementara himpunan data pralatihnya sendiri tidak dirilis.
- open weights
- reasoning
- MoE
GLM-5
Seri GLM-5 dari Z.ai adalah keluarga model bahasa MoE besar untuk penalaran, pemrograman, dan kerja keagenan berjangka panjang. GLM-5 muncul pada Februari 2026, 5.1 pada April, 5.2 pada Juni dengan 753 miliar parameter dan jendela konteks satu juta token, serta 5.3 pada Agustus di atas basis yang sama dengan perubahan pascapelatihan; GLM-5.3-Flash yang lebih kecil menyusul beberapa hari kemudian dengan 320 miliar parameter total dan 18 miliar parameter aktif. Skala anggota yang lebih besar membuat swahosting menuntut banyak sumber daya.
- open weights
- MoE
- long context
Kimi K3
Moonshot AI merilis Kimi K3 pada Juli 2026 sebagai model bahasa MoE multimodal-asli berbobot terbuka dengan 2,8 triliun parameter total, 104 miliar parameter aktif, dan jendela konteks satu juta token. Ia menyasar pemrograman berjangka panjang, kerja pengetahuan, dan agen pengguna perkakas, sementara skalanya membuat penggelaran lokal menuntut banyak.
- open weights
- MoE
- long context
Ini adalah peta teknis terkurasi, bukan klaim cakupan yang menyeluruh.