TECHNOLOGY GRAPH
AI 技術体系
モデルアーキテクチャと学習から推論、配備、オープンウェイトモデルの事例まで
研究上の発想を学習可能なモデルと利用可能なシステムへ結ぶ技術マップです。各項目を論文、歴史、モデル事例、ツール、一次資料へつなぎます。
モデルアーキテクチャ
モデルが情報を表現・変換する仕組みです。
Transformer
注意機構を中心に、系列内の位置を並列処理するニューラルアーキテクチャです。現代の言語・マルチモーダルモデルの多くの基盤となりました。
- self-attention
- encoder
- decoder
Mixture of Experts (MoE)
ルーティングされたエキスパート網を組み合わせるアーキテクチャ群です。現代の疎な方式は入力ごとに一部だけを起動し、各トークンで全パラメータを使わずに容量を増やします。
- experts
- router
- sparse activation
Diffusion Model
段階的にノイズを加える過程の逆変換を学習する生成モデルです。反復的なノイズ除去は画像、音声、動画、マルチモーダル生成の主要手法となりました。
- forward noise
- denoising
- score matching
フレームワークと表現
モデルの構築、学習、実行に使うソフトウェアとデータの接点です。
PyTorch
テンソル、自動微分、ニューラルネットワーク部品、コンパイル、分散実行を備えたオープンソースの深層学習フレームワークです。研究試作から本番学習まで広く使われます。
- tensor
- autograd
- module
Hugging Face Transformers
事前学習済みアーキテクチャを学習・推論エコシステムへ結ぶモデル定義ライブラリです。設定、前処理、読み込み、生成、多様なタスクのインターフェースを標準化します。
- model definitions
- pretrained checkpoints
- Trainer
Tokenization
生のテキストをモデルが処理する離散単位へ写像する工程です。語彙構築と分割方式は系列長、多言語対応、コスト、モデル挙動に影響します。
- token
- vocabulary
- BPE
学習と後学習
モデルの能力と挙動を形作る大規模化、適応、選好手法です。
Distributed Training
データ、パラメータ、活性値、計算を複数デバイスやノードへ分割する技術です。大規模モデルの学習を可能にする一方、通信、同期、耐障害性のトレードオフを生みます。
- data parallelism
- tensor parallelism
- pipeline parallelism
SFT / RLHF / DPO
指示追従と選好に沿う挙動を教えるための後学習手法群です。SFT は実演から学び、RLHF と DPO は異なる最適化手順で選好比較を利用します。
- supervised fine-tuning
- preference data
- reward model
Reasoning and test-time compute
回答の前に長い推論の軌跡を生成させ、難しい問題ほど推論時に多くの計算を費やすように学習させる後学習の一群。検証可能な報酬による強化学習、すなわち answer が照合可能であることが学習信号を与える方式が、この路線を閉じた研究所の外でも再現可能にした。代償ははっきり述べる価値がある。精度はより大きなモデルではなく生成の長さから得られ、その対価は遅延と提供コストである。
- reasoning traces
- verifiable rewards
- inference budget
LoRA / QLoRA
基盤重みを固定し、小さな低ランクアダプターだけを学習するパラメータ効率の良い微調整手法です。QLoRA は量子化基盤モデルと組み合わせ、メモリ使用量をさらに抑えます。
- low-rank adapters
- frozen base model
- 4-bit training
推論と配備
モデル提供に使うメモリ、スケジューリング、圧縮、ランタイム技術です。
Quantization
重み、活性値、キャッシュを低い数値精度で表現する技術です。メモリ、帯域、計算コストを減らせますが、精度とハードウェア対応とのトレードオフがあります。
- precision
- INT8
- INT4
KV Cache
自己回帰生成で過去トークンの注意キーと値を保存するキャッシュです。接頭部全体の再計算を避けられますが、大きなメモリ消費源になります。
- keys
- values
- prefill
Continuous Batching / PagedAttention
リクエストを連続的に追加・完了させながら、KV キャッシュをページ単位で管理するサービング技術です。可変長負荷での利用率とスループットを高めます。
- request scheduling
- memory paging
- throughput
Speculative Decoding
高速なドラフトが複数トークンを提案し、対象モデルが並列検証する推論手法です。対象分布を変えずに生成遅延を短縮できます。
- draft model
- verification
- latency
Open-model Inference Ecosystem
vLLM や llama.cpp などのエンジンとランタイムは、取得可能なモデル重みをローカルまたはサーバー推論へつなぎます。スループット、ハードウェア移植性、形式、運用複雑性の重点は異なります。
- vLLM
- llama.cpp
- GGUF
APPLICATION LAYER
アプリケーションアーキテクチャ
モデルはワークフロー、ツール、コンテキスト交換、安全策、評価を通じて製品になります。この応用層は既存の MCP とツールのセクションへ接続し、重複を避けます。
オープンモデルの事例
コード、重み、学習開示、ライセンスの四軸でモデル群を見ます。
Llama
Meta の重みを取得できるモデル群は、ローカル推論と下流微調整を広げました。Llama 固有の条件で公開されるため、OSI 定義のオープンソースと仮定するより「オープンウェイト」が正確です。
- open weights
- community license
- model family
Qwen
Alibaba の Qwen 系列は、密モデル、エキスパート経路、多言語、マルチモーダルの公開を含みます。多くのチェックポイントを取得できますが、ライセンスと開示は各モデルカードで確認すべきです。
- multilingual
- dense and MoE
- open weights
Mistral / Mixtral
Mistral AI の系列には密な Mistral とエキスパート経路型 Mixtral の両方があります。寛容なライセンスの公開もそうでないものもあるため、開放性は成果物ごとに評価します。
- dense models
- MoE
- open weights
DeepSeek
DeepSeek の取得可能な公開は、MoE 設計、推論向け後学習、効率的サービングの研究を広げました。コードと重みは異なるライセンスの場合があり、学習データ開示は別の軸です。
- MoE
- reasoning
- open weights
Gemma
Google の重みを取得できるモデル群は、Gemini 由来の研究をローカル、エッジ、ホスト環境へつなぎます。Google はオープンモデルと呼びますが、利用には Gemma 固有の条件が適用されます。
- open weights
- lightweight models
- edge deployment
OLMo
Ai2 が公開する OLMo 系列は、重みに加えて事前学習データ、学習コード、中間チェックポイント、学習ログも公開しています。最初の OLMo は2024年2月、OLMo 2 は同年11月、Olmo 3 は2025年11月に登場し、7B と 32B の Base・Instruct・Think の各版が Apache 2.0 で公開されました。コード、重み、学習の開示、ライセンスという別々に確認すべき四点がすべて実際に公開されている事例であり、重みのみを公開する系列を測る基準になります。
- fully open
- open training data
- intermediate checkpoints
gpt-oss
OpenAI の gpt-oss-120b と 20b は、ローカルおよびホスト推論向けのダウンロード可能な MoE 推論モデルです。Apache 2.0 の重みと参照実装は配備の選択肢を広げますが、事前学習データセット自体は公開されていません。
- open weights
- reasoning
- MoE
GLM-5
Z.ai の GLM-5 系列は、推論、コーディング、長期的なエージェント作業向けの大規模 MoE 言語モデル群です。GLM-5 は2026年2月に登場し、5.1 が4月、5.2 が6月に 7530 億パラメータで 100 万トークンのコンテキストを備え、5.3 が8月に同じ基盤モデルへの事後学習として公開されました。小型の GLM-5.3-Flash はその数日後で、総パラメータ 3200 億・活性 180 億です。大きい系列の規模は自己ホストに多くの計算資源を要します。
- open weights
- MoE
- long context
Kimi K3
Moonshot AI は 2026年7月、総 2.8 兆・稼働 1,040 億パラメータ、100 万トークンのコンテキストを備えた、オープンウェイトでネイティブ・マルチモーダルな MoE 言語モデル Kimi K3 を公開しました。長期的なコーディング、知識作業、ツール利用エージェント向けですが、ローカル配備には大きな資源が必要です。
- open weights
- MoE
- long context
これは選定された技術マップであり、網羅性を主張するものではありません。