TECHNOLOGY GRAPH
Технологии ИИ
От архитектуры и обучения до инференса, развёртывания и примеров моделей с открытыми весами
Кураторская карта технических слоёв, превращающих исследовательские идеи в обучаемые модели и применимые системы. Каждая запись связана со статьями, историей, моделями, инструментами и первичными источниками.
Архитектура моделей
Структуры, определяющие представление и преобразование информации моделью.
Transformer
Нейросетевая архитектура на основе механизма внимания, параллельно обрабатывающая позиции последовательности. Она стала основой многих современных языковых и мультимодальных моделей.
- self-attention
- encoder
- decoder
Mixture of Experts (MoE)
Семейство архитектур с маршрутизацией между экспертными подсетями. Современные разреженные варианты активируют лишь выбранных экспертов, увеличивая ёмкость без использования всех параметров для каждого токена.
- experts
- router
- sparse activation
Diffusion Model
Генеративная модель, обучающаяся обращать постепенный процесс добавления шума. Итеративное удаление шума стало важным методом генерации изображений, аудио, видео и мультимодального контента.
- forward noise
- denoising
- score matching
Фреймворки и представление
Программные и информационные интерфейсы для создания, обучения и запуска моделей.
PyTorch
Фреймворк с открытым исходным кодом для тензорных вычислений и глубокого обучения, включающий автоматическое дифференцирование, нейросетевые модули, компиляцию и распределённое выполнение.
- tensor
- autograd
- module
Hugging Face Transformers
Библиотека определений моделей, связывающая предобученные архитектуры с экосистемами обучения и инференса. Она унифицирует конфигурацию, предобработку, загрузку, генерацию и интерфейсы задач.
- model definitions
- pretrained checkpoints
- Trainer
Tokenization
Преобразование исходного текста в дискретные единицы, обрабатываемые моделью. Словарь и сегментация влияют на длину последовательности, многоязычность, стоимость и поведение.
- token
- vocabulary
- BPE
Обучение и постобучение
Методы масштабирования, адаптации и предпочтений, формирующие способности и поведение.
Distributed Training
Методы распределения данных, параметров, активаций или вычислений между устройствами и узлами. Они позволяют обучать крупные модели, но требуют компромиссов в коммуникации, синхронизации и отказоустойчивости.
- data parallelism
- tensor parallelism
- pipeline parallelism
SFT / RLHF / DPO
Семейство методов постобучения для следования инструкциям и согласования с предпочтениями. SFT учится на демонстрациях, а RLHF и DPO используют сравнения предпочтений через разные процедуры оптимизации.
- supervised fine-tuning
- preference data
- reward model
Reasoning and test-time compute
Дообучение, которое учит модель порождать длинную цепочку рассуждения перед ответом и тратить больше вычислений на этапе вывода, когда задача сложнее. Обучение с подкреплением на проверяемых наградах — когда сигнал даёт ответ, поддающийся проверке, — сделало этот путь воспроизводимым за пределами закрытых лабораторий. Размен стоит назвать прямо: точность достигается длиной генерации, а не увеличением модели, и оплачивается задержкой и стоимостью обслуживания.
- reasoning traces
- verifiable rewards
- inference budget
LoRA / QLoRA
Параметрически эффективные методы дообучения небольших низкоранговых адаптеров при замороженных базовых весах. QLoRA сочетает адаптеры с квантованной базовой моделью для дополнительной экономии памяти.
- low-rank adapters
- frozen base model
- 4-bit training
Инференс и развёртывание
Методы управления памятью, планирования, сжатия и выполнения для обслуживания моделей.
Quantization
Представление весов, активаций или кэшей с пониженной числовой точностью. Оно сокращает память, пропускную способность и вычисления, но требует компромисса с точностью и поддержкой оборудования.
- precision
- INT8
- INT4
KV Cache
Кэш ключей и значений внимания предыдущих токенов при авторегрессионной генерации. Он устраняет повторный расчёт всего префикса, но часто становится крупным потребителем памяти.
- keys
- values
- prefill
Continuous Batching / PagedAttention
Методы обслуживания, непрерывно добавляющие и завершающие запросы и управляющие KV-кэшем постранично. Они повышают загрузку оборудования и пропускную способность при переменной длине запросов.
- request scheduling
- memory paging
- throughput
Speculative Decoding
Метод инференса, при котором быстрая черновая модель предлагает несколько токенов, а целевая модель проверяет их параллельно. Он снижает задержку без изменения целевого распределения.
- draft model
- verification
- latency
Open-model Inference Ecosystem
Движки и среды выполнения, такие как vLLM и llama.cpp, превращают доступные веса в локальный или серверный инференс. Их приоритеты различаются по пропускной способности, переносимости, форматам и сложности эксплуатации.
- vLLM
- llama.cpp
- GGUF
APPLICATION LAYER
Прикладная архитектура
Модели превращаются в продукты благодаря рабочим процессам, инструментам, обмену контекстом, ограничениям и оценке. Существующие разделы MCP и инструментов покрывают этот слой без дублирования.
Примеры открытых моделей
Семейства, рассмотренные по коду, весам, раскрытию обучения и лицензии.
Llama
Семейство Meta с доступными для скачивания весами расширило локальный инференс и дообучение. Из-за специальных условий Llama точнее говорить об открытых весах, а не автоматически считать модель открытой по определению OSI.
- open weights
- community license
- model family
Qwen
Семейство Qwen компании Alibaba включает плотные, экспертные, многоязычные и мультимодальные выпуски. Многие контрольные точки доступны, но лицензию и раскрытие следует проверять по карточке каждой модели.
- multilingual
- dense and MoE
- open weights
Mistral / Mixtral
Семейство Mistral AI включает плотные модели Mistral и экспертные Mixtral. Одни выпуски имеют разрешительные лицензии, другие нет, поэтому открытость оценивается для каждого артефакта.
- dense models
- MoE
- open weights
DeepSeek
Доступные выпуски DeepSeek расширили исследования MoE, постобучения рассуждениям и эффективного обслуживания. Код и веса могут иметь разные лицензии, а раскрытие обучающих данных — отдельный параметр.
- MoE
- reasoning
- open weights
Gemma
Семейство Google с доступными весами связывает исследования Gemini с локальным, периферийным и облачным развёртыванием. Google называет модели открытыми, но использование регулируют специальные условия Gemma.
- open weights
- lightweight models
- edge deployment
OLMo
Ai2 публикует семейство OLMo вместе с данными предобучения, кодом обучения, промежуточными контрольными точками и журналами, а не только с весами. Первая модель OLMo вышла в феврале 2024 года, OLMo 2 — в ноябре того же года, а Olmo 3 — в ноябре 2025 года, с вариантами Base, Instruct и Think на 7B и 32B под лицензией Apache 2.0. Это случай, когда все четыре вещи, которые стоит проверять по отдельности, — код, веса, раскрытие обучения и лицензия — действительно опубликованы, что делает его ориентиром на фоне семейств, выпускающих только веса.
- fully open
- open training data
- intermediate checkpoints
gpt-oss
gpt-oss-120b и 20b от OpenAI — загружаемые MoE-модели рассуждений для локального и серверного инференса. Веса и эталонные реализации под Apache 2.0 расширяют варианты развёртывания, но сам набор предобучения не опубликован.
- open weights
- reasoning
- MoE
GLM-5
Серия GLM-5 от Z.ai — большое семейство языковых моделей MoE для рассуждения, программирования и длительной агентной работы. GLM-5 вышла в феврале 2026 года, 5.1 в апреле, 5.2 в июне с 753 миллиардами параметров и контекстным окном в миллион токенов, а 5.3 в августе на той же основе с изменениями после обучения; меньшая GLM-5.3-Flash появилась несколькими днями позже с 320 миллиардами параметров всего и 18 миллиардами активных. Масштаб старших моделей делает самостоятельное размещение ресурсоёмким.
- open weights
- MoE
- long context
Kimi K3
Moonshot AI выпустила Kimi K3 в июле 2026 года: мультимодальную языковую MoE-модель с открытыми весами, 2,8 трлн параметров всего, 104 млрд активных и контекстом в миллион токенов. Она рассчитана на длительные задачи программирования, интеллектуальную работу и агентов с инструментами, но локальное развёртывание требовательно.
- open weights
- MoE
- long context
Это отобранная техническая карта, а не заявление о полном охвате.