Русский
← На главную

Архитектура моделей

Структуры, определяющие представление и преобразование информации моделью.

3 записей

Фреймворки и представление

Программные и информационные интерфейсы для создания, обучения и запуска моделей.

3 записей

Обучение и постобучение

Методы масштабирования, адаптации и предпочтений, формирующие способности и поведение.

4 записей
2012–present

Distributed Training

Методы распределения данных, параметров, активаций или вычислений между устройствами и узлами. Они позволяют обучать крупные модели, но требуют компромиссов в коммуникации, синхронизации и отказоустойчивости.

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
2017 / 2022 / 2023

SFT / RLHF / DPO

Семейство методов постобучения для следования инструкциям и согласования с предпочтениями. SFT учится на демонстрациях, а RLHF и DPO используют сравнения предпочтений через разные процедуры оптимизации.

  • supervised fine-tuning
  • preference data
  • reward model
2024 / 2025

Reasoning and test-time compute

Дообучение, которое учит модель порождать длинную цепочку рассуждения перед ответом и тратить больше вычислений на этапе вывода, когда задача сложнее. Обучение с подкреплением на проверяемых наградах — когда сигнал даёт ответ, поддающийся проверке, — сделало этот путь воспроизводимым за пределами закрытых лабораторий. Размен стоит назвать прямо: точность достигается длиной генерации, а не увеличением модели, и оплачивается задержкой и стоимостью обслуживания.

  • reasoning traces
  • verifiable rewards
  • inference budget
2021 / 2023

LoRA / QLoRA

Параметрически эффективные методы дообучения небольших низкоранговых адаптеров при замороженных базовых весах. QLoRA сочетает адаптеры с квантованной базовой моделью для дополнительной экономии памяти.

  • low-rank adapters
  • frozen base model
  • 4-bit training

Инференс и развёртывание

Методы управления памятью, планирования, сжатия и выполнения для обслуживания моделей.

5 записей
2015 / LLM PTQ 2022

Quantization

Представление весов, активаций или кэшей с пониженной числовой точностью. Оно сокращает память, пропускную способность и вычисления, но требует компромисса с точностью и поддержкой оборудования.

  • precision
  • INT8
  • INT4
2017–present

KV Cache

Кэш ключей и значений внимания предыдущих токенов при авторегрессионной генерации. Он устраняет повторный расчёт всего префикса, но часто становится крупным потребителем памяти.

  • keys
  • values
  • prefill
2022–2023

Continuous Batching / PagedAttention

Методы обслуживания, непрерывно добавляющие и завершающие запросы и управляющие KV-кэшем постранично. Они повышают загрузку оборудования и пропускную способность при переменной длине запросов.

  • request scheduling
  • memory paging
  • throughput
2022

Speculative Decoding

Метод инференса, при котором быстрая черновая модель предлагает несколько токенов, а целевая модель проверяет их параллельно. Он снижает задержку без изменения целевого распределения.

  • draft model
  • verification
  • latency
2023–present

Open-model Inference Ecosystem

Движки и среды выполнения, такие как vLLM и llama.cpp, превращают доступные веса в локальный или серверный инференс. Их приоритеты различаются по пропускной способности, переносимости, форматам и сложности эксплуатации.

  • vLLM
  • llama.cpp
  • GGUF

APPLICATION LAYER

Прикладная архитектура

Модели превращаются в продукты благодаря рабочим процессам, инструментам, обмену контекстом, ограничениям и оценке. Существующие разделы MCP и инструментов покрывают этот слой без дублирования.

Примеры открытых моделей

Семейства, рассмотренные по коду, весам, раскрытию обучения и лицензии.

9 записей
2023

Llama

Семейство Meta с доступными для скачивания весами расширило локальный инференс и дообучение. Из-за специальных условий Llama точнее говорить об открытых весах, а не автоматически считать модель открытой по определению OSI.

  • open weights
  • community license
  • model family
2023

Qwen

Семейство Qwen компании Alibaba включает плотные, экспертные, многоязычные и мультимодальные выпуски. Многие контрольные точки доступны, но лицензию и раскрытие следует проверять по карточке каждой модели.

  • multilingual
  • dense and MoE
  • open weights
2023

Mistral / Mixtral

Семейство Mistral AI включает плотные модели Mistral и экспертные Mixtral. Одни выпуски имеют разрешительные лицензии, другие нет, поэтому открытость оценивается для каждого артефакта.

  • dense models
  • MoE
  • open weights
2023

DeepSeek

Доступные выпуски DeepSeek расширили исследования MoE, постобучения рассуждениям и эффективного обслуживания. Код и веса могут иметь разные лицензии, а раскрытие обучающих данных — отдельный параметр.

  • MoE
  • reasoning
  • open weights
2024

Gemma

Семейство Google с доступными весами связывает исследования Gemini с локальным, периферийным и облачным развёртыванием. Google называет модели открытыми, но использование регулируют специальные условия Gemma.

  • open weights
  • lightweight models
  • edge deployment
2024

OLMo

Ai2 публикует семейство OLMo вместе с данными предобучения, кодом обучения, промежуточными контрольными точками и журналами, а не только с весами. Первая модель OLMo вышла в феврале 2024 года, OLMo 2 — в ноябре того же года, а Olmo 3 — в ноябре 2025 года, с вариантами Base, Instruct и Think на 7B и 32B под лицензией Apache 2.0. Это случай, когда все четыре вещи, которые стоит проверять по отдельности, — код, веса, раскрытие обучения и лицензия — действительно опубликованы, что делает его ориентиром на фоне семейств, выпускающих только веса.

  • fully open
  • open training data
  • intermediate checkpoints
2025

gpt-oss

gpt-oss-120b и 20b от OpenAI — загружаемые MoE-модели рассуждений для локального и серверного инференса. Веса и эталонные реализации под Apache 2.0 расширяют варианты развёртывания, но сам набор предобучения не опубликован.

  • open weights
  • reasoning
  • MoE
2026

GLM-5

Серия GLM-5 от Z.ai — большое семейство языковых моделей MoE для рассуждения, программирования и длительной агентной работы. GLM-5 вышла в феврале 2026 года, 5.1 в апреле, 5.2 в июне с 753 миллиардами параметров и контекстным окном в миллион токенов, а 5.3 в августе на той же основе с изменениями после обучения; меньшая GLM-5.3-Flash появилась несколькими днями позже с 320 миллиардами параметров всего и 18 миллиардами активных. Масштаб старших моделей делает самостоятельное размещение ресурсоёмким.

  • open weights
  • MoE
  • long context
2026

Kimi K3

Moonshot AI выпустила Kimi K3 в июле 2026 года: мультимодальную языковую MoE-модель с открытыми весами, 2,8 трлн параметров всего, 104 млрд активных и контекстом в миллион токенов. Она рассчитана на длительные задачи программирования, интеллектуальную работу и агентов с инструментами, но локальное развёртывание требовательно.

  • open weights
  • MoE
  • long context

Это отобранная техническая карта, а не заявление о полном охвате.