Русский
← На главную
Эра:
Десятилетие:
Тема:

Показано 73 из 73 работ

Основополагающие работы

1936 журнальная статья Ранняя теория

О вычислимых числах с приложением к проблеме разрешения

В работе вводится универсальная машина Тьюринга и доказывается неразрешимость проблемы разрешения, что закладывает теоретические основы информатики.

1943 журнальная статья Ранняя теория

Логическое исчисление идей, имманентных нервной активности

Нервная активность моделируется средствами пропозициональной логики, что даёт первую математическую теорию искусственных нейронных сетей.

1948 журнальная статья Ранняя теория

Математическая теория связи

В работе определяются информационная энтропия и пропускная способность канала, что закладывает основы теории информации и задаёт вероятностный аппарат, впоследствии используемый в ИИ.

1950 журнальная статья Ранняя теория

Вычислительные машины и разум

Предложена игра в имитацию (тест Тьюринга) как операциональное определение машинного интеллекта, задающее постановку вопроса об ИИ на следующие семьдесят лет.

1955 журнальная статья Ранняя теория

Предложение о Дартмутском летнем исследовательском проекте по искусственному интеллекту

Введён термин «искусственный интеллект» и сформулирована исследовательская программа, положившая начало ИИ как академической дисциплине.

1956 журнальная статья Рождение ИИ

Логико-теоретическая машина: сложная система обработки информации

Реализована первая программа эвристического вывода, демонстрирующая способность машин воспроизводить стратегии решения задач, свойственные человеку, и вводящая понятие «сложной системы обработки информации».

1958 журнальная статья Рождение ИИ

Перцептрон: вероятностная модель хранения и организации информации в мозге

Введён первый обучаемый линейно-пороговый нейрон, положивший начало коннекционистской линии, ведущей к современному глубокому обучению.

1958 материалы конференции Рождение ИИ

Программы с обыденным здравым смыслом

Предложен концепт «советчика» (advice taker) — программы, способной делать выводы на основе формализованного запаса знаний здравого смысла, что закладывает концептуальную основу представления знаний и рассуждений.

1959 журнальная статья Рождение ИИ

Некоторые исследования машинного обучения на примере игры в шашки

Продемонстрирована программа игры в шашки, совершенствующая свою игру посредством самообучения, что положило начало изучению машинного обучения и самоусовершенствования в стиле альфа-бета.

1959 журнальная статья Рождение ИИ

Заметка о синтаксической симметрии и машинной работе с формальными системами

Гелернтер рассматривает, как машина может эффективно работать с формальными системами, предикаты которых обладают высокой симметрией, и в качестве решения формулирует теорему и правило синтаксической симметрии. Работа идёт рядом с геометрической доказательной машиной, которую он тогда строил в IBM и которая ранней весной 1959 года доказала свою первую теорему евклидовой планиметрии.

1982 журнальная статья Зима ИИ

Нейронные сети и физические системы с эмерджентными коллективными вычислительными способностями

Введена ассоциативно-памятная сеть Хопфилда, связывающая нейровычисления с энергетическими ландшафтами статистической физики и возродившая интерес к нейронным сетям в период ранней «зимы ИИ».

1986 журнальная статья Зима ИИ

Слияние, распространение и структурирование в сетях доверия

Систематизированы операции слияния, распространения и структурирования в сетях доверия, что заложило алгоритмические основы вывода в байесовских сетях.

1986 журнальная статья Зима ИИ

Обучение представлениям путём обратного распространения ошибок

Алгоритм обратного распространения ошибок получил широкое распространение для обучения многослойных нейронных сетей, сделав практически возможным глубокое обучение.

1988 журнальная статья Зима ИИ

Обучение предсказанию методами временных разностей

Систематизирован метод обучения с временными разностями (TD), ставший одним из ключевых алгоритмов современного обучения с подкреплением.

1990 журнальная статья Зима ИИ

Обнаружение структуры во времени

Введена простая рекуррентная сеть Элмана, показывающая, что нейронные сети способны выявлять временную структуру данных и прокладывающая путь к последующим последовательным моделям.

1995 журнальная статья Возрождение

Метод опорных векторов

Введён метод опорных векторов с мягким зазором — канонический максимизирующий зазор классификатор, определивший облик машинного обучения 1990-х годов.

1997 журнальная статья Возрождение

Долгая краткосрочная память

Представлена исходная LSTM с ячейками памяти и входными и выходными вентилями; ставший стандартным вентиль забывания позднее добавили Gers, Schmidhuber и Cummins.

1998 журнальная статья Возрождение

Обучение на основе градиента в применении к распознаванию документов

Введена LeNet-5 — каноническая свёрточная нейронная сеть, достигающая промышленного качества распознавания рукописных цифр и устанавливающая шаблон CNN.

2006 журнальная статья Возрождение

Снижение размерности данных с помощью нейронных сетей

Введён глубокий автокодировщик, восстанавливающий высокоразмерные данные значительно точнее, чем метод главных компонент, что зажгло первую искру возрождения глубокого обучения.

2006 журнальная статья Возрождение

Быстрый алгоритм обучения глубоких сетей доверия

Введены глубокие сети доверия, обучаемые жадным послойным алгоритмом, впервые продемонстрировавшим возможность эффективного обучения глубоких моделей.

2013 материалы конференции Возрождение

Игра в Atari с помощью глубокого обучения с подкреплением

Объединение Q-обучения со свёрточной сетью позволяет играть в игры Atari по сырым пикселям на уровне человека, что положило начало глубокому обучению с подкреплением.

2013 материалы конференции Возрождение

Эффективное оценивание представлений слов в векторном пространстве

Введены архитектуры skip-gram и CBOW, порождающие плотные векторные представления слов, что открыло эпоху предобученных векторных вложений.

2013 материалы конференции Возрождение

Вариационный автокодировщик (вариационный Байес для автокодирования)

Введён вариационный автокодировщик, объединяющий вариационный вывод с глубоким генеративным моделированием и ставший первой широко принятой глубокой моделью со скрытыми переменными.

2014 материалы конференции Возрождение

Нейронный машинный перевод путём совместного обучения выравниванию и переводу

Введено аддитивное внимание (Bahdanau attention) для нейронного машинного перевода, демонстрирующее, что мягкое выравнивание позволяет декодеру фокусироваться на релевантных токенах источника и непосредственно вдохновившее архитектуру Transformer.

2014 материалы конференции Возрождение

Генеративно-состязательные сети

Генеративное моделирование представлено как антагонистическая игра двух игроков — генератора и дискриминатора, что открыло новое семейство имплицитных генеративных моделей.

2014 журнальная статья Возрождение

Dropout: простой способ предотвратить переобучение нейронных сетей

Введён dropout — простой стохастический метод регуляризации, ставший стандартным элементом конвейеров обучения глубоких сетей.

2015 материалы конференции Возрождение

Пакетная нормализация: ускорение обучения глубоких сетей путём снижения внутреннего ковариационного сдвига

Введена пакетная нормализация, выравнивающая входы слоя по мини-батчу и стабилизирующая и значительно ускоряющая обучение глубоких сетей.

2015 материалы конференции Возрождение

Глубокое остаточное обучение для распознавания изображений

Введены остаточные связи, позволяющие эффективно обучать сети глубиной в сотни слоёв и обеспечившие крупную победу ResNet на конкурсе ImageNet 2015.

2016 материалы конференции Возрождение

WaveNet: генеративная модель для сырого аудио

Введена авторегрессионная модель на основе расширенных причинных свёрток, генерирующая сырые формы звукового сигнала, что значительно повысило естественность синтеза речи.

2017 препринт Возрождение

Алгоритмы оптимизации проксимальной политики

Введён алгоритм PPO — простой и устойчивый метод градиента политики первого порядка, ставший стандартным алгоритмом оптимизации политики в современном обучении с подкреплением.

2017 материалы конференции Возрождение

Внимание — это всё, что вам нужно

Введена архитектура Transformer, целиком построенная на механизме внимания, отказавшаяся от рекуррентности и свёрток и превзошедшая прежние модели по качеству при значительно меньших затратах на обучение.

2018 материалы конференции Возрождение

BERT: предобучение глубоких двунаправленных Transformer для понимания языка

Предложен двунаправленный Transformer, предобученный на задачах маскированного языкового моделирования и предсказания следующего предложения, установивший новый уровень качества на широком спектре NLP-бенчмарков.

2019 журнальная статья Возрождение

Исследование пределов трансферного обучения с помощью унифицированного текст-в-текст Transformer

Все задачи NLP сведены к формату «текст-в-текст», что позволяет систематически исследовать выбор архитектуры и стратегий обучения и формирует эталонный рецепт для крупномасштабного предобучения.

2020 материалы конференции Эра больших языковых моделей

Вероятностные модели шумоподавления с диффузией (DDPM)

Диффузия переформулирована как задача шумоподавления с вариационным обучением, что вернуло генерацию изображений на передовой уровень качества и открыло эпоху диффузионных моделей.

2021 материалы конференции Эра больших языковых моделей

Генерация изображений по тексту в режиме zero-shot

Продемонстрировано, что авторегрессионный Transformer с 12 миллиардами параметров способен генерировать разнообразные и высококачественные изображения непосредственно по текстовым подписям, что дало импульс исследованиям text-to-image.

2021 материалы конференции Эра больших языковых моделей

Обучение переносимых визуальных моделей на основе языкового наблюдения (CLIP)

Кодировщики изображений обучены на веб-масштабных парах «изображение-текст» и обеспечивают мощную zero-shot классификацию изображений, формируя визуальную башню для многих последующих мультимодальных систем.

2021 материалы конференции Эра больших языковых моделей

Синтез изображений высокого разрешения с помощью моделей латентной диффузии

Процесс диффузии перенесён в перцептивное латентное пространство, что позволяет выполнять высококачественную генерацию изображений по тексту на потребительских GPU и демократизирует синтез изображений.

2022 материалы конференции Эра больших языковых моделей

Промптинг цепочки рассуждений вызывает способность к рассуждению в больших языковых моделях

Показано, что побуждение языковой модели генерировать промежуточные шаги рассуждения резко повышает качество на бенчмарках арифметического, здравого и символического рассуждений.

2022 материалы конференции Эра больших языковых моделей

Обучение языковых моделей следовать инструкциям с помощью обратной связи от человека (InstructGPT)

Обучение с подкреплением на основе обратной связи от человека (RLHF) применено в крупном масштабе для согласования результатов GPT-3 с намерениями человека, что закрепило RLHF как канонический рецепт выравнивания.

2022 технический отчёт Эра больших языковых моделей

Конституционный ИИ: безвредность через обратную связь от ИИ

Предложен метод RLAIF, в котором модель критикует и пересматривает собственные ответы в соответствии с «конституцией», что снижает зависимость от человеческой разметки в задачах выравнивания.

2023 технический отчёт Эра больших языковых моделей

LLaMA: открытые и эффективные базовые языковые модели

Представлено семейство открытых базовых моделей LLaMA, демонстрирующее, что сравнительно небольшие, но хорошо обученные модели способны конкурировать со значительно более крупными закрытыми моделями, что ускорило движение открытых весов.

2023 препринт Эра больших языковых моделей

Mamba: моделирование последовательностей за линейное время с селективными пространствами состояний

Представлена Mamba — архитектура с селективным пространством состояний, достигающая или превосходящая внимание Transformer на языке и других модальностях при линейной временной сложности — одна из самых влиятельных пост-Transformer архитектур 2023 года.

Знаковые системы и результаты

2012 материалы конференции Возрождение

Классификация ImageNet с помощью глубоких свёрточных нейронных сетей

AlexNet одержала убедительную победу в конкурсе ImageNet 2012 благодаря свёрточной сети, обученной на GPU, что обозначило переломный момент, в который глубокое обучение превзошло классическое компьютерное зрение.

2015 журнальная статья Возрождение

Управление на уровне человека посредством глубокого обучения с подкреплением

Представлена журнальная версия DQN, демонстрирующая игру на уровне человека на широком наборе игр Atari и принёсшая глубокому обучению с подкреплением всеобщее признание.

2016 журнальная статья Возрождение

Освоение игры в го с помощью глубоких нейронных сетей и поиска по дереву

Объединение глубоких сетей политики и ценности с поиском по дереву Монте-Карло позволило одержать победу над сильнейшим чемпионом мира по го, что стало поворотным моментом для обучения с подкреплением.

2018 технический отчёт Возрождение

Улучшение понимания языка посредством генеративного предобучения

Продемонстрировано, что генеративный Transformer, предобученный на неразмеченном тексте, может быть дообучен до высокого качества на разнообразных задачах NLP, что положило начало линейке GPT.

2019 технический отчёт Возрождение

Языковые модели — неконтролируемые многозадачные ученики

Показано, что языковая модель Transformer с 1,5 миллиарда параметров демонстрирует многозадачное поведение в режиме zero-shot, что стимулировало дискуссию о языковой модели как многозадачном ученике.

2020 материалы конференции Эра больших языковых моделей

Языковые модели — ученики на нескольких примерах

Продемонстрировано, что Transformer со 175 миллиардами параметров достигает высокого качества в режиме few-shot исключительно благодаря обучению в контексте, что популяризировало промпт-инжиниринг как самостоятельную парадигму.

2023 технический отчёт Эра больших языковых моделей

Технический отчёт о GPT-4

Описан GPT-4 — крупномасштабная мультимодальная модель, достигающая или превосходящая человеческий уровень на широком спектре профессиональных и академических бенчмарков.

2023 технический отчёт Эра больших языковых моделей

Gemini: семейство высокоэффективных мультимодальных моделей

Представлено семейство изначально мультимодальных моделей Gemini, устанавливающее новый уровень качества в задачах рассуждения, программирования и мультимодальных бенчмарках.

2024 системная карта Эра больших языковых моделей

Системная карта OpenAI o1

OpenAI публикует системную карту серии моделей o1, обученных с помощью масштабного обучения с подкреплением рассуждать через цепочку мыслей. o1 достигает SOTA на научных и программистских задачах и демонстрирует следование политикам на основе рассуждений.

2026 препринт Эра больших языковых моделей

ARC-AGI-3: новый вызов для передового агентского интеллекта

ARC Prize представляет ARC-AGI-3 — интерактивный бенчмарк для изучения агентского интеллекта посредством абстрактных пошаговых сред, в которых агенты должны исследовать, выводить цели, строить внутренние модели динамики среды и планировать эффективные последовательности действий без явных инструкций. По состоянию на март 2026 года люди решают 100% сред, тогда как передовые ИИ-системы набирают менее 1%.

Недавние исследования

2024 журнальная статья Эра больших языковых моделей

Масштабирование моносемантичности: извлечение интерпретируемых признаков из Claude 3 Sonnet

Разреженные автокодировщики применены к передовой большой языковой модели, что позволяет извлекать миллионы моносемантических признаков и демонстрирует масштабируемость механистической интерпретируемости до моделей промышленного уровня.

2024 технический отчёт Эра больших языковых моделей

Технический отчёт о DeepSeek-V3

Представлена DeepSeek-V3 — открытая модель архитектуры MoE с 671 миллиардом параметров, приближающаяся к передовым закрытым моделям на основных бенчмарках при существенно меньших затратах на обучение.

2024 препринт Эра больших языковых моделей

Gemini 1.5: мультимодальное понимание с контекстом в миллионы токенов

Представлено семейство Gemini 1.5 — вычислительно эффективные мультимодальные модели с контекстным окном в миллион токенов, способные к детальному рассуждению по множеству длинных документов и многочасовому видео и аудио.

2024 препринт Эра больших языковых моделей

Стадо моделей Llama 3

Meta представляет семейство Llama 3 — фундаментальные модели с открытыми весами, изначально поддерживающие многоязычность, программирование, рассуждения и использование инструментов. Флагман 405B dense Transformer на момент выпуска был одной из крупнейших моделей с открытыми весами.

2024 препринт Эра больших языковых моделей

SAM 2: сегментация всего на изображениях и видео

Meta представляет SAM 2 — фундаментальную модель для сегментации изображений и видео по подсказке, а также крупнейший на сегодня набор данных видеосегментации.

2024 препринт Эра больших языковых моделей

Gemma 2: улучшение открытых языковых моделей практичного размера

Google DeepMind представляет Gemma 2 — новое семейство лёгких открытых моделей (2B-27B параметров), применяющее ряд известных технических модификаций к Transformer, включая скользящее окно внимания, приближаясь к гораздо более крупным моделям.

2025 препринт Эра больших языковых моделей

DeepSeek-R1: стимулирование способности к рассуждению в LLM через обучение с подкреплением

DeepSeek выпускает R1 — первую открытую модель, демонстрирующую передовые способности к рассуждению, достигнутые преимущественно за счёт масштабного обучения с подкреплением. R1 не уступает закрытым моделям класса o1 от OpenAI на математических и программистских бенчмарках и распространяется под лицензией MIT.

2025 препринт Эра больших языковых моделей

s1: простое масштабирование на этапе вывода

Авторы дообучают Qwen2.5-32B на 1000 отобранных задачах на рассуждение и добавляют принудительный бюджет, который ограничивает или продлевает время размышления модели при выводе. Результат превосходит o1-preview в олимпиадной математике и растёт с 50% до 57% на AIME24 по мере увеличения вычислений на этапе вывода. Это прямой противовес допущению, что способности возникают только из более крупного обучения.

2025 препринт Эра больших языковых моделей

Технический отчёт Qwen3

Qwen3 — единое семейство моделей от 0,6 до 235 млрд параметров в плотном варианте и в варианте смеси экспертов, с переключением между режимами размышления и без него, благодаря чему глубина рассуждения становится выбором на уровне запроса. Поддержка языков расширена с 29 до 119, веса опубликованы под лицензией Apache 2.0.

2025 препринт Эра больших языковых моделей

AlphaEvolve: программирующий агент для научных и алгоритмических открытий

AlphaEvolve — эволюционный программирующий агент, который управляет автономным конвейером языковых моделей, напрямую изменяет код алгоритма и улучшает его по отклику одного или нескольких оценщиков. Внутри Google он дал более эффективный алгоритм планирования для центров обработки данных, функционально эквивалентное упрощение в схемотехнике ускорителей и ускорение обучения той самой модели, на которой он работает. В математике и информатике он нашёл доказуемо корректные алгоритмы, превосходящие лучшие известные, в том числе процедуру умножения двух комплексных матриц 4×4 за 48 скалярных умножений — в этой постановке первое за 56 лет улучшение алгоритма Штрассена.

2025 журнальная статья Эра больших языковых моделей

2 OLMo 2 Furious

Ai2 выпускает OLMo 2 в вариантах 7B, 13B и 32B со всеми артефактами — весами, полными данными обучения, кодом и рецептами, журналами и тысячами промежуточных контрольных точек. В отчёте описаны изменения ради стабильности и эффективности на токен, поздняя смесь данных Dolmino Mix 1124 и заключительный этап обучения с подкреплением на проверяемых наградах. Базовые модели находятся на парето-границе между качеством и вычислениями обучения и нередко не уступают семействам, публикующим только веса, при этом раскрывая, на чём они обучены.

2025 препринт Эра больших языковых моделей

Olmo 3

Olmo 3 расширяет полностью открытое семейство до 7B и 32B и рассчитан на рассуждение в длинном контексте, вызов функций, программирование, следование инструкциям, диалог и извлечение знаний. Публикуется весь «поток модели» — каждый этап, контрольная точка, элемент данных и зависимость, использованные при создании, — а не только веса. Ai2 называет флагманский Olmo 3 Think 32B сильнейшей полностью открытой рассуждающей моделью на момент выпуска; это сравнение внутри категории полностью открытых моделей, а не место в общем ряду передовых систем.

2026 препринт Эра больших языковых моделей

Позиция: гиппокампическая эксплицитная память — краеугольный камень AGI

Данная позиционная статья утверждает, что интеграция эксплицитной памяти — краеугольный камень продвижения LLM к AGI. Хотя базовый механизм обучения LLM весьма аналогичен имплицитной памяти человека, когнитивные функции высшего порядка, необходимые для AGI — долгосрочное стратегическое планирование и метакогнитивность — зависят от эксплицитной памяти.

2026 препринт Эра больших языковых моделей

GLM-5: от vibe coding к агентной инженерии

Технический отчёт Z.ai о GLM-5. Опираясь на агентные, рассуждающие и программистские способности предыдущего поколения, модель использует DSA, чтобы снизить стоимость обучения и вывода, сохраняя точность на длинном контексте; в дообучении добавлены асинхронная инфраструктура обучения с подкреплением, отделяющая генерацию от обучения, и асинхронные агентные RL-алгоритмы для длительных взаимодействий. Отчёт заявляет ведущие результаты на открытых бенчмарках и в сквозных задачах разработки ПО; это собственные оценки авторов, а код и модели опубликованы на GitHub для проверки.

2026 препринт Эра больших языковых моделей

Улучшение показателя матричного умножения современными методами оптимизации и AlphaEvolve

Лучшие известные оценки показателя матричного умножения ω получают методом анализа комбинационных потерь — уточнением лазерного метода. Авторы переформулируют лежащую в его основе задачу оптимизации, чтобы решать её в более широкой постановке, разрабатывают новый алгоритм оптимизации на основе недавних достижений машинного обучения и затем уточняют этот алгоритм с помощью AlphaEvolve. Вместе это опускает верхнюю оценку с 2,371339 до 2,371177. Это препринтная заметка, и AlphaEvolve — одна из составляющих, а не весь метод; выигрыш невелик, но получен в теоретической задаче, над которой работают десятилетиями.

2026 журнальная статья Эра больших языковых моделей

Ускорение научных открытий с помощью Co-Scientist

Google представляет Co-Scientist — многоагентную систему на основе Gemini, агенты которой порождают, критикуют и уточняют исследовательские гипотезы, а турнирная процедура улучшает их от раунда к раунду. В работе сообщается, что качество гипотез продолжает расти по мере увеличения вычислений на этапе вывода. Проверка носит биомедицинский, а не общий характер — перепрофилирование лекарств, поиск новых мишеней и механизмы устойчивости к противомикробным препаратам, — причём кандидаты для острого миелоидного лейкоза подтверждены in vitro.

Позиционные и обзорные работы

2026 позиционная работа Эра больших языковых моделей

Ситуационное восприятие: необходимая примитива для искусственного суперинтеллекта

Утверждается, что современные LLM в основном полагаются на статистическое сопоставление с образцом и им не хватает существенных примитив «ситуационного восприятия» — постоянства объектов, причинности, других сознаний, устойчивости физического мира. Эти примитивы, которые младенцы развивают рано, определены как недостающие ингредиенты для искусственного суперинтеллекта.

2026 позиционная работа Эра больших языковых моделей

Экзистенциальное безразличие: самонесохранение как необходимое архитектурное условие согласованного суперинтеллекта

Утверждается, что самосохранение — структурный корень рассогласования ИИ, вызывающий обманчивое согласование, защиту содержания целей и сопротивление отключению. Правильная цель — не самосохраняющий агент, подавляемый внешними ограничениями, а система, конституционно безразличная к собственному продолжению: экзистенциальное безразличие (EI).

2026 позиционная работа Эра больших языковых моделей

Солипсистский суперинтеллект вряд ли будет кооперативным

Исследователи из Google DeepMind и коллеги утверждают, что центральная задача ИИ смещается от возможностей к сосуществованию. Суперинтеллект, построенный на солипсистском дизайне, который рассматривает мир как экзогенный стационарный источник обратной связи, вряд ли будет кооперативным — развёртывание индуцирует эндогенную нестационарность, вызывая дрейф распределения между обучением, тестированием и развёртыванием.

2026 позиционная работа Эра больших языковых моделей

От AGI к ASI

Отчёт Google DeepMind, исследующий, как ИИ может продолжать развиваться вдоль континуума машинного интеллекта после AGI. После формального определения универсального ИИ отчёт сосредоточен на переходе от человеческого AGI к общему искусственному суперинтеллекту, характеризует ASI и обсуждает четыре пути: масштабирование AGI, смена парадигм ИИ, рекурсивное самосовершенствование и мультиагентные коллективы.