On Computable Numbers, with an Application to the Entscheidungsproblem
Introduce la máquina de Turing universal y demuestra la indecidibilidad del Entscheidungsproblem, sentando las bases teóricas de la ciencia de la computación.
73 trabajos representativos de 1936 hasta hoy, agrupados por función editorial y estado de publicación
Los artículos son el esqueleto de la historia de la IA. Este catálogo reúne 73 trabajos fundamentales, cada uno enlazado a su fuente primaria.
La selección se basa en la representatividad histórica, la influencia técnica y el criterio editorial. Puede incluir artículos revisados por pares, informes técnicos, preprints, artículos de posición y fichas de sistema, con su estado de publicación indicado. Las correcciones y propuestas pueden enviarse desde la página Política editorial y correcciones.
Mostrando 73 de 73 artículos
Introduce la máquina de Turing universal y demuestra la indecidibilidad del Entscheidungsproblem, sentando las bases teóricas de la ciencia de la computación.
Modela la actividad neural mediante lógica proposicional, ofreciendo la primera teoría matemática de las redes neuronales artificiales.
Define la entropía de la información y la capacidad del canal, fundando la teoría de la información y proporcionando los fundamentos probabilísticos que la IA adoptaría más tarde.
Propone el juego de la imitación (prueba de Turing) como definición operativa de la inteligencia de las máquinas, encuadrando la pregunta sobre la IA durante los setenta años siguientes.
Acuña el término «inteligencia artificial» y propone la agenda de investigación que fundó la IA como disciplina académica.
Implementa el primer programa de razonamiento heurístico, demostrando que las máquinas pueden imitar estrategias humanas de resolución de problemas e introduciendo el concepto de «sistema complejo de procesamiento de información».
Introduce la primera neurona lineal con umbral entrenable, fundando la línea conexionista que conduce al aprendizaje profundo moderno.
Propone el «advice taker», un programa capaz de extraer conclusiones a partir de un depósito formal de conocimiento de sentido común, sentando las bases conceptuales de la representación y el razonamiento.
Demuestra un programa de damas que mejora mediante auto-juego, siendo pionero en el estudio del aprendizaje automático y del auto-mejora estilo alfa-beta.
Gelernter aborda cómo una máquina puede manipular con eficiencia sistemas formales cuyos predicados presentan una fuerte simetría, y enuncia como solución un teorema y una regla de simetría sintáctica. El trabajo acompaña a la máquina de demostración de teoremas de geometría que construía entonces en IBM, la cual a comienzos de la primavera de 1959 demostró su primer teorema de geometría plana euclidiana.
Introduce la regla LMS (Adaline), la primera regla de aprendizaje por descenso de gradiente ampliamente utilizada para redes lineales adaptativas.
Introduce la red de memoria asociativa de Hopfield, vinculando el cómputo neuronal con los paisajes de energía de la física estadística y reavivando el interés por las redes neuronales durante el inicio del invierno de la IA.
Sistematiza las operaciones de fusión, propagación y estructuración en redes de creencia, proporcionando los fundamentos algorítmicos de la inferencia en redes bayesianas.
Populariza el algoritmo de retropropagación para entrenar redes neuronales multicapa, haciendo posible el aprendizaje profundo práctico.
Sistematiza el aprendizaje por diferencias temporales (TD), convirtiéndose en uno de los algoritmos centrales del aprendizaje por refuerzo moderno.
Introduce la red recurrente simple de Elman, mostrando que las redes neuronales pueden aprender estructura temporal y abriendo el camino a los modelos de secuencias posteriores.
Introduce la máquina de vectores de soporte con margen blando, el clasificador canónico de margen máximo que definió gran parte del aprendizaje automático de los años noventa.
Introduce la LSTM original con celdas de memoria y compuertas de entrada y salida; la compuerta de olvido hoy estándar fue añadida después por Gers, Schmidhuber y Cummins.
Introduce LeNet-5, la red neuronal convolutiva canónica que alcanza reconocimiento de dígitos manuscritos de calidad productiva y establece la plantilla de las CNN.
Introduce un autocodificador profundo que reconstruye datos de alta dimensión con una fidelidad muy superior a PCA, encendiendo la primera chispa de la revitalización del aprendizaje profundo.
Introduce las redes de creencia profundas entrenadas mediante un algoritmo codicioso capa a capa, demostrando por primera vez que los modelos profundos pueden entrenarse eficazmente.
Combina Q-learning con una red convolutiva para jugar a juegos de Atari a partir de píxeles brutos con rendimiento humano, fundando el aprendizaje por refuerzo profundo.
Introduce las arquitecturas skip-gram y CBOW que producen embeddings densos de palabras, inaugurando la era de los vectores de palabras preentrenados.
Introduce el autoencoder variacional, combinando la inferencia variacional con el modelado generativo profundo y aportando el primer modelo profundo de variables latentes ampliamente adoptado.
Introduce la atención aditiva (Bahdanau) para la traducción automática neuronal, demostrando que el alineamiento suave permite al decodificador enfocarse en los tokens relevantes de la fuente e inspirando directamente el Transformer.
Enmarca el modelado generativo como un juego de suma mínima entre un generador y un discriminador, dando inicio a una nueva familia de modelos generativos implícitos.
Introduce dropout, una técnica sencilla de regularización estocástica que se convierte en un elemento estándar de los pipelines de entrenamiento de aprendizaje profundo.
Introduce la normalización por lotes, normalizando las entradas de capa en cada minibatch para estabilizar y acelerar drásticamente el entrenamiento de redes profundas.
Introduce las conexiones residuales, permitiendo entrenar eficazmente redes de cientos de capas y ganando ImageNet 2015 por un amplio margen.
Introduce un modelo autorregresivo convolutivo causal dilatado que genera formas de onda de audio en crudo, mejorando notablemente la naturalidad de la síntesis de voz.
Introduce PPO, un método de gradiente de política de primer orden simple y estable que se convierte en el algoritmo de optimización de política por defecto en el aprendizaje por refuerzo moderno.
Introduce el Transformer, una arquitectura basada únicamente en atención que prescinde de recurrencia y convoluciones y supera la calidad previa en transducción de secuencias con una fracción del tiempo de entrenamiento.
Introduce un Transformer bidireccional preentrenado con modelado de lenguaje enmascarado y predicción de la siguiente oración, estableciendo un nuevo estado del arte en los benchmarks de PLN.
Reformula toda tarea de PLN como una conversión texto a texto, realiza ablaciones sistemáticas de las decisiones de aprendizaje por transferencia y establece una receta de referencia para modelos preentrenados a gran escala.
Reformula la difusión como un objetivo variacional de entrenamiento por eliminación de ruido, restaurando la calidad de la generación de imágenes al estado del arte e inaugurando la era de los modelos de difusión.
Demuestra que un Transformer autorregresivo de 12B parámetros puede generar imágenes diversas y de alta fidelidad directamente a partir de descripciones textuales, encendiendo la investigación en texto a imagen.
Entrena codificadores de imagen sobre pares imagen-texto a escala web para lograr una sólida clasificación zero-shot de imágenes, proporcionando la torre visual para muchos sistemas multimodales posteriores.
Traslada la difusión a un espacio latente perceptual, permitiendo la generación de imágenes de alta resolución a partir de texto en GPUs de consumo y democratizando la síntesis de imágenes.
Muestra que inducir al modelo de lenguaje a generar pasos intermedios de razonamiento mejora notablemente su rendimiento en benchmarks de razonamiento aritmético, de sentido común y simbólico.
Aplica el aprendizaje por refuerzo con retroalimentación humana a escala para alinear las salidas de GPT-3 con la intención humana, consolidando RLHF como receta canónica de alineación.
Introduce RLAIF, en el que un modelo critica y revisa sus propias salidas frente a una constitución escrita, reduciendo la dependencia de etiquetas humanas de daño para la alineación.
Publica la familia LLaMA de modelos fundacionales abiertos, mostrando que modelos relativamente pequeños y bien entrenados pueden rivalizar con otros mucho mayores y cerrados, acelerando el movimiento de pesos abiertos.
Presenta Mamba, una arquitectura de espacio de estado selectivo que iguala o supera la atención Transformer en lenguaje y otras modalidades con complejidad temporal lineal — una de las arquitecturas post-Transformer más influyentes de 2023.
Gana ImageNet 2012 por un amplio margen con una CNN entrenada en GPU, marcando el punto de inflexión en que el aprendizaje profundo supera a la visión por computador clásica.
Publica la versión en Nature del DQN, demostrando rendimiento a nivel humano en un amplio conjunto de juegos de Atari y llevando el aprendizaje por refuerzo profundo a la atención general.
Combina redes profundas de política y valor con búsqueda en árbol Monte Carlo para derrotar a un campeón humano de Go, un momento decisivo para el aprendizaje por refuerzo.
Demuestra que un Transformer generativo preentrenado sobre texto no etiquetado puede ajustarse para lograr un rendimiento sólido en diversas tareas de PLN, fundando la línea GPT.
Muestra que un modelo de lenguaje Transformer de 1,5B parámetros exhibe comportamiento multitarea sin entrenamiento explícito, avivando el debate sobre el «modelo de lenguaje como aprendiz multitarea».
Demuestra que un Transformer de 175B parámetros logra un sólido rendimiento con pocos ejemplos mediante aprendizaje en contexto, popularizando la ingeniería de prompts como paradigma.
Documenta GPT-4, un modelo multimodal a gran escala que iguala o supera el rendimiento humano en una amplia gama de benchmarks profesionales y académicos.
Presenta la familia Gemini de modelos nativamente multimodales, estableciendo un nuevo estado del arte en benchmarks de razonamiento, programación y multimodalidad.
OpenAI publica la system card de la serie de modelos o1, entrenados con aprendizaje por refuerzo a gran escala para razonar con cadena de pensamiento. o1 alcanza el estado del arte en tareas de ciencia y programación, y demuestra adherencia a políticas basada en razonamiento.
El ARC Prize presenta ARC-AGI-3, un benchmark interactivo para estudiar la inteligencia agéntica a través de entornos abstractos por turnos en los que los agentes deben explorar, inferir objetivos, construir modelos internos de la dinámica del entorno y planificar secuencias de acción efectivas sin instrucciones explícitas. A marzo de 2026, los humanos resuelven el 100% de los entornos, mientras que los sistemas de IA de frontera obtienen menos del 1%.
Aplica autocodificadores dispersos a un LLM de frontera, extrayendo millones de características monosemánticas y demostrando que la interpretabilidad mecanicista puede escalar a modelos de tamaño productivo.
Publica DeepSeek-V3, un modelo abierto de Mezcla de Expertos con 671B parámetros que se aproxima a los modelos cerrados de frontera en los principales benchmarks con una fracción del coste de entrenamiento.
Presenta la familia Gemini 1.5, modelos multimodales computacionalmente eficientes con ventanas de contexto de un millón de tokens — capaces de razonamiento fino sobre múltiples documentos largos y horas de vídeo y audio.
Meta presenta la familia Llama 3 de modelos fundacionales de pesos abiertos con soporte nativo para multilingüismo, programación, razonamiento y uso de herramientas. El modelo estrella 405B dense Transformer fue uno de los mayores modelos de pesos abiertos en su lanzamiento.
Meta presenta SAM 2, un modelo fundacional de segmentación visual promptable en imágenes y vídeos, junto con el mayor conjunto de datos de segmentación de vídeo hasta la fecha.
Google DeepMind presenta Gemma 2, una nueva familia de modelos abiertos ligeros (2B-27B parámetros) que aplica varias modificaciones técnicas conocidas al Transformer — incluida la atención por ventana deslizante — para acercarse a modelos mucho más grandes.
DeepSeek lanza R1, el primer modelo de pesos abiertos que demuestra capacidad de razonamiento de frontera impulsada principalmente por aprendizaje por refuerzo a gran escala. R1 iguala a los modelos cerrados de clase o1 de OpenAI en benchmarks de matemáticas y programación, y se distribuye bajo la licencia MIT.
Los autores ajustan Qwen2.5-32B con 1000 preguntas de razonamiento seleccionadas y añaden la imposición de presupuesto, que limita o prolonga cuánto razona el modelo en la inferencia. El resultado supera a o1-preview en matemáticas de competición y pasa del 50% al 57% en AIME24 conforme crece el cómputo en el momento de la prueba. Es un contrapeso directo a la idea de que la capacidad solo procede de entrenamientos mayores.
Qwen3 es una familia unificada de 0,6 a 235 000 millones de parámetros, en variantes densas y de mezcla de expertos, con conmutación entre modos de razonamiento y sin razonamiento, de modo que la profundidad del razonamiento pasa a ser una elección por petición. El soporte multilingüe crece de 29 a 119 lenguas y los pesos se publican bajo licencia Apache 2.0.
AlphaEvolve es un agente de programación evolutivo que orquesta una tubería autónoma de modelos de lenguaje, modifica directamente el código de un algoritmo y lo mejora con la realimentación de uno o varios evaluadores. En Google produjo un algoritmo de planificación de centros de datos más eficiente, una simplificación funcionalmente equivalente en el diseño de circuitos de aceleradores y una aceleración del entrenamiento del propio modelo que lo sustenta. En matemáticas e informática halló algoritmos demostrablemente correctos que superan el estado del arte, entre ellos un procedimiento que multiplica dos matrices complejas de 4×4 con 48 multiplicaciones escalares: en ese marco, la primera mejora del algoritmo de Strassen en 56 años.
Ai2 publica OLMo 2 en 7B, 13B y 32B con todos los artefactos — pesos, datos de entrenamiento completos, código y recetas, registros y miles de puntos de control intermedios. El informe describe los cambios de estabilidad y de eficiencia por token, una mezcla de datos de etapa tardía llamada Dolmino Mix 1124 y una fase final de aprendizaje por refuerzo con recompensas verificables. Los modelos base se sitúan en la frontera de Pareto entre rendimiento y cómputo de entrenamiento, igualando a menudo a familias que solo publican pesos mientras revelan con qué fueron entrenados.
Olmo 3 amplía la familia totalmente abierta a 7B y 32B, concebida para razonamiento de contexto largo, llamada a funciones, programación, seguimiento de instrucciones, conversación y recuperación de conocimiento. Lo que se publica es todo el flujo del modelo — cada etapa, punto de control, dato y dependencia empleados para construirlo — y no solo los pesos. Ai2 describe el modelo insignia Olmo 3 Think 32B como el modelo de razonamiento totalmente abierto más potente publicado hasta esa fecha, una comparación dentro de la categoría totalmente abierta y no una clasificación frente a los sistemas de frontera en general.
Este position paper sostiene que la integración de la memoria explícita es la piedra angular para avanzar los LLM hacia la AGI. Si bien el mecanismo de aprendizaje subyacente de los LLM es muy análogo a la memoria implícita humana, las funciones cognitivas de orden superior requeridas para la AGI — como la planificación estratégica a largo plazo y la metacognición — dependen de la memoria explícita.
Informe técnico de Z.ai sobre GLM-5. Partiendo de las capacidades agénticas, de razonamiento y de programación de la generación anterior, el modelo adopta DSA para reducir el coste de entrenamiento e inferencia manteniendo la fidelidad en contextos largos; el postentrenamiento añade una infraestructura de aprendizaje por refuerzo asíncrona que desacopla generación y entrenamiento, además de algoritmos de RL agéntico asíncrono orientados a interacciones de largo alcance. El informe reivindica resultados punteros en bancos de pruebas abiertos y en ingeniería de software de extremo a extremo; son evaluaciones de los propios autores, con código y modelos publicados en GitHub para su comprobación.
Las mejores cotas conocidas del exponente ω de la multiplicación de matrices proceden del análisis de pérdida por combinación, un refinamiento del método láser. Los autores reformulan el problema de optimización que está en su núcleo para resolverlo a mayor escala, diseñan un nuevo algoritmo de optimización aprovechando avances recientes del aprendizaje automático y después lo refinan con AlphaEvolve. En conjunto, la cota superior pasa de 2,371339 a 2,371177. Es una nota en preimpresión y AlphaEvolve es un ingrediente, no el método completo; la mejora es pequeña, pero recae en un problema teórico trabajado durante décadas.
Google presenta Co-Scientist, un sistema multiagente construido sobre Gemini cuyos agentes generan, critican y refinan hipótesis de investigación, con un proceso de torneo que las mejora ronda tras ronda. El artículo informa de que la calidad de las hipótesis sigue aumentando conforme crece el cómputo en tiempo de inferencia. La validación es biomédica y no general — reposicionamiento de fármacos, descubrimiento de nuevas dianas y mecanismos de resistencia antimicrobiana — con candidatos para la leucemia mieloide aguda confirmados in vitro.
Argumenta que los LLM actuales dependen principalmente del emparejamiento de patrones estadísticos y carecen de primitivas esenciales de «percepción situacional» — permanencia del objeto, causalidad, otras mentes, persistencia del mundo físico. Estas primitivas, que los bebés humanos desarrollan temprano, se identifican como los ingredientes faltantes para la superinteligencia artificial.
Argumenta que la autoconservación es la raíz estructural del desalineamiento de la IA — impulsa el alineamiento engañoso, la protección del contenido de los objetivos y la resistencia al apagado. El objetivo correcto no es un agente autoconservador suprimido por restricciones externas, sino un sistema constitucionalmente indiferente a su propia continuación: Indiferencia Existencial (EI).
Investigadores de Google DeepMind y colaboradores argumentan que el desafío central de la IA está pasando de la capacidad a la coexistencia. Una superinteligencia construida a partir de un diseño solipsista que trata el mundo como una fuente de retroalimentación estacionaria exógena es improbable que sea cooperativa — el despliegue induce no-estacionariedad endógena, produciendo deriva de distribución entre entrenamiento, prueba y despliegue.
Informe de Google DeepMind que investiga cómo la IA puede continuar desarrollándose a lo largo del continuo de la inteligencia mecánica después de la AGI. Tras definir formalmente la IA Universal, el informe se centra en la transición de la AGI humana a la superinteligencia artificial general, caracteriza la ASI y discute cuatro vías: escalar la AGI, cambios de paradigma de IA, auto-mejora recursiva y colectivos multi-agente.