TECHNOLOGY GRAPH
Tecnologías de IA
De la arquitectura y el entrenamiento a la inferencia, el despliegue y los modelos con pesos abiertos
Un mapa editorial de las capas que convierten ideas de investigación en modelos entrenables y sistemas utilizables. Cada entrada enlaza artículos, historia, modelos, herramientas y fuentes primarias.
Arquitectura de modelos
Estructuras que determinan cómo los modelos representan y transforman información.
Transformer
Una arquitectura neuronal basada en atención que procesa en paralelo las posiciones de una secuencia. Se convirtió en la base de muchos modelos lingüísticos y multimodales modernos.
- self-attention
- encoder
- decoder
Mixture of Experts (MoE)
Una familia de arquitecturas con expertos enrutados. Las variantes dispersas modernas activan solo algunos expertos por entrada, aumentando la capacidad sin usar todos los parámetros en cada token.
- experts
- router
- sparse activation
Diffusion Model
Un modelo generativo que aprende a invertir un proceso gradual de adición de ruido. La eliminación iterativa de ruido se volvió fundamental para generar imágenes, audio, vídeo y contenido multimodal.
- forward noise
- denoising
- score matching
Frameworks y representación
Software e interfaces de datos usados para construir, entrenar y ejecutar modelos.
PyTorch
Un framework de código abierto para tensores y aprendizaje profundo con diferenciación automática, módulos neuronales, compilación y ejecución distribuida. Se usa desde la investigación hasta el entrenamiento en producción.
- tensor
- autograd
- module
Hugging Face Transformers
Una biblioteca de definición de modelos que conecta arquitecturas preentrenadas con los ecosistemas de entrenamiento e inferencia. Estandariza configuración, preprocesamiento, carga, generación e interfaces de tareas.
- model definitions
- pretrained checkpoints
- Trainer
Tokenization
La conversión del texto sin procesar en unidades discretas que procesa un modelo. El vocabulario y la segmentación afectan longitud, cobertura multilingüe, coste y comportamiento.
- token
- vocabulary
- BPE
Entrenamiento y posentrenamiento
Métodos de escala, adaptación y preferencia que moldean capacidades y comportamiento.
Distributed Training
Técnicas que reparten datos, parámetros, activaciones o cómputo entre dispositivos y nodos. Permiten entrenar modelos grandes, pero introducen compromisos de comunicación, sincronización y tolerancia a fallos.
- data parallelism
- tensor parallelism
- pipeline parallelism
SFT / RLHF / DPO
Una familia de métodos de posentrenamiento para enseñar seguimiento de instrucciones y alineación con preferencias. SFT aprende de demostraciones; RLHF y DPO usan comparaciones mediante optimizaciones distintas.
- supervised fine-tuning
- preference data
- reward model
Reasoning and test-time compute
Un postentrenamiento que enseña al modelo a producir una traza de razonamiento larga antes de responder y a gastar más cómputo en la inferencia cuando el problema es más difícil. El aprendizaje por refuerzo con recompensas verificables — donde una respuesta comprobable aporta la señal de entrenamiento — es lo que hizo reproducible este enfoque fuera de los laboratorios cerrados. Conviene decir el intercambio con claridad: precisión obtenida por la longitud de la generación y no por un modelo mayor, pagada en latencia y coste de servicio.
- reasoning traces
- verifiable rewards
- inference budget
LoRA / QLoRA
Métodos de ajuste fino eficientes que entrenan pequeños adaptadores de bajo rango manteniendo congelados los pesos base. QLoRA los combina con un modelo base cuantizado para reducir aún más la memoria.
- low-rank adapters
- frozen base model
- 4-bit training
Inferencia y despliegue
Técnicas de memoria, planificación, compresión y ejecución para servir modelos.
Quantization
La representación de pesos, activaciones o cachés con menor precisión numérica. Reduce memoria, ancho de banda y cómputo, con compromisos de precisión y compatibilidad de hardware.
- precision
- INT8
- INT4
KV Cache
Una caché de claves y valores de atención de tokens anteriores durante la generación autorregresiva. Evita recalcular todo el prefijo, pero suele consumir mucha memoria.
- keys
- values
- prefill
Continuous Batching / PagedAttention
Técnicas de servicio que incorporan y retiran solicitudes continuamente mientras gestionan la caché KV por páginas. Mejoran utilización y rendimiento con cargas de longitud variable.
- request scheduling
- memory paging
- throughput
Speculative Decoding
Un método de inferencia en el que un modelo borrador más rápido propone varios tokens y el modelo objetivo los verifica en paralelo. Puede reducir latencia sin cambiar la distribución objetivo.
- draft model
- verification
- latency
Open-model Inference Ecosystem
Motores y entornos como vLLM y llama.cpp convierten pesos descargables en inferencia local o de servidor. Sus prioridades varían entre rendimiento, portabilidad de hardware, formatos y complejidad operativa.
- vLLM
- llama.cpp
- GGUF
APPLICATION LAYER
Arquitectura de aplicaciones
Los modelos se convierten en productos mediante flujos, herramientas, intercambio de contexto, salvaguardas y evaluación. Las secciones MCP y Herramientas cubren esta capa sin duplicarla aquí.
Casos de modelos abiertos
Familias examinadas según código, pesos, datos de entrenamiento y licencia.
Llama
La familia de Meta con pesos descargables amplió la inferencia local y el ajuste fino. Al usar condiciones propias de Llama, «pesos abiertos» es más preciso que asumir código abierto según la OSI.
- open weights
- community license
- model family
Qwen
La familia Qwen de Alibaba abarca modelos densos, con expertos, multilingües y multimodales. Muchos checkpoints son descargables, pero licencia y divulgación deben revisarse en cada ficha de modelo.
- multilingual
- dense and MoE
- open weights
Mistral / Mixtral
La familia de Mistral AI incluye modelos densos Mistral y modelos Mixtral con expertos. Algunas versiones tienen licencias permisivas y otras no; la apertura debe evaluarse por artefacto.
- dense models
- MoE
- open weights
DeepSeek
Las versiones descargables de DeepSeek extendieron el estudio de MoE, posentrenamiento de razonamiento y servicio eficiente. Código y pesos pueden tener licencias distintas; los datos de entrenamiento son otra dimensión.
- MoE
- reasoning
- open weights
Gemma
La familia de Google con pesos descargables conecta investigación derivada de Gemini con despliegue local, en el borde y alojado. Google la denomina abierta, pero el uso se rige por condiciones propias de Gemma.
- open weights
- lightweight models
- edge deployment
OLMo
Ai2 publica la familia OLMo con sus datos de preentrenamiento, su código de entrenamiento, sus puntos de control intermedios y sus registros, además de los pesos. El primer OLMo apareció en febrero de 2024, OLMo 2 en noviembre del mismo año y Olmo 3 en noviembre de 2025, con variantes Base, Instruct y Think de 7B y 32B bajo licencia Apache 2.0. Es el caso en que los cuatro elementos que conviene revisar por separado — código, pesos, datos de entrenamiento y licencia — están realmente todos publicados, lo que lo convierte en un punto de referencia frente a familias que solo difunden los pesos.
- fully open
- open training data
- intermediate checkpoints
gpt-oss
gpt-oss-120b y 20b de OpenAI son modelos MoE de razonamiento descargables para inferencia local o alojada. Sus pesos e implementaciones de referencia Apache 2.0 amplían el despliegue, pero el conjunto de preentrenamiento no se ha publicado.
- open weights
- reasoning
- MoE
GLM-5
La serie GLM-5 de Z.ai es una gran familia de modelos de lenguaje MoE para razonamiento, programación y trabajo agéntico de largo alcance. GLM-5 apareció en febrero de 2026, 5.1 en abril, 5.2 en junio con 753 000 millones de parámetros y una ventana de contexto de un millón de tokens, y 5.3 en agosto sobre la misma base con cambios de posentrenamiento; el más pequeño GLM-5.3-Flash llegó días después con 320 000 millones de parámetros totales y 18 000 millones activos. La escala de los miembros mayores hace exigente el autoalojamiento.
- open weights
- MoE
- long context
Kimi K3
Moonshot AI publicó Kimi K3 en julio de 2026: un modelo lingüístico MoE multimodal nativo de pesos abiertos, con 2,8 billones de parámetros totales, 104 mil millones activos y un contexto de un millón de tokens. Está orientado a programación prolongada, trabajo del conocimiento y agentes con herramientas, aunque el despliegue local es exigente.
- open weights
- MoE
- long context
Este es un mapa técnico seleccionado, no una afirmación de cobertura completa.