TECHNOLOGY GRAPH
Tecnologias de IA
Da arquitetura e do treino à inferência, implantação e casos de modelos com pesos abertos
Um mapa editorial das camadas que transformam ideias de investigação em modelos treináveis e sistemas utilizáveis. Cada entrada liga artigos, história, modelos, ferramentas e fontes primárias.
Arquitetura de modelos
Estruturas que determinam como os modelos representam e transformam informação.
Transformer
Uma arquitetura neural baseada em atenção que processa posições de uma sequência em paralelo. Tornou-se a base de muitos modelos modernos de linguagem e multimodais.
- self-attention
- encoder
- decoder
Mixture of Experts (MoE)
Uma família de arquiteturas com especialistas encaminhados. As variantes esparsas modernas ativam apenas alguns especialistas por entrada, aumentando a capacidade sem mobilizar todos os parâmetros em cada token.
- experts
- router
- sparse activation
Diffusion Model
Um modelo generativo que aprende a inverter um processo gradual de adição de ruído. A remoção iterativa de ruído tornou-se central na geração de imagem, áudio, vídeo e conteúdo multimodal.
- forward noise
- denoising
- score matching
Frameworks e representação
Software e interfaces de dados usados para construir, treinar e executar modelos.
PyTorch
Um framework open source de tensores e aprendizagem profunda com diferenciação automática, módulos neurais, compilação e execução distribuída. É usado da investigação ao treino em produção.
- tensor
- autograd
- module
Hugging Face Transformers
Uma biblioteca de definição de modelos que liga arquiteturas pré-treinadas aos ecossistemas de treino e inferência. Padroniza configuração, pré-processamento, carregamento, geração e interfaces de tarefas.
- model definitions
- pretrained checkpoints
- Trainer
Tokenization
O mapeamento de texto bruto para unidades discretas processadas por um modelo. Vocabulário e segmentação afetam comprimento da sequência, cobertura multilíngue, custo e comportamento.
- token
- vocabulary
- BPE
Treino e pós-treino
Métodos de escala, adaptação e preferência que moldam capacidades e comportamento.
Distributed Training
Técnicas que repartem dados, parâmetros, ativações ou computação entre dispositivos e nós. Permitem treinar grandes modelos, mas introduzem compromissos de comunicação, sincronização e tolerância a falhas.
- data parallelism
- tensor parallelism
- pipeline parallelism
SFT / RLHF / DPO
Uma família de métodos de pós-treino para ensinar seguimento de instruções e alinhamento de preferências. SFT aprende com demonstrações; RLHF e DPO usam comparações de preferência por otimizações distintas.
- supervised fine-tuning
- preference data
- reward model
Reasoning and test-time compute
Um pós-treino que ensina o modelo a produzir um longo traço de raciocínio antes de responder e a gastar mais cálculo na inferência quando o problema é mais difícil. A aprendizagem por reforço com recompensas verificáveis — em que uma resposta conferível fornece o sinal de treino — foi o que tornou a abordagem reproduzível fora dos laboratórios fechados. A troca merece ser dita com clareza: exatidão obtida pelo comprimento da geração e não por um modelo maior, paga em latência e custo de serviço.
- reasoning traces
- verifiable rewards
- inference budget
LoRA / QLoRA
Métodos de ajuste fino eficientes que treinam pequenos adaptadores de baixo posto mantendo os pesos de base congelados. QLoRA combina adaptadores com uma base quantizada para reduzir ainda mais a memória.
- low-rank adapters
- frozen base model
- 4-bit training
Inferência e implantação
Técnicas de memória, agendamento, compressão e runtime usadas para servir modelos.
Quantization
A representação de pesos, ativações ou caches com menor precisão numérica. Reduz memória, largura de banda e computação, com compromissos de precisão e suporte de hardware.
- precision
- INT8
- INT4
KV Cache
Um cache das chaves e valores de atenção de tokens anteriores durante a geração autorregressiva. Evita recalcular todo o prefixo, mas costuma consumir muita memória.
- keys
- values
- prefill
Continuous Batching / PagedAttention
Técnicas de serviço que admitem e concluem pedidos continuamente, gerindo o cache KV em páginas. Melhoram utilização e débito com cargas de comprimento variável.
- request scheduling
- memory paging
- throughput
Speculative Decoding
Um método de inferência em que um modelo de rascunho mais rápido propõe vários tokens e o modelo-alvo os verifica em paralelo. Pode reduzir latência sem alterar a distribuição-alvo.
- draft model
- verification
- latency
Open-model Inference Ecosystem
Motores e runtimes como vLLM e llama.cpp transformam pesos transferíveis em inferência local ou em servidor. As prioridades variam entre débito, portabilidade de hardware, formatos e complexidade operacional.
- vLLM
- llama.cpp
- GGUF
APPLICATION LAYER
Arquitetura de aplicação
Os modelos tornam-se produtos por meio de fluxos, ferramentas, troca de contexto, proteções e avaliação. As secções MCP e Ferramentas cobrem esta camada sem a duplicar aqui.
Casos de modelos abertos
Famílias examinadas por código, pesos, divulgação de treino e licença.
Llama
A família da Meta com pesos transferíveis ampliou inferência local e ajuste fino. Como usa termos próprios do Llama, «pesos abertos» é mais preciso do que presumir código aberto segundo a OSI.
- open weights
- community license
- model family
Qwen
A família Qwen da Alibaba abrange versões densas, com especialistas, multilíngues e multimodais. Muitos checkpoints podem ser transferidos, mas licença e divulgação devem ser verificadas em cada cartão de modelo.
- multilingual
- dense and MoE
- open weights
Mistral / Mixtral
A família da Mistral AI inclui modelos densos Mistral e modelos Mixtral com especialistas. Algumas versões têm licenças permissivas e outras não; a abertura deve ser avaliada por artefacto.
- dense models
- MoE
- open weights
DeepSeek
As versões transferíveis da DeepSeek ampliaram o estudo de MoE, pós-treino de raciocínio e serviço eficiente. Código e pesos podem usar licenças diferentes; a divulgação de dados é uma dimensão separada.
- MoE
- reasoning
- open weights
Gemma
A família da Google com pesos transferíveis liga investigação derivada do Gemini a implantação local, periférica e alojada. A Google chama-os modelos abertos, mas o uso segue termos próprios do Gemma.
- open weights
- lightweight models
- edge deployment
OLMo
A Ai2 publica a família OLMo com os dados de pré-treino, o código de treino, os pontos de controlo intermédios e os registos, além dos pesos. O primeiro OLMo saiu em fevereiro de 2024, o OLMo 2 em novembro do mesmo ano e o Olmo 3 em novembro de 2025, com variantes Base, Instruct e Think de 7B e 32B sob licença Apache 2.0. É o caso em que os quatro elementos a verificar separadamente — código, pesos, divulgação do treino e licença — estão de facto todos publicados, o que faz dele um ponto de referência perante famílias que difundem apenas os pesos.
- fully open
- open training data
- intermediate checkpoints
gpt-oss
Os gpt-oss-120b e 20b da OpenAI são modelos MoE de raciocínio transferíveis para inferência local ou alojada. Pesos e implementações de referência Apache 2.0 ampliam a implantação, mas o conjunto de pré-treino não foi publicado.
- open weights
- reasoning
- MoE
GLM-5
A série GLM-5 da Z.ai é uma grande família de modelos de linguagem MoE para raciocínio, programação e trabalho agêntico de longo prazo. O GLM-5 surgiu em fevereiro de 2026, o 5.1 em abril, o 5.2 em junho com 753 mil milhões de parâmetros e uma janela de contexto de um milhão de tokens, e o 5.3 em agosto sobre a mesma base com alterações de pós-treino; o mais pequeno GLM-5.3-Flash seguiu-se dias depois com 320 mil milhões de parâmetros totais e 18 mil milhões ativos. A escala dos membros maiores torna o alojamento próprio exigente.
- open weights
- MoE
- long context
Kimi K3
A Moonshot AI lançou o Kimi K3 em julho de 2026: um modelo de linguagem MoE multimodal nativo, com pesos abertos, 2,8 biliões de parâmetros totais, 104 mil milhões ativos e contexto de um milhão de tokens. Destina-se a programação prolongada, trabalho de conhecimento e agentes com ferramentas, mas a implantação local é exigente.
- open weights
- MoE
- long context
Este é um mapa técnico selecionado, não uma afirmação de cobertura completa.