Português
← Voltar ao início

Arquitetura de modelos

Estruturas que determinam como os modelos representam e transformam informação.

3 entradas

Frameworks e representação

Software e interfaces de dados usados para construir, treinar e executar modelos.

3 entradas

Treino e pós-treino

Métodos de escala, adaptação e preferência que moldam capacidades e comportamento.

4 entradas
2012–present

Distributed Training

Técnicas que repartem dados, parâmetros, ativações ou computação entre dispositivos e nós. Permitem treinar grandes modelos, mas introduzem compromissos de comunicação, sincronização e tolerância a falhas.

  • data parallelism
  • tensor parallelism
  • pipeline parallelism
2017 / 2022 / 2023

SFT / RLHF / DPO

Uma família de métodos de pós-treino para ensinar seguimento de instruções e alinhamento de preferências. SFT aprende com demonstrações; RLHF e DPO usam comparações de preferência por otimizações distintas.

  • supervised fine-tuning
  • preference data
  • reward model
2024 / 2025

Reasoning and test-time compute

Um pós-treino que ensina o modelo a produzir um longo traço de raciocínio antes de responder e a gastar mais cálculo na inferência quando o problema é mais difícil. A aprendizagem por reforço com recompensas verificáveis — em que uma resposta conferível fornece o sinal de treino — foi o que tornou a abordagem reproduzível fora dos laboratórios fechados. A troca merece ser dita com clareza: exatidão obtida pelo comprimento da geração e não por um modelo maior, paga em latência e custo de serviço.

  • reasoning traces
  • verifiable rewards
  • inference budget
2021 / 2023

LoRA / QLoRA

Métodos de ajuste fino eficientes que treinam pequenos adaptadores de baixo posto mantendo os pesos de base congelados. QLoRA combina adaptadores com uma base quantizada para reduzir ainda mais a memória.

  • low-rank adapters
  • frozen base model
  • 4-bit training

Inferência e implantação

Técnicas de memória, agendamento, compressão e runtime usadas para servir modelos.

5 entradas

APPLICATION LAYER

Arquitetura de aplicação

Os modelos tornam-se produtos por meio de fluxos, ferramentas, troca de contexto, proteções e avaliação. As secções MCP e Ferramentas cobrem esta camada sem a duplicar aqui.

Casos de modelos abertos

Famílias examinadas por código, pesos, divulgação de treino e licença.

9 entradas
2023

Llama

A família da Meta com pesos transferíveis ampliou inferência local e ajuste fino. Como usa termos próprios do Llama, «pesos abertos» é mais preciso do que presumir código aberto segundo a OSI.

  • open weights
  • community license
  • model family
2023

Qwen

A família Qwen da Alibaba abrange versões densas, com especialistas, multilíngues e multimodais. Muitos checkpoints podem ser transferidos, mas licença e divulgação devem ser verificadas em cada cartão de modelo.

  • multilingual
  • dense and MoE
  • open weights
2023

Mistral / Mixtral

A família da Mistral AI inclui modelos densos Mistral e modelos Mixtral com especialistas. Algumas versões têm licenças permissivas e outras não; a abertura deve ser avaliada por artefacto.

  • dense models
  • MoE
  • open weights
2023

DeepSeek

As versões transferíveis da DeepSeek ampliaram o estudo de MoE, pós-treino de raciocínio e serviço eficiente. Código e pesos podem usar licenças diferentes; a divulgação de dados é uma dimensão separada.

  • MoE
  • reasoning
  • open weights
2024

Gemma

A família da Google com pesos transferíveis liga investigação derivada do Gemini a implantação local, periférica e alojada. A Google chama-os modelos abertos, mas o uso segue termos próprios do Gemma.

  • open weights
  • lightweight models
  • edge deployment
2024

OLMo

A Ai2 publica a família OLMo com os dados de pré-treino, o código de treino, os pontos de controlo intermédios e os registos, além dos pesos. O primeiro OLMo saiu em fevereiro de 2024, o OLMo 2 em novembro do mesmo ano e o Olmo 3 em novembro de 2025, com variantes Base, Instruct e Think de 7B e 32B sob licença Apache 2.0. É o caso em que os quatro elementos a verificar separadamente — código, pesos, divulgação do treino e licença — estão de facto todos publicados, o que faz dele um ponto de referência perante famílias que difundem apenas os pesos.

  • fully open
  • open training data
  • intermediate checkpoints
2025

gpt-oss

Os gpt-oss-120b e 20b da OpenAI são modelos MoE de raciocínio transferíveis para inferência local ou alojada. Pesos e implementações de referência Apache 2.0 ampliam a implantação, mas o conjunto de pré-treino não foi publicado.

  • open weights
  • reasoning
  • MoE
2026

GLM-5

A série GLM-5 da Z.ai é uma grande família de modelos de linguagem MoE para raciocínio, programação e trabalho agêntico de longo prazo. O GLM-5 surgiu em fevereiro de 2026, o 5.1 em abril, o 5.2 em junho com 753 mil milhões de parâmetros e uma janela de contexto de um milhão de tokens, e o 5.3 em agosto sobre a mesma base com alterações de pós-treino; o mais pequeno GLM-5.3-Flash seguiu-se dias depois com 320 mil milhões de parâmetros totais e 18 mil milhões ativos. A escala dos membros maiores torna o alojamento próprio exigente.

  • open weights
  • MoE
  • long context
2026

Kimi K3

A Moonshot AI lançou o Kimi K3 em julho de 2026: um modelo de linguagem MoE multimodal nativo, com pesos abertos, 2,8 biliões de parâmetros totais, 104 mil milhões ativos e contexto de um milhão de tokens. Destina-se a programação prolongada, trabalho de conhecimento e agentes com ferramentas, mas a implantação local é exigente.

  • open weights
  • MoE
  • long context

Este é um mapa técnico selecionado, não uma afirmação de cobertura completa.