Italiano
← Torna alle tecnologie dell’IA

Framework e rappresentazione

Tokenization

La mappatura del testo grezzo nelle unità discrete elaborate dal modello. Vocabolario e segmentazione influenzano lunghezza della sequenza, copertura multilingue, costo e comportamento.

Periodo di riferimento
2015 / 2018
Ultima verifica

Termini chiave

  • token
  • vocabulary
  • BPE
  • SentencePiece

Collegamenti nel progetto

Fonti primarie

  1. Neural Machine Translation of Rare Words with Subword Units
  2. SentencePiece

Questa è una mappa tecnica curata, non una pretesa di copertura completa.