Русский
← Назад к технологиям ИИ

Фреймворки и представление

Tokenization

Преобразование исходного текста в дискретные единицы, обрабатываемые моделью. Словарь и сегментация влияют на длину последовательности, многоязычность, стоимость и поведение.

Опорный период
2015 / 2018
Последняя проверка

Ключевые термины

  • token
  • vocabulary
  • BPE
  • SentencePiece

Связи внутри проекта

Первичные источники

  1. Neural Machine Translation of Rare Words with Subword Units
  2. SentencePiece

Это отобранная техническая карта, а не заявление о полном охвате.