ไทย
← กลับไปยังเทคโนโลยี AI

เฟรมเวิร์กและการแทนข้อมูล

Tokenization

การแปลงข้อความดิบเป็นหน่วยไม่ต่อเนื่องที่โมเดลประมวลผล การสร้างคำศัพท์และการแบ่งข้อความมีผลต่อความยาวลำดับ การรองรับหลายภาษา ต้นทุน และพฤติกรรมของโมเดล

ช่วงเวลาอ้างอิง
2015 / 2018
ตรวจล่าสุด

คำสำคัญ

  • token
  • vocabulary
  • BPE
  • SentencePiece

ความเชื่อมโยงในโครงการ

แหล่งข้อมูลปฐมภูมิ

  1. Neural Machine Translation of Rare Words with Subword Units
  2. SentencePiece

นี่คือแผนที่เทคนิคที่คัดสรร ไม่ใช่การอ้างว่าครอบคลุมทั้งหมด