Belajar AI #15: NLP — Tokenisasi, Stopword, dan Word Embedding

Komputer tidak membaca kata. Baginya “kucing” dan “anjing” sama sekali tidak lebih dekat daripada “kucing” dan “pajak” — semua huruf, semua angka. Seluruh NLP (Natural Language Processing) pada dasarnya adalah usaha menjembatani jurang itu: mengubah teks manusia jadi angka yang bisa dihitung, tanpa membuang maknanya. Episode ini catatan saya tentang tiga fondasinya: tokenisasi, stopword, dan word embedding.

Belajar AI #15: NLP — Tokenisasi, Stopword, dan Word Embedding Lanjutkan membaca