Bahasa ThailandCompatible with Milvus 3.0.0+
Penganalisis thai adalah penganalisis bawaan untuk teks bahasa Thailand. Gunakan penganalisis ini jika Anda ingin Milvus memisahkan teks bahasa Thailand menjadi kata-kata, menormalkan angka dalam bahasa Thailand, mengubah teks campuran huruf Latin menjadi huruf kecil, dan menghapus kata-kata pengisi dalam bahasa Thailand.
Konfigurasi
Penganalisis bawaan adalah templat penganalisis yang disediakan oleh Milvus. Untuk menggunakan penganalisis bawaan, atur ` type ` ke nama penganalisis yang telah ditentukan sebelumnya di analyzer_params.
Untuk menggunakan penganalisis bahasa Thailand bawaan, atur ` type ` ke ` thai`:
analyzer_params = {
"type": "thai",
}
Penganalisis thai menerima parameter opsional berikut:
Parameter |
Tipe |
Default |
Deskripsi |
|---|---|---|---|
|
|
|
Daftar kata-kata yang diabaikan (stop words) tambahan yang akan dihilangkan dari proses tokenisasi. Secara default, penganalisis |
Untuk menambahkan kata henti kustom, sertakan stop_words:
analyzer_params = {
"type": "thai",
"stop_words": ["มิลวัส"],
}
Milvus menerapkan kata-kata stop kustom selain kamus _thai_ bawaan.
Penganalisis bawaan " thai " setara dengan konfigurasi penganalisis kustom berikut:
analyzer_params = {
"tokenizer": "thai",
"filter": [
"lowercase",
"decimaldigit",
{
"type": "stop",
"stop_words": ["_thai_"],
},
],
}
Analizer ini menerapkan langkah-langkah pemrosesan berikut:
- Tokenisasi: Menggunakan
thaitokenizer untuk memotong teks bahasa Thailand menjadi token kata tanpa bergantung pada spasi. Tokenizer ini menyaring spasi dan segmen yang hanya berisi tanda baca. - Normalisasi huruf besar/kecil: Menggunakan filter
lowercase, yang memengaruhi huruf Latin dalam teks campuran bahasa Thailand/Inggris. - Normalisasi angka: Menggunakan filter `
decimaldigit` untuk mengonversi angka dalam bahasa Thailand dan angka desimal Unicode lainnya menjadi angka ASCII. - Penghapusan kata stop: Menggunakan filter `
stop` dengan kamus bawaan `_thai_`. - Tanpa stemming: Penganalisis bawaan "
thai" tidak menerapkan filter "stemmer".
Setelah mendefinisikan analyzer_params, Anda dapat menerapkan penganalisis tersebut ke bidang VARCHAR saat mendefinisikan skema koleksi. Untuk detailnya, lihat Contoh penggunaan.
Contoh
Sebelum menerapkan konfigurasi penganalisis ke skema koleksi Anda, verifikasi perilakunya menggunakan metode ` run_analyzer `.
Konfigurasi penganalisis
analyzer_params = {
"type": "thai",
}
Verifikasi menggunakan run_analyzer
from pymilvus import MilvusClient
client = MilvusClient(uri="http://localhost:19530")
sample_text = "ฉันรักการค้นหาข้อความใน Milvus ๑๒๓"
result = client.run_analyzer(sample_text, analyzer_params)
print(result)
Hasil yang diharapkan
['ฉัน', 'รัก', 'ค้นหา', 'ข้อความ', 'milvus', '123']