Bahasa ThailandCompatible with Milvus 3.0.0+

Tokenizer thai membagi teks bahasa Thailand menjadi token kata tanpa mengandalkan spasi. Gunakan tokenizer ini jika Anda perlu membuat pipa penganalisis khusus untuk teks bahasa Thailand atau teks campuran bahasa Thailand/Inggris.

Konfigurasi

Untuk teks bahasa Thailand, gunakan thai . Analisis bawaan ini mencakup tokenizer ini bersama dengan konversi huruf kecil, normalisasi angka desimal, dan penghapusan kata penghalang bahasa Thailand. Gunakan tokenizer thai secara langsung hanya jika Anda perlu membangun pipa analisis kustom.

Untuk mengonfigurasi penganalisis menggunakan tokenizer ` thai `, atur ` tokenizer ` menjadi ` thai ` di ` analyzer_params`.

analyzer_params = {
    "tokenizer": "thai",
}

Tokenizer thai tidak memiliki parameter yang dapat dikonfigurasi.

Tokenizer ini dapat bekerja dengan satu atau lebih filter. Misalnya, konfigurasi berikut menggunakan tokenizer thai dengan lowercase dan decimaldigit filters:

analyzer_params = {
    "tokenizer": "thai",
    "filter": [
        "lowercase",
        "decimaldigit",
    ],
}

Pipa kustom ini tidak setara dengan penganalisis bawaan thai karena tidak menyertakan kamus kata henti bawaan _thai_. Untuk pipa yang telah ditentukan sebelumnya secara lengkap, gunakan {"type": "thai"}.

Tokenizer menerapkan perilaku berikut:

  • Segmentasi bahasa Thailand: Menyegmentasikan teks bahasa Thailand menjadi token kata tanpa bergantung pada spasi.
  • Penyaringan spasi kosong dan tanda baca: Menyaring segmen yang hanya berisi spasi kosong dan tanda baca. Hal ini berbeda dari icu tokenizer, yang dapat mempertahankan tanda baca dan spasi sebagai token.
  • Teks campuran skrip: Menghasilkan token kata Latin dalam teks campuran bahasa Thailand/Inggris.
  • Hanya tokenizer: Tidak mengubah huruf besar menjadi huruf kecil, menormalkan angka Unicode, atau menghapus kata penghubung. Tambahkan filter atau gunakan thai untuk langkah-langkah tersebut.
  • Semantik posisi: Menggunakan posisi token berbasis karakter yang mencakup spasi kosong dan tanda baca yang dilewati, yang menjaga perilaku pencocokan frasa dan kedekatan tetap konsisten dengan tokenizer non-Latin lainnya.

Setelah mendefinisik analyzer_params, Anda dapat menerapkan penganalisis ke bidang VARCHAR saat mendefinisikan skema koleksi. Untuk detailnya, lihat Contoh penggunaan.

Contoh

Sebelum menerapkan konfigurasi penganalisis ke skema koleksi Anda, verifikasi perilakunya menggunakan metode ` run_analyzer `.

Konfigurasi penganalisis

analyzer_params = {
    "tokenizer": "thai",
}

Verifikasi menggunakan run_analyzer

from pymilvus import MilvusClient

client = MilvusClient(uri="http://localhost:19530")

sample_text = "สวัสดี! ทดสอบ, ระบบ Milvus ๑๒๓"

result = client.run_analyzer(sample_text, analyzer_params)
print(result)

Hasil yang diharapkan

['สวัสดี', 'ทดสอบ', 'ระบบ', 'Milvus', '๑๒๓']

Diterjemahkan olehDeepL

Coba Milvus yang Dikelola secara Gratis

Zilliz Cloud bebas masalah, didukung oleh Milvus dan 10x lebih cepat.

Mulai
Umpan balik

Apakah halaman ini bermanfaat?