Bahasa ThailandCompatible with Milvus 3.0.0+

Penganalisis thai adalah penganalisis bawaan untuk teks bahasa Thailand. Gunakan penganalisis ini jika Anda ingin Milvus memisahkan teks bahasa Thailand menjadi kata-kata, menormalkan angka dalam bahasa Thailand, mengubah teks campuran huruf Latin menjadi huruf kecil, dan menghapus kata-kata pengisi dalam bahasa Thailand.

Konfigurasi

Penganalisis bawaan adalah templat penganalisis yang disediakan oleh Milvus. Untuk menggunakan penganalisis bawaan, atur ` type ` ke nama penganalisis yang telah ditentukan sebelumnya di analyzer_params.

Untuk menggunakan penganalisis bahasa Thailand bawaan, atur ` type ` ke ` thai`:

analyzer_params = {
    "type": "thai",
}

Penganalisis thai menerima parameter opsional berikut:

Parameter

Tipe

Default

Deskripsi

stop_words

list[str]

_thai_

Daftar kata-kata yang diabaikan (stop words) tambahan yang akan dihilangkan dari proses tokenisasi. Secara default, penganalisis thai menggunakan kamus bawaan _thai_. Untuk memeriksa kamus default, lihat daftar kata-kata yang diabaikan (stop words) Milvus Thai. Daftar ini bersumber dari berkas kata-kata yang diabaikan (stop words) Apache Lucene Thai.

Untuk menambahkan kata henti kustom, sertakan stop_words:

analyzer_params = {
    "type": "thai",
    "stop_words": ["มิลวัส"],
}

Milvus menerapkan kata-kata stop kustom selain kamus _thai_ bawaan.

Penganalisis bawaan " thai " setara dengan konfigurasi penganalisis kustom berikut:

analyzer_params = {
    "tokenizer": "thai",
    "filter": [
        "lowercase",
        "decimaldigit",
        {
            "type": "stop",
            "stop_words": ["_thai_"],
        },
    ],
}

Analizer ini menerapkan langkah-langkah pemrosesan berikut:

  • Tokenisasi: Menggunakan thai tokenizer untuk memotong teks bahasa Thailand menjadi token kata tanpa bergantung pada spasi. Tokenizer ini menyaring spasi dan segmen yang hanya berisi tanda baca.
  • Normalisasi huruf besar/kecil: Menggunakan filter lowercase, yang memengaruhi huruf Latin dalam teks campuran bahasa Thailand/Inggris.
  • Normalisasi angka: Menggunakan filter ` decimaldigit ` untuk mengonversi angka dalam bahasa Thailand dan angka desimal Unicode lainnya menjadi angka ASCII.
  • Penghapusan kata stop: Menggunakan filter ` stop ` dengan kamus bawaan ` _thai_ `.
  • Tanpa stemming: Penganalisis bawaan " thai " tidak menerapkan filter " stemmer ".

Setelah mendefinisikan analyzer_params, Anda dapat menerapkan penganalisis tersebut ke bidang VARCHAR saat mendefinisikan skema koleksi. Untuk detailnya, lihat Contoh penggunaan.

Contoh

Sebelum menerapkan konfigurasi penganalisis ke skema koleksi Anda, verifikasi perilakunya menggunakan metode ` run_analyzer `.

Konfigurasi penganalisis

analyzer_params = {
    "type": "thai",
}

Verifikasi menggunakan run_analyzer

from pymilvus import MilvusClient

client = MilvusClient(uri="http://localhost:19530")

sample_text = "ฉันรักการค้นหาข้อความใน Milvus ๑๒๓"

result = client.run_analyzer(sample_text, analyzer_params)
print(result)

Hasil yang diharapkan

['ฉัน', 'รัก', 'ค้นหา', 'ข้อความ', 'milvus', '123']

Diterjemahkan olehDeepL

Coba Milvus yang Dikelola secara Gratis

Zilliz Cloud bebas masalah, didukung oleh Milvus dan 10x lebih cepat.

Mulai
Umpan balik

Apakah halaman ini bermanfaat?