Bahasa ArabCompatible with Milvus 3.0.0+

Penganalisis arabic adalah penganalisis bawaan untuk teks bahasa Arab. Gunakan penganalisis ini jika Anda ingin Milvus menormalisasi varian huruf Arab, menghapus tanda diakritik dan Tatweel, mengonversi angka Arab-India, menerapkan stemming bahasa Arab, serta menghapus kata-kata pengisi dalam bahasa Arab.

Konfigurasi

Penganalisis bawaan adalah templat penganalisis yang disediakan oleh Milvus. Untuk menggunakan penganalisis bawaan, atur ` type ` ke nama penganalisis yang telah ditentukan sebelumnya di analyzer_params.

Untuk menggunakan penganalisis bahasa Arab bawaan, atur ` type ` ke ` arabic`:

analyzer_params = {
    "type": "arabic",
}

Penganalisis arabic menerima parameter opsional berikut:

Parameter

Tipe

Default

Deskripsi

stop_words

list[str]

_arabic_

Daftar kata-kata yang diabaikan (stop words) tambahan yang akan dihilangkan dari proses tokenisasi. Secara default, penganalisis arabic menggunakan kamus bawaan _arabic_. Untuk memeriksa kamus default, lihat daftar kata-kata yang diabaikan (stop words) bahasa Arab Milvus. Daftar ini bersumber dari berkas kata-kata yang diabaikan (stop words) bahasa Arab Apache Lucene.

Untuk menambahkan kata henti kustom, sertakan stop_words:

analyzer_params = {
    "type": "arabic",
    "stop_words": ["ميلفوس"],
}

Milvus menerapkan kata-kata stop kustom selain kamus bawaan _arabic_.

Penganalisis bawaan ` arabic ` setara dengan konfigurasi penganalisis khusus berikut:

analyzer_params = {
    "tokenizer": "standard",
    "filter": [
        "lowercase",
        "decimaldigit",
        "arabic_normalization",
        {
            "type": "stemmer",
            "language": "arabic",
        },
        {
            "type": "stop",
            "stop_words": "_arabic_",
        },
    ],
}

Analizer ini menerapkan langkah-langkah pemrosesan berikut:

  • Tokenisasi: Menggunakan tokenizer standard untuk memecah teks menjadi token.
  • Normalisasi angka: Menggunakan filter decimaldigit untuk mengubah angka desimal Arab-India dan angka desimal Unicode lainnya menjadi angka ASCII.
  • Normalisasi Arab: Menggunakan filter arabic_normalization untuk menormalisasi varian Alef, Teh Marbuta, dan Alef Maksura, serta menghapus Harakat dan Tatweel.
  • Stemming: Menggunakan filter stemmer dengan opsi " language " disetel ke " arabic".
  • Penghapusan kata stop: Menggunakan filter ` stop ` dengan kamus bawaan ` _arabic_ `.

Setelah mendefinisikan analyzer_params, Anda dapat menerapkan penganalisis ke bidang VARCHAR saat mendefinisikan skema koleksi. Untuk detailnya, lihat Contoh penggunaan.

Contoh

Sebelum menerapkan konfigurasi penganalisis ke skema koleksi Anda, verifikasi perilakunya menggunakan metode ` run_analyzer `.

Konfigurasi penganalisis

analyzer_params = {
    "type": "arabic",
}

Verifikasi menggunakan run_analyzer

from pymilvus import MilvusClient

client = MilvusClient(uri="http://localhost:19530")

sample_text = "كِتَابٌ عـــربي ١٢٣"

result = client.run_analyzer(sample_text, analyzer_params)
print(result)

Hasil yang diharapkan

['كتاب', 'عرب', '123']

Diterjemahkan olehDeepL

Coba Milvus yang Dikelola secara Gratis

Zilliz Cloud bebas masalah, didukung oleh Milvus dan 10x lebih cepat.

Mulai
Umpan balik

Apakah halaman ini bermanfaat?