Bahasa ArabCompatible with Milvus 3.0.0+
Penganalisis arabic adalah penganalisis bawaan untuk teks bahasa Arab. Gunakan penganalisis ini jika Anda ingin Milvus menormalisasi varian huruf Arab, menghapus tanda diakritik dan Tatweel, mengonversi angka Arab-India, menerapkan stemming bahasa Arab, serta menghapus kata-kata pengisi dalam bahasa Arab.
Konfigurasi
Penganalisis bawaan adalah templat penganalisis yang disediakan oleh Milvus. Untuk menggunakan penganalisis bawaan, atur ` type ` ke nama penganalisis yang telah ditentukan sebelumnya di analyzer_params.
Untuk menggunakan penganalisis bahasa Arab bawaan, atur ` type ` ke ` arabic`:
analyzer_params = {
"type": "arabic",
}
Penganalisis arabic menerima parameter opsional berikut:
Parameter |
Tipe |
Default |
Deskripsi |
|---|---|---|---|
|
|
|
Daftar kata-kata yang diabaikan (stop words) tambahan yang akan dihilangkan dari proses tokenisasi. Secara default, penganalisis |
Untuk menambahkan kata henti kustom, sertakan stop_words:
analyzer_params = {
"type": "arabic",
"stop_words": ["ميلفوس"],
}
Milvus menerapkan kata-kata stop kustom selain kamus bawaan _arabic_.
Penganalisis bawaan ` arabic ` setara dengan konfigurasi penganalisis khusus berikut:
analyzer_params = {
"tokenizer": "standard",
"filter": [
"lowercase",
"decimaldigit",
"arabic_normalization",
{
"type": "stemmer",
"language": "arabic",
},
{
"type": "stop",
"stop_words": "_arabic_",
},
],
}
Analizer ini menerapkan langkah-langkah pemrosesan berikut:
- Tokenisasi: Menggunakan tokenizer
standarduntuk memecah teks menjadi token. - Normalisasi angka: Menggunakan filter
decimaldigituntuk mengubah angka desimal Arab-India dan angka desimal Unicode lainnya menjadi angka ASCII. - Normalisasi Arab: Menggunakan filter
arabic_normalizationuntuk menormalisasi varian Alef, Teh Marbuta, dan Alef Maksura, serta menghapus Harakat dan Tatweel. - Stemming: Menggunakan filter
stemmerdengan opsi "language" disetel ke "arabic". - Penghapusan kata stop: Menggunakan filter `
stop` dengan kamus bawaan `_arabic_`.
Setelah mendefinisikan analyzer_params, Anda dapat menerapkan penganalisis ke bidang VARCHAR saat mendefinisikan skema koleksi. Untuk detailnya, lihat Contoh penggunaan.
Contoh
Sebelum menerapkan konfigurasi penganalisis ke skema koleksi Anda, verifikasi perilakunya menggunakan metode ` run_analyzer `.
Konfigurasi penganalisis
analyzer_params = {
"type": "arabic",
}
Verifikasi menggunakan run_analyzer
from pymilvus import MilvusClient
client = MilvusClient(uri="http://localhost:19530")
sample_text = "كِتَابٌ عـــربي ١٢٣"
result = client.run_analyzer(sample_text, analyzer_params)
print(result)
Hasil yang diharapkan
['كتاب', 'عرب', '123']