اللغة التايلانديةCompatible with Milvus 3.0.0+
محلل " thai " هو محلل مدمج للنصوص التايلاندية. استخدم هذا المحلل عندما تحتاج إلى أن يقوم Milvus بتقسيم النص التايلاندي إلى كلمات، وتوحيد الأرقام التايلاندية، وتحويل النص اللاتيني المختلط إلى أحرف صغيرة، وإزالة الكلمات الممنوعة التايلاندية.
التكوين
المحللات المدمجة هي قوالب محللات مقدمة من Milvus. لاستخدام محلل مدمج، قم بتعيين type إلى اسم محلل محدد مسبقًا في analyzer_params.
لاستخدام المحلل التايلاندي المدمج، قم بتعيين type إلى thai:
analyzer_params = {
"type": "thai",
}
يقبل محلل thai المعلمة الاختيارية التالية:
المعلمة |
النوع |
القيمة الافتراضية |
الوصف |
|---|---|---|---|
|
|
|
قائمة بالكلمات الممنوعة الإضافية التي يجب إزالتها من عملية التقطيع إلى رموز. بشكل افتراضي، يستخدم محلل " |
لإضافة كلمات توقف مخصصة، قم بتضمين stop_words:
analyzer_params = {
"type": "thai",
"stop_words": ["มิลวัส"],
}
يطبق Milvus الكلمات الممنوعة المخصصة بالإضافة إلى قاموس _thai_ المدمج.
المحلل المدمج « thai » يعادل تكوين المحلل المخصص التالي:
analyzer_params = {
"tokenizer": "thai",
"filter": [
"lowercase",
"decimaldigit",
{
"type": "stop",
"stop_words": ["_thai_"],
},
],
}
يطبق هذا المحلل خطوات المعالجة التالية:
- التقطيع إلى رموز: يستخدم
thaiأداة التقطيع لتقسيم النص التايلاندي إلى رموز كلمات دون الاعتماد على المسافات البيضاء. تقوم أداة التقطيع بتصفية المسافات البيضاء والمقاطع التي تحتوي على علامات الترقيم فقط. - توحيد حالة الأحرف: يستخدم مرشح
lowercase، الذي يؤثر على الأحرف اللاتينية في النص المختلط بين التايلاندية والإنجليزية. - توحيد الأرقام: يستخدم مرشح "
decimaldigit" لتحويل الأرقام التايلاندية والأرقام العشرية الأخرى في Unicode إلى أرقام ASCII. - إزالة الكلمات الممنوعة: يستخدم مرشح «
stop» مع القاموس المدمج «_thai_». - عدم استخدام أسلوب "الاستخلاص" (stemming): لا يطبق محلل "
thai" المدمج مرشح "stemmer".
بعد تعريف analyzer_params ، يمكنك تطبيق المحلل على حقل VARCHAR عند تعريف مخطط المجموعة. للحصول على التفاصيل، راجع مثال الاستخدام.
أمثلة
قبل تطبيق تكوين المحلل على مخطط المجموعة الخاص بك، تحقق من سلوكه باستخدام طريقة run_analyzer.
تكوين المحلل
analyzer_params = {
"type": "thai",
}
التحقق باستخدام run_analyzer
from pymilvus import MilvusClient
client = MilvusClient(uri="http://localhost:19530")
sample_text = "ฉันรักการค้นหาข้อความใน Milvus ๑๒๓"
result = client.run_analyzer(sample_text, analyzer_params)
print(result)
الناتج المتوقع
['ฉัน', 'รัก', 'ค้นหา', 'ข้อความ', 'milvus', '123']