اللغة التايلانديةCompatible with Milvus 3.0.0+

يقوم أداة تحليل النص التايلاندية ( thai ) بتقسيم النص التايلاندي إلى رموز كلمات دون الاعتماد على المسافات. استخدم أداة التحليل هذه عندما تحتاج إلى إنشاء مسار تحليل مخصص للنص التايلاندي أو النص المختلط بين التايلاندية والإنجليزية.

التكوين

بالنسبة للنصوص التايلاندية، استخدم المحلل المدمج thai في معظم الحالات. يتضمن المحلل المدمج أداة التقطيع هذه إلى جانب تحويل الأحرف إلى صغرى، وتوحيد الأرقام العشرية، وإزالة الكلمات الممنوعة في اللغة التايلاندية. استخدم أداة التقطيع thai مباشرةً فقط عندما تحتاج إلى إنشاء مسار تحليل مخصص.

لتكوين محلل باستخدام أداة تجزئة الكلمات thai ، قم بتعيين tokenizer إلى thai في analyzer_params.

analyzer_params = {
    "tokenizer": "thai",
}

لا يحتوي أداة التقطيع thai على معلمات قابلة للتكوين.

يمكن لمُجزئ الكلمات العمل مع مرشح واحد أو أكثر. على سبيل المثال، يستخدم التكوين التالي مُجزئ الكلمات thai مع lowercase و decimaldigit :

analyzer_params = {
    "tokenizer": "thai",
    "filter": [
        "lowercase",
        "decimaldigit",
    ],
}

لا يعادل مسار المعالجة المخصص هذا محلل thai المدمج لأنه لا يتضمن قاموس الكلمات الممنوعة _thai_ المدمج. للحصول على مسار المعالجة الكامل المُعرَّف مسبقًا، استخدم {"type": "thai"}.

يطبق أداة تحليل الكلمات السلوك التالي:

  • تجزئة اللغة التايلاندية: يقسم النص التايلاندي إلى رموز كلمات دون الاعتماد على المسافات البيضاء.
  • تصفية المسافات البيضاء وعلامات الترقيم: تصفية المقاطع التي تحتوي على مسافات بيضاء وعلامات ترقيم فقط. وهذا يختلف عن icu أداة التقطيع، التي يمكنها الاحتفاظ بعلامات الترقيم والمسافات كرموز.
  • النص ذو النصوص المختلطة: يُنتج رموزًا لكلمات لاتينية في النص المختلط بين التايلاندية والإنجليزية.
  • أداة التقطيع فقط: لا تقوم بتحويل الرموز إلى أحرف صغيرة، ولا تعمل على توحيد الأرقام في يونيكود، ولا تزيل الكلمات الممنوعة. أضف عوامل تصفية أو استخدم thai لتلك الخطوات.
  • دلالات الموضع: يستخدم مواضع الرموز القائمة على الأحرف والتي تشمل المسافات البيضاء وعلامات الترقيم التي تم تخطيها، مما يحافظ على اتساق سلوك مطابقة العبارات والقرب مع أدوات تحليل الرموز الأخرى غير اللاتينية.

بعد تعريف « analyzer_params » ، يمكنك تطبيق المحلل على حقل « VARCHAR » عند تعريف مخطط المجموعة. لمزيد من التفاصيل، راجع «مثال على الاستخدام».

أمثلة

قبل تطبيق تكوين المحلل على مخطط المجموعة الخاص بك، تحقق من سلوكه باستخدام طريقة run_analyzer.

تكوين المحلل

analyzer_params = {
    "tokenizer": "thai",
}

التحقق باستخدام run_analyzer

from pymilvus import MilvusClient

client = MilvusClient(uri="http://localhost:19530")

sample_text = "สวัสดี! ทดสอบ, ระบบ Milvus ๑๒๓"

result = client.run_analyzer(sample_text, analyzer_params)
print(result)

الناتج المتوقع

['สวัสดี', 'ทดสอบ', 'ระบบ', 'Milvus', '๑๒๓']

ترجمة بواسطةDeepL

جرب Managed Milvus مجاناً

Zilliz Cloud خالي من المتاعب، ويعمل بواسطة Milvus ويعمل بسرعة 10 أضعاف.

ابدأ
التعليقات

هل كانت هذه الصفحة مفيدة؟