ThaïCompatible with Milvus 3.0.0+

Le tokeniseur « thai » segmente le texte thaï en tokens de mots sans s'appuyer sur les espaces. Utilisez ce tokeniseur lorsque vous devez créer un pipeline d'analyse personnalisé pour du texte en thaï ou mixte (thaï/anglais).

Configuration

Pour le texte en thaï, utilisez dans la plupart des cas l’analyseur intégré thai dans la plupart des cas. L'analyseur intégré inclut ce tokeniseur ainsi que la conversion en minuscules, la normalisation des chiffres décimaux et la suppression des mots vides en thaï. N'utilisez directement le tokeniseur « thai » que lorsque vous devez créer un pipeline d'analyse personnalisé.

Pour configurer un analyseur à l’aide du tokenizer « thai », définissez ` tokenizer ` sur ` thai ` dans ` analyzer_params`.

analyzer_params = {
    "tokenizer": "thai",
}

Le tokenizer thai ne dispose d’aucun paramètre configurable.

Le tokenizer peut fonctionner avec un ou plusieurs filtres. Par exemple, la configuration suivante utilise le tokenizer thai avec le lowercase et decimaldigit :

analyzer_params = {
    "tokenizer": "thai",
    "filter": [
        "lowercase",
        "decimaldigit",
    ],
}

Ce pipeline personnalisé n’est pas équivalent à l’analyseur intégré « thai », car il n’inclut pas le dictionnaire de mots vides intégré « _thai_ ». Pour le pipeline prédéfini complet, utilisez {"type": "thai"}.

Le tokeniseur applique le comportement suivant :

  • Segmentation du thaï: segmente le texte thaï en tokens de mots sans s’appuyer sur les espaces.
  • Filtrage des espaces et de la ponctuation: filtre les segments composés uniquement d’espaces et de signes de ponctuation. Cela diffère du icu tokenizer, qui peut conserver la ponctuation et les espaces en tant que tokens.
  • Texte à scripts mixtes: génère des tokens de mots en alphabet latin dans un texte mixte thaï/anglais.
  • Tokeniseur uniquement: ne met pas les tokens en minuscules, ne normalise pas les chiffres Unicode et ne supprime pas les mots vides. Ajoutez des filtres ou utilisez l’ thai pour ces étapes.
  • Sémantique de position: utilise les positions des tokens basées sur les caractères, y compris les espaces et la ponctuation ignorés, ce qui garantit une cohérence du comportement de correspondance de phrases et de proximité avec d’autres tokeniseurs non latins.

Après avoir défini l’ analyzer_params, vous pouvez appliquer l’analyseur à un champ de type « VARCHAR » lors de la définition d’un schéma de collection. Pour plus de détails, reportez-vous à la section « Exemple d’utilisation ».

Exemples

Avant d’appliquer la configuration de l’analyseur à votre schéma de collection, vérifiez son comportement à l’aide de la méthode ` run_analyzer `.

Configuration de l’analyseur

analyzer_params = {
    "tokenizer": "thai",
}

Vérification à l’aide de run_analyzer

from pymilvus import MilvusClient

client = MilvusClient(uri="http://localhost:19530")

sample_text = "สวัสดี! ทดสอบ, ระบบ Milvus ๑๒๓"

result = client.run_analyzer(sample_text, analyzer_params)
print(result)

Résultat attendu

['สวัสดี', 'ทดสอบ', 'ระบบ', 'Milvus', '๑๒๓']

Traduit parDeepL

Essayez Milvus géré gratuitement

Zilliz Cloud est sans souci, propulsé par Milvus et 10 fois plus rapide.

Commencer
Feedback

Cette page a-t - elle été utile ?