TailandésCompatible with Milvus 3.0.0+

El tokenizador « thai » segmenta el texto tailandés en tokens de palabras sin basarse en los espacios. Utiliza este tokenizador cuando necesites crear un flujo de análisis personalizado para texto tailandés o mixto (tailandés e inglés).

Configuración

Para el texto tailandés, utiliza el analizador integrado thai . El analizador integrado incluye este tokenizador, además de la conversión a minúsculas, la normalización de dígitos decimales y la eliminación de palabras vacías en tailandés. Utiliza el tokenizador « thai » directamente solo cuando necesites crear un flujo de análisis personalizado.

Para configurar un analizador utilizando el tokenizador « thai », establezca « tokenizer » en « thai » en « analyzer_params ».

analyzer_params = {
    "tokenizer": "thai",
}

El tokenizador thai no tiene parámetros configurables.

El tokenizador puede funcionar con uno o varios filtros. Por ejemplo, la siguiente configuración utiliza el tokenizador thai con el lowercase y decimaldigit :

analyzer_params = {
    "tokenizer": "thai",
    "filter": [
        "lowercase",
        "decimaldigit",
    ],
}

Esta cadena de procesamiento personalizada no es equivalente al analizador integrado « thai », ya que no incluye el diccionario de palabras vacías integrado « _thai_ ». Para obtener la cadena de procesamiento predefinida completa, utilice {"type": "thai"}.

El tokenizador aplica el siguiente comportamiento:

  • Segmentación del tailandés: segmenta el texto tailandés en tokens de palabras sin basarse en los espacios en blanco.
  • Filtrado de espacios en blanco y signos de puntuación: filtra los segmentos que contienen únicamente espacios en blanco y signos de puntuación. Esto difiere del icu tokenizador, que puede conservar la puntuación y los espacios como tokens.
  • Texto con escritura mixta: genera tokens de palabras en alfabeto latino en textos mixtos de tailandés e inglés.
  • Solo tokenizador: no convierte los tokens a minúsculas, no normaliza los dígitos Unicode ni elimina las palabras vacías. Añade filtros o utiliza el thai analizador integrado para esos pasos.
  • Semántica de posición: utiliza posiciones de tokens basadas en caracteres que incluyen los espacios en blanco y los signos de puntuación omitidos, lo que mantiene el comportamiento de coincidencia de frases y proximidad coherente con otros tokenizadores no latinos.

Tras definir un analizad analyzer_params, puede aplicar el analizador a un campo de tipo « VARCHAR » al definir un esquema de colección. Para obtener más detalles, consulte el ejemplo de uso.

Ejemplos

Antes de aplicar la configuración del analizador a su esquema de colección, compruebe su comportamiento utilizando el método ` run_analyzer `.

Configuración del analizador

analyzer_params = {
    "tokenizer": "thai",
}

Verificación mediante run_analyzer

from pymilvus import MilvusClient

client = MilvusClient(uri="http://localhost:19530")

sample_text = "สวัสดี! ทดสอบ, ระบบ Milvus ๑๒๓"

result = client.run_analyzer(sample_text, analyzer_params)
print(result)

Resultado esperado

['สวัสดี', 'ทดสอบ', 'ระบบ', 'Milvus', '๑๒๓']

Traducido porDeepL

Prueba Milvus gestionado gratis

Zilliz Cloud no da problemas, funciona con Milvus y es 10 veces más rápido.

Empezar
Feedback

¿Fue útil esta página?