TailandésCompatible with Milvus 3.0.0+

El analizador « thai » es un analizador integrado para texto tailandés. Utiliza este analizador cuando necesites que Milvus segmente el texto tailandés en palabras, normalice los dígitos tailandeses, convierta a minúsculas el texto mixto en alfabeto latino y elimine las palabras vacías tailandesas.

Configuración

Los analizadores integrados son plantillas de analizadores proporcionadas por Milvus. Para utilizar un analizador integrado, configura type con un nombre de analizador predefinido en analyzer_params.

Para utilizar el analizador tailandés integrado, establezca type en thai:

analyzer_params = {
    "type": "thai",
}

El analizador thai admite el siguiente parámetro opcional:

Parámetro

Tipo

Valor por defecto

Descripción

stop_words

list[str]

_thai_

Una lista de palabras vacías adicionales que se deben eliminar de la tokenización. Por defecto, el analizador « thai » utiliza el diccionario integrado « _thai_ ». Para consultar el diccionario por defecto, véase la lista de palabras vacías tailandesas de Milvus. La lista procede del archivo de palabras vacías tailandesas de Apache Lucene.

Para añadir palabras vacías personalizadas, incluye stop_words:

analyzer_params = {
    "type": "thai",
    "stop_words": ["มิลวัส"],
}

Milvus aplica palabras vacías personalizadas además del diccionario integrado « _thai_ ».

El analizador integrado « thai » es equivalente a la siguiente configuración de analizador personalizado:

analyzer_params = {
    "tokenizer": "thai",
    "filter": [
        "lowercase",
        "decimaldigit",
        {
            "type": "stop",
            "stop_words": ["_thai_"],
        },
    ],
}

Este analizador aplica los siguientes pasos de procesamiento:

  • Tokenización: utiliza el thai tokenizador para segmentar el texto tailandés en tokens de palabras sin basarse en los espacios en blanco. El tokenizador filtra los espacios en blanco y los segmentos que solo contienen signos de puntuación.
  • Normalización de mayúsculas y minúsculas: utiliza el filtro « lowercase », que afecta a las letras latinas en textos mixtos de tailandés e inglés.
  • Normalización de dígitos: utiliza el filtro « decimaldigit » para convertir los dígitos tailandeses y otros dígitos decimales Unicode a dígitos ASCII.
  • Eliminación de palabras vacías: utiliza el filtro « stop » con el diccionario integrado « _thai_ ».
  • Sin derivación: el analizador integrado « thai » no aplica el filtro « stemmer ».

Una vez definido « analyzer_params », puede aplicar el analizador a un campo « VARCHAR » al definir un esquema de colección. Para obtener más detalles, consulte «Ejemplo de uso».

Ejemplos

Antes de aplicar la configuración del analizador a su esquema de colección, compruebe su comportamiento utilizando el método « run_analyzer ».

Configuración del analizador

analyzer_params = {
    "type": "thai",
}

Verificación mediante run_analyzer

from pymilvus import MilvusClient

client = MilvusClient(uri="http://localhost:19530")

sample_text = "ฉันรักการค้นหาข้อความใน Milvus ๑๒๓"

result = client.run_analyzer(sample_text, analyzer_params)
print(result)

Resultado esperado

['ฉัน', 'รัก', 'ค้นหา', 'ข้อความ', 'milvus', '123']

Traducido porDeepL

Prueba Milvus gestionado gratis

Zilliz Cloud no da problemas, funciona con Milvus y es 10 veces más rápido.

Empezar
Feedback

¿Fue útil esta página?