TailandésCompatible with Milvus 3.0.0+
El tokenizador « thai » segmenta el texto tailandés en tokens de palabras sin basarse en los espacios. Utiliza este tokenizador cuando necesites crear un flujo de análisis personalizado para texto tailandés o mixto (tailandés e inglés).
Configuración
Para el texto tailandés, utiliza el analizador integrado thai . El analizador integrado incluye este tokenizador, además de la conversión a minúsculas, la normalización de dígitos decimales y la eliminación de palabras vacías en tailandés. Utiliza el tokenizador « thai » directamente solo cuando necesites crear un flujo de análisis personalizado.
Para configurar un analizador utilizando el tokenizador « thai », establezca « tokenizer » en « thai » en « analyzer_params ».
analyzer_params = {
"tokenizer": "thai",
}
El tokenizador thai no tiene parámetros configurables.
El tokenizador puede funcionar con uno o varios filtros. Por ejemplo, la siguiente configuración utiliza el tokenizador thai con el lowercase y decimaldigit :
analyzer_params = {
"tokenizer": "thai",
"filter": [
"lowercase",
"decimaldigit",
],
}
Esta cadena de procesamiento personalizada no es equivalente al analizador integrado « thai », ya que no incluye el diccionario de palabras vacías integrado « _thai_ ». Para obtener la cadena de procesamiento predefinida completa, utilice {"type": "thai"}.
El tokenizador aplica el siguiente comportamiento:
- Segmentación del tailandés: segmenta el texto tailandés en tokens de palabras sin basarse en los espacios en blanco.
- Filtrado de espacios en blanco y signos de puntuación: filtra los segmentos que contienen únicamente espacios en blanco y signos de puntuación. Esto difiere del
icutokenizador, que puede conservar la puntuación y los espacios como tokens. - Texto con escritura mixta: genera tokens de palabras en alfabeto latino en textos mixtos de tailandés e inglés.
- Solo tokenizador: no convierte los tokens a minúsculas, no normaliza los dígitos Unicode ni elimina las palabras vacías. Añade filtros o utiliza el
thaianalizador integrado para esos pasos. - Semántica de posición: utiliza posiciones de tokens basadas en caracteres que incluyen los espacios en blanco y los signos de puntuación omitidos, lo que mantiene el comportamiento de coincidencia de frases y proximidad coherente con otros tokenizadores no latinos.
Tras definir un analizad analyzer_params, puede aplicar el analizador a un campo de tipo « VARCHAR » al definir un esquema de colección. Para obtener más detalles, consulte el ejemplo de uso.
Ejemplos
Antes de aplicar la configuración del analizador a su esquema de colección, compruebe su comportamiento utilizando el método ` run_analyzer `.
Configuración del analizador
analyzer_params = {
"tokenizer": "thai",
}
Verificación mediante run_analyzer
from pymilvus import MilvusClient
client = MilvusClient(uri="http://localhost:19530")
sample_text = "สวัสดี! ทดสอบ, ระบบ Milvus ๑๒๓"
result = client.run_analyzer(sample_text, analyzer_params)
print(result)
Resultado esperado
['สวัสดี', 'ทดสอบ', 'ระบบ', 'Milvus', '๑๒๓']