TailandêsCompatible with Milvus 3.0.0+

O tokenizador « thai » segmenta o texto em tailandês em tokens de palavras sem depender de espaços. Utilize este tokenizador quando precisar de criar um pipeline de análise personalizado para texto em tailandês ou misto (tailandês/inglês).

Configuração

Para texto em tailandês, utilize o thai na maioria dos casos. O analisador integrado inclui este tokenizador, juntamente com a conversão para minúsculas, a normalização de algarismos decimais e a remoção de palavras-vazio em tailandês. Utilize o tokenizador « thai » diretamente apenas quando precisar de criar um pipeline de análise personalizado.

Para configurar um analisador utilizando o tokenizador « thai », defina « tokenizer » como « thai » em « analyzer_params ».

analyzer_params = {
    "tokenizer": "thai",
}

O tokenizador thai não possui parâmetros configuráveis.

O tokenizador pode funcionar com um ou mais filtros. Por exemplo, a configuração seguinte utiliza o tokenizador thai com o lowercase e decimaldigit :

analyzer_params = {
    "tokenizer": "thai",
    "filter": [
        "lowercase",
        "decimaldigit",
    ],
}

Este pipeline personalizado não é equivalente ao analisador « thai » integrado, uma vez que não inclui o dicionário de palavras de stop « _thai_ » integrado. Para o pipeline predefinido completo, utilize {"type": "thai"}.

O tokenizador aplica o seguinte comportamento:

  • Segmentação em tailandês: Segmenta o texto em tailandês em tokens de palavras sem depender de espaços em branco.
  • Filtragem de espaços em branco e pontuação: Filtra segmentos compostos apenas por espaços em branco e pontuação. Isto difere do icu tokenizador, que pode preservar a pontuação e os espaços como tokens.
  • Texto com alfabetos mistos: Gera tokens de palavras em alfabeto latino em texto misto de tailandês e inglês.
  • Apenas tokenizador: Não converte os tokens para minúsculas, não normaliza dígitos Unicode nem remove palavras de preenchimento. Adicione filtros ou utilize o thai para essas etapas.
  • Semântica de posição: Utiliza posições de tokens baseadas em caracteres que incluem espaços em branco e pontuação ignorados, o que mantém o comportamento de correspondência de frases e proximidade consistente com outros tokenizadores não latinos.

Após definir um « analyzer_params », pode aplicar o analisador a um campo « VARCHAR » ao definir um esquema de coleção. Para mais detalhes, consulte o «Exemplo de utilização».

Exemplos

Antes de aplicar a configuração do analisador ao esquema da sua coleção, verifique o seu comportamento utilizando o método ` run_analyzer `.

Configuração do analisador

analyzer_params = {
    "tokenizer": "thai",
}

Verificação utilizando run_analyzer

from pymilvus import MilvusClient

client = MilvusClient(uri="http://localhost:19530")

sample_text = "สวัสดี! ทดสอบ, ระบบ Milvus ๑๒๓"

result = client.run_analyzer(sample_text, analyzer_params)
print(result)

Resultado esperado

['สวัสดี', 'ทดสอบ', 'ระบบ', 'Milvus', '๑๒๓']

Traduzido porDeepL

Experimente o Milvus gerenciado gratuitamente

O Zilliz Cloud é descomplicado, powered by Milvus e 10x mais rápido.

Começar
Feedback

Esta página foi útil?