TailandêsCompatible with Milvus 3.0.0+
O tokenizador « thai » segmenta o texto em tailandês em tokens de palavras sem depender de espaços. Utilize este tokenizador quando precisar de criar um pipeline de análise personalizado para texto em tailandês ou misto (tailandês/inglês).
Configuração
Para texto em tailandês, utilize o thai na maioria dos casos. O analisador integrado inclui este tokenizador, juntamente com a conversão para minúsculas, a normalização de algarismos decimais e a remoção de palavras-vazio em tailandês. Utilize o tokenizador « thai » diretamente apenas quando precisar de criar um pipeline de análise personalizado.
Para configurar um analisador utilizando o tokenizador « thai », defina « tokenizer » como « thai » em « analyzer_params ».
analyzer_params = {
"tokenizer": "thai",
}
O tokenizador thai não possui parâmetros configuráveis.
O tokenizador pode funcionar com um ou mais filtros. Por exemplo, a configuração seguinte utiliza o tokenizador thai com o lowercase e decimaldigit :
analyzer_params = {
"tokenizer": "thai",
"filter": [
"lowercase",
"decimaldigit",
],
}
Este pipeline personalizado não é equivalente ao analisador « thai » integrado, uma vez que não inclui o dicionário de palavras de stop « _thai_ » integrado. Para o pipeline predefinido completo, utilize {"type": "thai"}.
O tokenizador aplica o seguinte comportamento:
- Segmentação em tailandês: Segmenta o texto em tailandês em tokens de palavras sem depender de espaços em branco.
- Filtragem de espaços em branco e pontuação: Filtra segmentos compostos apenas por espaços em branco e pontuação. Isto difere do
icutokenizador, que pode preservar a pontuação e os espaços como tokens. - Texto com alfabetos mistos: Gera tokens de palavras em alfabeto latino em texto misto de tailandês e inglês.
- Apenas tokenizador: Não converte os tokens para minúsculas, não normaliza dígitos Unicode nem remove palavras de preenchimento. Adicione filtros ou utilize o
thaipara essas etapas. - Semântica de posição: Utiliza posições de tokens baseadas em caracteres que incluem espaços em branco e pontuação ignorados, o que mantém o comportamento de correspondência de frases e proximidade consistente com outros tokenizadores não latinos.
Após definir um « analyzer_params », pode aplicar o analisador a um campo « VARCHAR » ao definir um esquema de coleção. Para mais detalhes, consulte o «Exemplo de utilização».
Exemplos
Antes de aplicar a configuração do analisador ao esquema da sua coleção, verifique o seu comportamento utilizando o método ` run_analyzer `.
Configuração do analisador
analyzer_params = {
"tokenizer": "thai",
}
Verificação utilizando run_analyzer
from pymilvus import MilvusClient
client = MilvusClient(uri="http://localhost:19530")
sample_text = "สวัสดี! ทดสอบ, ระบบ Milvus ๑๒๓"
result = client.run_analyzer(sample_text, analyzer_params)
print(result)
Resultado esperado
['สวัสดี', 'ทดสอบ', 'ระบบ', 'Milvus', '๑๒๓']