TailandêsCompatible with Milvus 3.0.0+
O analisador « thai » é um analisador integrado para texto em tailandês. Utilize este analisador quando precisar que o Milvus segmente texto em tailandês em palavras, normalize algarismos tailandeses, converta texto misto em latim para minúsculas e remova palavras vazias em tailandês.
Configuração
Os analisadores integrados são modelos de analisadores fornecidos pelo Milvus. Para utilizar um analisador integrado, defina ` type ` para um nome de analisador predefinido em ` analyzer_params`.
Para utilizar o analisador tailandês integrado, defina ` type ` como ` thai`:
analyzer_params = {
"type": "thai",
}
O analisador thai aceita o seguinte parâmetro opcional:
Parâmetro |
Tipo |
Padrão |
Descrição |
|---|---|---|---|
|
|
|
Uma lista de palavras de exclusão adicionais a remover da tokenização. Por predefinição, o analisador « |
Para adicionar palavras de exclusão personalizadas, inclua stop_words:
analyzer_params = {
"type": "thai",
"stop_words": ["มิลวัส"],
}
O Milvus aplica palavras de exclusão personalizadas para além do dicionário _thai_ integrado.
O analisador « thai » integrado é equivalente à seguinte configuração de analisador personalizado:
analyzer_params = {
"tokenizer": "thai",
"filter": [
"lowercase",
"decimaldigit",
{
"type": "stop",
"stop_words": ["_thai_"],
},
],
}
Este analisador aplica as seguintes etapas de processamento:
- Tokenização: Utiliza o
thaitokenizador para segmentar o texto tailandês em tokens de palavras sem depender de espaços em branco. O tokenizador filtra os espaços em branco e os segmentos compostos apenas por sinais de pontuação. - Normalização de maiúsculas e minúsculas: utiliza o filtro «
lowercase», que afeta as letras latinas em texto misto tailandês/inglês. - Normalização de dígitos: utiliza o filtro «
decimaldigit» para converter dígitos tailandeses e outros dígitos decimais Unicode em dígitos ASCII. - Remoção de palavras-vazio: utiliza o filtro «
stop» com o dicionário integrado «_thai_». - Sem stemming: O analisador «
thai» integrado não aplica o filtro «stemmer».
Após definir o analyzer_params, pode aplicar o analisador a um campo VARCHAR ao definir um esquema de coleção. Para mais detalhes, consulte o Exemplo de utilização.
Exemplos
Antes de aplicar a configuração do analisador ao seu esquema de coleção, verifique o seu comportamento utilizando o método run_analyzer.
Configuração do analisador
analyzer_params = {
"type": "thai",
}
Verificação utilizando run_analyzer
from pymilvus import MilvusClient
client = MilvusClient(uri="http://localhost:19530")
sample_text = "ฉันรักการค้นหาข้อความใน Milvus ๑๒๓"
result = client.run_analyzer(sample_text, analyzer_params)
print(result)
Resultado esperado
['ฉัน', 'รัก', 'ค้นหา', 'ข้อความ', 'milvus', '123']