TailandêsCompatible with Milvus 3.0.0+

O analisador « thai » é um analisador integrado para texto em tailandês. Utilize este analisador quando precisar que o Milvus segmente texto em tailandês em palavras, normalize algarismos tailandeses, converta texto misto em latim para minúsculas e remova palavras vazias em tailandês.

Configuração

Os analisadores integrados são modelos de analisadores fornecidos pelo Milvus. Para utilizar um analisador integrado, defina ` type ` para um nome de analisador predefinido em ` analyzer_params`.

Para utilizar o analisador tailandês integrado, defina ` type ` como ` thai`:

analyzer_params = {
    "type": "thai",
}

O analisador thai aceita o seguinte parâmetro opcional:

Parâmetro

Tipo

Padrão

Descrição

stop_words

list[str]

_thai_

Uma lista de palavras de exclusão adicionais a remover da tokenização. Por predefinição, o analisador « thai » utiliza o dicionário « _thai_ » integrado. Para consultar o dicionário predefinido, consulte a lista de palavras de exclusão do Milvus para a língua tailandesa. A lista provém do ficheiro de palavras de exclusão do Apache Lucene para a língua tailandesa.

Para adicionar palavras de exclusão personalizadas, inclua stop_words:

analyzer_params = {
    "type": "thai",
    "stop_words": ["มิลวัส"],
}

O Milvus aplica palavras de exclusão personalizadas para além do dicionário _thai_ integrado.

O analisador « thai » integrado é equivalente à seguinte configuração de analisador personalizado:

analyzer_params = {
    "tokenizer": "thai",
    "filter": [
        "lowercase",
        "decimaldigit",
        {
            "type": "stop",
            "stop_words": ["_thai_"],
        },
    ],
}

Este analisador aplica as seguintes etapas de processamento:

  • Tokenização: Utiliza o thai tokenizador para segmentar o texto tailandês em tokens de palavras sem depender de espaços em branco. O tokenizador filtra os espaços em branco e os segmentos compostos apenas por sinais de pontuação.
  • Normalização de maiúsculas e minúsculas: utiliza o filtro « lowercase », que afeta as letras latinas em texto misto tailandês/inglês.
  • Normalização de dígitos: utiliza o filtro « decimaldigit » para converter dígitos tailandeses e outros dígitos decimais Unicode em dígitos ASCII.
  • Remoção de palavras-vazio: utiliza o filtro « stop » com o dicionário integrado « _thai_ ».
  • Sem stemming: O analisador « thai » integrado não aplica o filtro « stemmer ».

Após definir o analyzer_params, pode aplicar o analisador a um campo VARCHAR ao definir um esquema de coleção. Para mais detalhes, consulte o Exemplo de utilização.

Exemplos

Antes de aplicar a configuração do analisador ao seu esquema de coleção, verifique o seu comportamento utilizando o método run_analyzer.

Configuração do analisador

analyzer_params = {
    "type": "thai",
}

Verificação utilizando run_analyzer

from pymilvus import MilvusClient

client = MilvusClient(uri="http://localhost:19530")

sample_text = "ฉันรักการค้นหาข้อความใน Milvus ๑๒๓"

result = client.run_analyzer(sample_text, analyzer_params)
print(result)

Resultado esperado

['ฉัน', 'รัก', 'ค้นหา', 'ข้อความ', 'milvus', '123']

Traduzido porDeepL

Experimente o Milvus gerenciado gratuitamente

O Zilliz Cloud é descomplicado, powered by Milvus e 10x mais rápido.

Começar
Feedback

Esta página foi útil?