Berhenti

Filter " stop " menghapus kata-kata stop yang ditentukan dari teks yang telah ditokenisasi, sehingga membantu menghilangkan kata-kata umum yang kurang bermakna. Anda dapat mengonfigurasi daftar kata-kata stop menggunakan parameter " stop_words ".

Konfigurasi

Filter ` stop ` menerima daftar kata henti baik secara langsung melalui parameter ` stop_words ` maupun dari sumber berkas yang terdaftar melalui parameter ` stop_words_file `.

Daftar kata-kata yang diabaikan secara langsung

Untuk menggunakan filter ` stop ` dengan daftar langsung, tentukan ` "type": "stop" ` dalam konfigurasi filter, bersama dengan parameter ` stop_words ` yang menyediakan daftar kata-kata yang diabaikan.

analyzer_params = {
    "tokenizer": "standard",
    "filter":[{
        "type": "stop", # Specifies the filter type as stop
        "stop_words": ["of", "to", "_english_"], # Defines custom stop words and includes the English stop word list
    }],
}
Map<String, Object> analyzerParams = new HashMap<>();
analyzerParams.put("tokenizer", "standard");
analyzerParams.put("filter",
        Collections.singletonList(
                new HashMap<String, Object>() {{
                    put("type", "stop");
                    put("stop_words", Arrays.asList("of", "to", "_english_"));
                }}
        )
);
const analyzer_params = {
    "tokenizer": "standard",
    "filter":[{
        "type": "stop", # Specifies the filter type as stop
        "stop_words": ["of", "to", "_english_"], # Defines custom stop words and includes the English stop word list
    }],
};
analyzerParams = map[string]any{"tokenizer": "standard",
    "filter": []any{map[string]any{
        "type":       "stop",
        "stop_words": []string{"of", "to", "_english_"},
    }}}
# restful
analyzerParams='{
  "tokenizer": "standard",
  "filter": [
    {
      "type": "stop",
      "stop_words": [
        "of",
        "to",
        "_english_"
      ]
    }
  ]
}'

Filter ` stop ` menerima parameter-parameter konfigurasi berikut.

Parameter

Deskripsi

stop_words

Daftar kata yang akan dihapus dari tokenisasi. Secara default, filter ini menggunakan kamus _english_ bawaan. Anda dapat mengganti atau memperluasnya dengan tiga cara:

  • Kamus bawaan – berikan salah satu alias bahasa berikut untuk menggunakan kamus yang telah ditentukan sebelumnya:

    "_arabic_", "_english_", "_danish_", "_dutch_", "_finnish_", "_french_", "_german_", "_hungarian_", "_italian_", "_norwegian_", "_portuguese_", "_russian_", "_spanish_", "_swedish_", "_thai_"

  • Daftar kustom – berikan array istilah Anda sendiri, misalnya ["foo", "bar", "baz"].

  • Daftar campuran – gabungkan alias dan istilah kustom, misalnya ["of", "to", "_english_"].

    Untuk detail mengenai isi tepat dari setiap kamus bawaan, lihat stop_words. Untuk memeriksa kamus Arab atau Thailand, lihat daftar kata henti Arab atau daftar kata henti Thailand.

Filter ` stop ` beroperasi pada istilah yang dihasilkan oleh tokenizer, sehingga harus digunakan bersama dengan tokenizer. Untuk daftar tokenizer yang tersedia di Milvus, lihat `Standard Tokenizer ` dan halaman terkait lainnya.

Setelah mendefinisikan kata-kata yang diabaikan ( analyzer_params), Anda dapat menerapkannya ke bidang " VARCHAR " saat mendefinisikan skema koleksi. Hal ini memungkinkan Milvus memproses teks di bidang tersebut menggunakan penganalisis yang ditentukan untuk tokenisasi dan penyaringan yang efisien. Untuk detailnya, lihat Contoh penggunaan.

Memuat kata-kata stop dari sumber daya berkasCompatible with Milvus 3.0.x

Untuk daftar kata henti kustom yang besar — daftar khusus bahasa, kosakata domain, atau daftar yang ingin Anda bagikan di banyak koleksi — simpan kata-kata tersebut dalam berkas dan daftarkan berkas tersebut sebagai sumber daya berkas jarak jauh, lalu rujuk berkas tersebut dari filter melalui parameter ` stop_words_file `. Anda dapat menggunakan ` stop_words_file ` secara mandiri atau bersama dengan ` stop_words` yang disertakan; ketika keduanya ditetapkan, filter akan menggabungkan kedua sumber tersebut menjadi satu daftar kata henti.

File tersebut berupa teks UTF‑8 biasa dengan satu kata penghalang per baris. Contoh:

the
of
for

Unggah berkas tersebut ke penyimpanan objek yang dikonfigurasi untuk digunakan oleh kluster Milvus Anda, lalu daftarkan berkas tersebut:

from pymilvus import MilvusClient

client = MilvusClient(uri="http://localhost:19530")

# Register the uploaded file under a name you'll reference from analyzer configs.
client.add_file_resource(
    name="en_stop_words",
    path="file/stop_words.txt",    # full S3 object key, including the rootPath prefix
)

Rujuk sumber daya yang telah didaftarkan dalam filter melalui ` stop_words_file`:

analyzer_params = {
    "tokenizer": "standard",
    "filter": [{
        "type": "stop",
        "stop_words_file": {
            "type": "remote",
            "resource_name": "en_stop_words",
            "file_name": "stop_words.txt",
        },
    }],
}

Parameter ` stop_words_file ` menerima objek dengan bidang-bidang berikut:

Bidang

Deskripsi

type

Jenis sumber daya. Gunakan ` "remote" ` untuk berkas yang didaftarkan melalui ` add_file_resource`. Untuk varian ` "local" ` yang digunakan dalam deployment self-hosted, lihat Manage File Resources.

resource_name

Nama yang digunakan saat berkas didaftarkan di add_file_resource.

file_name

Bagian nama berkas dari jalur penyimpanan objek sumber daya yang terdaftar (misalnya, "stop_words.txt" jika sumber daya tersebut didaftarkan melalui path="file/stop_words.txt").

Contoh

Sebelum menerapkan konfigurasi penganalisis ke skema koleksi Anda, verifikasi perilakunya menggunakan metode run_analyzer.

Konfigurasi penganalisis

analyzer_params = {
    "tokenizer": "standard",
    "filter":[{
        "type": "stop", # Specifies the filter type as stop
        "stop_words": ["of", "to", "_english_"], # Defines custom stop words and includes the English stop word list
    }],
}
Map<String, Object> analyzerParams = new HashMap<>();
analyzerParams.put("tokenizer", "standard");
analyzerParams.put("filter",
        Collections.singletonList(
                new HashMap<String, Object>() {{
                    put("type", "stop");
                    put("stop_words", Arrays.asList("of", "to", "_english_"));
                }}
        )
);
// javascript
analyzerParams = map[string]any{"tokenizer": "standard",
    "filter": []any{map[string]any{
        "type":       "stop",
        "stop_words": []string{"of", "to", "_english_"},
    }}}
# restful

Verifikasi menggunakan run_analyzer

from pymilvus import (
    MilvusClient,
)

client = MilvusClient(uri="http://localhost:19530")

# Sample text to analyze
sample_text = "The stop filter allows control over common stop words for text processing."

# Run the standard analyzer with the defined configuration
result = client.run_analyzer(sample_text, analyzer_params)
print("Standard analyzer output:", result)
import io.milvus.v2.client.ConnectConfig;
import io.milvus.v2.client.MilvusClientV2;
import io.milvus.v2.service.vector.request.RunAnalyzerReq;
import io.milvus.v2.service.vector.response.RunAnalyzerResp;

ConnectConfig config = ConnectConfig.builder()
        .uri("http://localhost:19530")
        .build();
MilvusClientV2 client = new MilvusClientV2(config);

List<String> texts = new ArrayList<>();
texts.add("The stop filter allows control over common stop words for text processing.");

RunAnalyzerResp resp = client.runAnalyzer(RunAnalyzerReq.builder()
        .texts(texts)
        .analyzerParams(analyzerParams)
        .build());
List<RunAnalyzerResp.AnalyzerResult> results = resp.getResults();
// javascript
import (
    "context"
    "encoding/json"
    "fmt"

    "github.com/milvus-io/milvus/client/v2/milvusclient"
)

client, err := milvusclient.New(ctx, &milvusclient.ClientConfig{
    Address: "localhost:19530",
    APIKey:  "root:Milvus",
})
if err != nil {
    fmt.Println(err.Error())
    // handle error
}

bs, _ := json.Marshal(analyzerParams)
texts := []string{"The stop filter allows control over common stop words for text processing."}
option := milvusclient.NewRunAnalyzerOption(texts).
    WithAnalyzerParams(string(bs))

result, err := client.RunAnalyzer(ctx, option)
if err != nil {
    fmt.Println(err.Error())
    // handle error
}
# restful

Hasil yang diharapkan

['The', 'stop', 'filter', 'allows', 'control', 'over', 'common', 'stop', 'words', 'text', 'processing']

Diterjemahkan olehDeepL

Coba Milvus yang Dikelola secara Gratis

Zilliz Cloud bebas masalah, didukung oleh Milvus dan 10x lebih cepat.

Mulai
Umpan balik

Apakah halaman ini bermanfaat?