Satzzeichen entfernenCompatible with Milvus 2.5.11+

Der Filter removepunct entfernt Interpunktionszeichen, Leerzeichen und Zeilenumbrüche, die einige Tokenizer - wie jieba, lindera und icu- normalerweise beibehalten. Verwenden Sie ihn, wenn Sie einen sauberen Token-Stream wünschen, der nur sinnvolle Text-Token enthält, frei von Kommas, Punkten und anderen Satzzeichen.

Konfiguration

Der removepunct Filter ist in Milvus eingebaut. Um ihn zu verwenden, geben Sie einfach seinen Namen im Abschnitt filter innerhalb von analyzer_params an.

{
    "tokenizer": "jieba",
    "filter": ["removepunct"]
}
// java
// node
// go
# restful

Der Filter removepunct arbeitet mit den vom Tokenizer generierten Begriffen, muss also in Kombination mit einem Tokenizer verwendet werden.

Nachdem Sie analyzer_params definiert haben, können Sie sie bei der Definition eines Sammelschemas auf ein VARCHAR Feld anwenden. Dadurch kann Milvus den Text in diesem Feld unter Verwendung des angegebenen Analysators für eine effiziente Tokenisierung und Filterung verarbeiten. Einzelheiten finden Sie im Abschnitt Beispielanwendung.

Beispiele

Bevor Sie die Analyzer-Konfiguration auf Ihr Sammelschema anwenden, überprüfen Sie das Verhalten mit der Methode run_analyzer.

Analyzer-Konfiguration

{
    "tokenizer": "icu",
    "filter": ["removepunct"]
}
// java
// node
// go
# restful

Überprüfung mit run_analyzer

# Sample text to analyze
sample_text = "Привет! Как дела?"

# Run the standard analyzer with the defined configuration
result = MilvusClient.run_analyzer(sample_text, analyzer_params)
print(result)
// java
// javascript
// go
# restful

Erwartete Ausgabe

['Привет', 'Как', 'дела']

Try Managed Milvus for Free

Zilliz Cloud is hassle-free, powered by Milvus and 10x faster.

Get Started
Feedback

War diese Seite hilfreich?