Satzzeichen entfernenCompatible with Milvus 2.5.11+
Der Filter removepunct entfernt Interpunktionszeichen, Leerzeichen und Zeilenumbrüche, die einige Tokenizer - wie jieba, lindera und icu- normalerweise beibehalten. Verwenden Sie ihn, wenn Sie einen sauberen Token-Stream wünschen, der nur sinnvolle Text-Token enthält, frei von Kommas, Punkten und anderen Satzzeichen.
Konfiguration
Der removepunct Filter ist in Milvus eingebaut. Um ihn zu verwenden, geben Sie einfach seinen Namen im Abschnitt filter innerhalb von analyzer_params an.
{
"tokenizer": "jieba",
"filter": ["removepunct"]
}
// java
// node
// go
# restful
Der Filter removepunct arbeitet mit den vom Tokenizer generierten Begriffen, muss also in Kombination mit einem Tokenizer verwendet werden.
Nachdem Sie analyzer_params definiert haben, können Sie sie bei der Definition eines Sammelschemas auf ein VARCHAR Feld anwenden. Dadurch kann Milvus den Text in diesem Feld unter Verwendung des angegebenen Analysators für eine effiziente Tokenisierung und Filterung verarbeiten. Einzelheiten finden Sie im Abschnitt Beispielanwendung.
Beispiele
Bevor Sie die Analyzer-Konfiguration auf Ihr Sammelschema anwenden, überprüfen Sie das Verhalten mit der Methode run_analyzer.
Analyzer-Konfiguration
{
"tokenizer": "icu",
"filter": ["removepunct"]
}
// java
// node
// go
# restful
Überprüfung mit run_analyzer
# Sample text to analyze
sample_text = "Привет! Как дела?"
# Run the standard analyzer with the defined configuration
result = MilvusClient.run_analyzer(sample_text, analyzer_params)
print(result)
// java
// javascript
// go
# restful
Erwartete Ausgabe
['Привет', 'Как', 'дела']