Milvus-Roadmap
🌌 Auf dem Weg zur multimodalen Datenbank der nächsten Generation und zu Vector Lakebase
Milvus-Produkt-Roadmap
Willkommen bei der Milvus-Roadmap!
Wir führen Milvus in eine neue Ära – die der multimodalen Datenbank der nächsten Generation –, die strukturierte bis unstrukturierte Daten, Echtzeit-Abfragen bis hin zu Offline-Analysen sowie die Leistung eines einzelnen Clusters bis hin zu einer globalen Vector Lakebase-Architektur umfasst .
Diese Roadmap skizziert die Kernziele für Milvus v3.0 (öffentliche Beta) und Milvus v3.1 (langfristige Entwicklung) sowie den Entwicklungsplan für Zilliz Vector Lakebase.
🌠 Milvus v3.0 (öffentliche Beta)
Öffentliche Beta-Version: Mai 2026
Schwerpunkt: Aufbau einer semantisch-nativen Abfrage-Engine mit integrierter Sortierung, Aggregation und Multi-Vektor-Abfrage sowie der Lake-nativen Grundlage von Zilliz Vector Lakebase, damit Rechenleistung die Daten ohne Migration erreicht.
🎯 Wichtigste Highlights
🔹 Weiterentwicklung von Schema und Datentypen
- Unterstützung von „ALTER COLLECTION ADD COLUMN“ und „DROP COLUMN“ zur Laufzeit, ohne dass Indizes neu erstellt werden müssen oder der Betrieb unterbrochen wird.
- Bereitstellung von zwei Nachvervollständigungswegen für neue Spalten: extern über den Spark-Connector und intern mit BM25-Sparse-Vektoren, die beim Schreiben automatisch generiert werden.
- Einführung von TEXT als vollwertigen Datentyp, der den Originaltext neben Vektoren speichert und BM25 sowie Textabgleich unterstützt.
🔹 Überarbeitung der Abfrageausführung
- Integration von „Order By“ in die Engine mit segmentweiser Sortierung und Merge-Sort über Abfrageknoten hinweg.
- Hinzufügen von Abfrageaggregationen im SQL-Stil (GROUP BY mit COUNT, SUM, AVG, MIN, MAX), die im Kernel berechnet werden.
- Einführung von Suchfacetten für ANN-Ergebnisse mit Statistiken pro Bucket und verschachtelten Unterfacetten auf Serverseite.
- Unterstützung benutzerdefinierter Wörterbücher und Synonymtabellen, die auf Cluster-Ebene registriert werden, zur Verbesserung des CJK- und domänenspezifischen Recalls.
🔹 Unterstützung für Multi-Vektoren und späte Interaktion
- Einführung von StructList zur Darstellung einer Entität als einzelne Zeile mit vielen Vektoren, mit nativer Unterstützung für späte Interaktion (ColBERT, ColPali) über MAX_SIM.
- Unterstützung der Suche auf Element- und Entitätsebene in StructList-Feldern mit konfigurierbaren Übereinstimmungsregeln für Ergebnisse auf Entitätsebene.
- Hinzufügung von drei Multi-Vektor-Abrufstrategien: TokenANN (vollständig), Muvera (projektionsbasiert, ohne Training) und Lemur (gelernte Komprimierung).
🔹 Überarbeitung von Abruf und Index
- Überarbeitung des spärlichen invertierten Index mit Blockkomprimierung, Gewichtsquantisierung und einem persistenten Format; Einführung von SINDI als Standardalgorithmus für spärliche invertierte Indizes.
- Erweiterung der Indexabdeckung um die gesamte Faiss-Familie (SVS, Panorama, PQ, IVFPQ, ScaNN) und MinHash DIDO zur Erkennung von Beinahe-Duplikaten.
- Unterstützung von nullfähigen Vektorfeldern für asynchrone Einbettungen und fehlende Modalitäten mit automatischer Filterung zum Zeitpunkt der Suche.
🔹 Vektor-Lakebase-Speicher- und Rechenarchitektur
- Einführung von „External Collection“ zum Indizieren und Abfragen von Daten in S3 / GCS / Azure vor Ort, mit Unterstützung für die Tabellenformate Lance, Parquet, Iceberg und Vortex.
- Hinzufügung von „Vortex“, einem offenen spaltenorientierten Format, und „Loon“ (Storage V3), einer Speicher-Schicht mit gemischten Formaten für effiziente Punktabfragen aus dem Objektspeicher.
- Unterstützung von Momentaufnahmen mit MVCC-ähnlicher Isolation für die Stapelverarbeitung, während der Dienst weiterhin Schreibvorgänge zulässt.
- Integration als Spark DataSource v2 zum direkten Lesen aus und Schreiben in Milvus in Spark-/Databricks-/EMR-Pipelines.
🪐 Milvus v3.1 (Langfristige Vision)
Zeitplan: Ende 2026 und darüber hinaus
Schwerpunkte: Speicherintelligenz, Integrität des Schreibpfads, Erweiterbarkeit der Rechenkapazitäten und erweiterte Interoperabilität mit Vector Lakebase.
🎯 Wichtigste Highlights
🔹 Speicher & Schreibpfad
- Einführung von Prädikat-Pushdown mit Seitenindex- und Bloom-Filter-Pruning auf der Speicherebene.
- Implementierung der Primärschlüssel-Deduplizierung bei der Datenaufnahme, um Duplikate beim Schreiben zu vermeiden.
🔹 Rechenleistung und Skalierbarkeit
- Unterstützung benutzerdefinierter Funktionen (UDFs) zur Ausführung benutzerdefinierter Logik in der Engine auf der Datenebene.
- Aktivierung der Shard-Aufteilung, um Shards bei wachsendem Datenvolumen neu aufzuteilen, mit Unterstützung für benutzerdefinierte Sharding-Schlüssel.
🔹 Spark & Erweiterung von Vector Lakebase
- Erweiterung des Spark-Konnektors um eine umfangreichere Bibliothek nativer Batch-Operatoren.
- Erweiterung der Tabellenformatfunktionen um Zeitreise, Schemaentwicklung und Snapshot-Rollback.
- Erweiterung der Interoperabilität von Vector Lakebase durch CDC-aktuelle externe Indizes, Unterstützung für Apache Paimon und zusätzliche Datenformate.
🤝 Gemeinsam die Zukunft von Milvus gestalten
Milvus ist ein Open-Source-Projekt, das von einer globalen Entwickler-Community vorangetrieben wird. Wir laden alle Community-Mitglieder ein, die multimodale Datenbank der nächsten Generation mitzugestalten:
💬 Feedback geben: Schlagen Sie neue Funktionen oder Optimierungsideen in den GitHub-Diskussionen vor.
🐛 Probleme melden: Melden Sie Fehler über GitHub Issues.
🔧 Code beisteuern: Reichen Sie Pull-Requests ein und helfen Sie mit, Kernfunktionen zu entwickeln.
- Pull-Anfragen: Leisten Sie einen direkten Beitrag zu unserem Code. Ganz gleich, ob Sie Fehler beheben, Funktionen hinzufügen oder die Dokumentation verbessern – Ihre Beiträge sind herzlich willkommen.
- Entwicklerleitfaden: In unserem Contributor’s Guide findest du Richtlinien für Code-Beiträge.
🗣️ Nehmen Sie an der Diskussion teil: Stellen Sie Fragen und treffen Sie die Betreuer auf Discord, bei den Milvus Office Hours oder in allen Community-Kanälen.
⭐ Weiterempfehlen: Teile Best Practices und Erfolgsgeschichten und folge Milvus auf X, LinkedIn und YouTube.
👉 GitHub: milvus-io/milvus