Hoja de ruta de Milvus

🌌 Hacia la base de datos multimodal de próxima generación y Vector Lakebase

Hoja de ruta del producto Milvus

¡Bienvenidos a la hoja de ruta de Milvus!

Estamos llevando a Milvus hacia una nueva era —la base de datos multimodal de próxima generación— que abarca desde datos estructurados hasta datos no estructurados, desde la recuperación en tiempo real hasta el análisis offline, y desde el rendimiento de un único clúster hasta una arquitectura global de Vector Lakebase.

Esta hoja de ruta describe los objetivos principales de Milvus v3.0 (beta pública) y Milvus v3.1 (desarrollo a largo plazo), junto con el plan de evolución de Zilliz Vector Lakebase.

🌠 Milvus v3.0 (beta pública)

Beta pública: mayo de 2026

Enfoque: Crear un motor de consultas nativo semántico con clasificación, agregación y recuperación multivectorial integradas en el propio motor, así como la base nativa de lago de datos de Zilliz Vector Lakebase, de modo que el procesamiento acceda a los datos sin necesidad de migración.

🎯 Aspectos destacados

🔹 Evolución del esquema y los tipos de datos

  • Admite ALTER COLLECTION ADD COLUMN y DROP COLUMN en tiempo de ejecución sin necesidad de reconstruir índices ni interrumpir el servicio.
  • Ofrece dos vías de retroalimentación para las nuevas columnas: externa a través de Spark Connector e interna con vectores dispersos BM25 generados automáticamente en el momento de la escritura.
  • Introducción de TEXT como tipo de datos de primera clase que almacena el texto original junto con vectores, con soporte para BM25 y coincidencia de texto.

🔹 Revisión de la ejecución de consultas

  • Incorporación de «Order By» en el motor con ordenación por segmento y ordenación por fusión entre los nodos de consulta.
  • Añade la agregación de consultas al estilo SQL (GROUP BY con COUNT, SUM, AVG, MIN, MAX) calculada en el núcleo.
  • Introducción de facetas de búsqueda sobre los resultados de ANN con estadísticas por bucket y subfacetas anidadas del lado del servidor.
  • Compatibilidad con diccionarios personalizados y tablas de sinónimos registrados en el clúster para mejorar la recuperación de CJK y de dominios específicos.

🔹 Compatibilidad con multivectores e interacción tardía

  • Introducción de StructList para representar una entidad como una única fila con múltiples vectores, con soporte nativo para la interacción tardía (ColBERT, ColPali) a través de MAX_SIM.
  • Compatibilidad con la búsqueda a nivel de elemento y de entidad en los campos de StructList, con políticas de coincidencia configurables para los resultados a nivel de entidad.
  • Se añaden tres estrategias de recuperación multivectorial: TokenANN (exhaustiva), Muvera (basada en proyección, sin entrenamiento) y Lemur (compresión aprendida).

🔹 Revisión de la recuperación y el índice

  • Revisión del índice invertido disperso con compresión por bloques, cuantificación de pesos y un formato persistente; introducción de SINDI como algoritmo predeterminado de índice invertido disperso.
  • Ampliar la cobertura del índice con toda la familia Faiss (SVS, Panorama, PQ, IVFPQ, ScaNN) y MinHash DIDO para la detección de casi duplicados.
  • Compatibilidad con campos vectoriales nulos para incrustaciones asíncronas y modalidades ausentes, con filtrado automático en el momento de la búsqueda.

🔹 Arquitectura de almacenamiento y computación vectorial de Lakebase

  • Introducción de External Collection para indexar y consultar datos en S3, GCS y Azure in situ, con compatibilidad con los formatos de tabla Lance, Parquet, Iceberg y Vortex.
  • Se añade Vortex, un formato columnar abierto, y Loon (Storage V3), una capa de almacenamiento de formato mixto para lecturas puntuales eficientes desde el almacenamiento de objetos.
  • Compatibilidad con instantáneas puntuales con aislamiento de tipo MVCC para el procesamiento por lotes, mientras el servicio continúa escribiendo.
  • Se integra como Spark DataSource v2 para leer y escribir en Milvus directamente en los flujos de trabajo de Spark, Databricks y EMR.

🪐 Milvus v3.1 (visión a largo plazo)

Calendario: finales de 2026 y más allá

Enfoque: inteligencia de almacenamiento, integridad de la ruta de escritura, extensibilidad de la computación y mayor interoperabilidad con Vector Lakebase.

🎯 Aspectos destacados

🔹 Almacenamiento y ruta de escritura

  • Añadir la aplicación de predicados con poda de índices de página y filtros Bloom en la capa de almacenamiento.
  • Implementar la deduplicación por clave primaria en la ingesta para evitar duplicados en el momento de la escritura.

🔹 Computación y elasticidad

  • Compatibilidad con funciones definidas por el usuario (UDF) para ejecutar lógica personalizada en el motor, en el plano de datos.
  • Habilitar la división de fragmentos para volver a dividirlos a medida que crecen los datos, con soporte para claves de fragmentación personalizadas.

🔹 Expansión de Spark y Vector Lakebase

  • Ampliar el conector de Spark con una biblioteca más completa de operadores por lotes nativos.
  • Añade capacidades de formato de tabla, incluyendo «time-travel», evolución de esquemas y reversión de instantáneas.
  • Ampliar la interoperabilidad de Vector Lakebase con índices externos actualizados mediante CDC, compatibilidad con Apache Paimon y formatos de datos adicionales.

🤝 Construyendo juntos el futuro de Milvus

Milvus es un proyecto de código abierto impulsado por una comunidad global de desarrolladores. Invitamos a todos los miembros de la comunidad a ayudar a dar forma a la base de datos multimodal de próxima generación:

  • 💬 Comparte tus comentarios: propone nuevas funcionalidades o ideas de optimización en GitHub Discussions.

  • 🐛 Informa de problemas: envía informes de errores a través de GitHub Issues.

  • 🔧 Aporta código: envía pull requests y ayuda a desarrollar las funcionalidades principales.

    • Solicitudes de incorporación de cambios: contribuye directamente a nuestro código fuente. Ya sea corrigiendo errores, añadiendo funcionalidades o mejorando la documentación, tus contribuciones son bienvenidas.
    • Guía de desarrollo: Consulta nuestra Guía para colaboradores para conocer las directrices sobre las contribuciones de código.
  • 🗣️ Únete a la conversación: Haz preguntas y conoce a los mantenedores en Discord, en las horas de atención de Milvus o en todos los canales de la comunidad.

  • Corre la voz: comparte buenas prácticas e historias de éxito, y sigue a Milvus en X, LinkedIn y YouTube.

👉 GitHub: milvus-io/milvus