2 min de lectura

Slater empaqueta grandes bases de datos de grafos en unos pocos cientos de MB

Slater es una base de datos de grafos diseñada para cargas intensivas de lectura, que sirve grafos con cientos de millones de nodos mediante Bolt sin cargarlos en RAM.

Imagen: Hacker News

Un nuevo proyecto de código abierto llamado Slater se propone abordar uno de los problemas más persistentes de las bases de datos de grafos: el uso de memoria. Su propuesta es simple: servir grafos que no caben en memoria —incluyendo cientos de millones de nodos y miles de millones de aristas— manteniendo el uso de RAM en unos pocos cientos de MB, no ligado al tamaño del grafo.

Slater expone grafos mediante Bolt estándar, por lo que los controladores existentes de Neo4j funcionan sin modificación. Según el proyecto, la base de datos puede servir el grafo de Wikidata de 90 millones de nodos / 1.5B aristas desde unos pocos cientos de MB de RAM al paginar desde una imagen en disco en lugar de mantener el grafo completo en memoria. En contraste, el README indica que los motores de grafos en memoria pueden necesitar ~64–128 GiB para abrir ese conjunto de datos.

La arquitectura separa la construcción del grafo de su servicio. Una herramienta fuera de línea, slater-build, compila los datos en una imagen en disco inmutable con direccionamiento por contenido. El servidor slater en línea entonces sirve esa imagen con un presupuesto de caché fijo, lo que significa que un grafo de 4 GB y otro de 400 GB pueden usar la misma cantidad de RAM en tiempo de ejecución.

Slater no es de solo lectura, aunque las escrituras son opcionales. El proyecto usa una capa escribible basada en LSM sobre el núcleo inmutable, con un registro de escritura adelantada (write-ahead log), una tabla en memoria, segmentos delta inmutables y consolidación periódica de nuevo en un núcleo renovado. El objetivo declarado es mantener la ruta de lectura sin cambios cuando no hay escrituras pendientes, permitiendo al mismo tiempo actualizaciones duraderas a través de Bolt.

Recomendado

Los centros de datos de EE. UU. podrían consumir el 20 % de la electricidad para 2035

Las características clave que destaca el proyecto incluyen:

  • Compatibilidad con Bolt 5.4 / 4.4 / 4.1
  • Amplia superficie de consultas Cypher además de un subconjunto de ISO GQL (ISO/IEC 39075)
  • Búsqueda vectorial nativa en disco integrada usando Vamana + PQ con KNN por coseno, L2 o producto punto
  • Almacenamiento en sistemas de archivos locales, S3 o Google Cloud Storage
  • Cifrado opcional XChaCha20-Poly1305 en reposo y TLS en tránsito
  • Soporte multinquilino y ACLs

La versión actual listada en el repositorio es v0.24.1. Para equipos que construyen grafos de conocimiento, sistemas de recomendación, grafos de identidad o recuperación basada en grafos para RAG, la afirmación central de Slater es inusualmente directa: el tamaño del grafo debería vivir en disco, no en tu factura de memoria.

Marcus Vance

Enterprise Editor

Marcus follows the money. He covers enterprise software, cloud architecture, and the tectonic shifts in Big Tech strategy. He translates dense earnings calls and complex M&A activity into actionable insights about where the industry is actually heading. If a tech giant makes a silent pivot, Marcus is usually the first to notice.

vía Hacker News

// Sigue leyendo