← retour

UltraDim

La première base de données vectorielle conçue pour les vecteurs larges et aussi pour l'analytique, pas seulement pour la récupération — regroupez, classifiez, visualisez et détectez les anomalies directement depuis l'index, sur les vecteurs complets.

Les bases de données vectorielles classiques supposent des centaines à quelques milliers de dimensions. Les données scientifiques et analytiques brisent cette hypothèse : les profils de méthylation du génome entier couvrent des dizaines de millions de sites CpG, les empreintes moléculaires se hachent dans des espaces de trente millions de bits, les matrices client×produit atteignent des centaines de milliers de colonnes. UltraDim a été conçu exactement pour ce régime — ultra-large et épars — là où les bases conventionnelles s'effondrent sous leur propre coût mémoire bien avant de pouvoir répondre à une requête.

La percée est mathématique, pas seulement d'ingénierie. UltraDim représente les données ultra-larges et éparses dans un nouveau type d'index de données qui reste exact tout en passant à l'échelle avec un meilleur big-O — de sorte que les grands jeux de données qui font céder les autres bases ne constituent tout simplement pas un obstacle pour nous. Nous multiplions aussi les gains — notre index alimente la recherche mais tout autant le regroupement, la visualisation, le plongement, la recommandation et la détection d'anomalies. Pas seulement de la récupération — un environnement analytique.

BloomMap : 49 grappes feuilles de 50 000 molécules ChEMBL, regroupées en 30 millions de dimensions, rendues sous forme de pétales autour d'un cœur de Voronoï sombre
BloomMap — 50 000 molécules ChEMBL regroupées en 30 000 000 dimensions sur les clés réutilisées de la base. 49 grappes feuilles ; chaque pétale est une donnée réelle, étiquetée par sa molécule la plus centrale.

Mesuré, sur un seul ordinateur portable

Opération et corpuslargeurrésultat mesuré
Recherche — ChEMBL, 500k molécules3×10⁷ recall@10 0.9964 @ 29 ms
Recherche — DBpedia-1M, dense1,536 precision@10 0.9945 · 1,339 q/s @ 2.99 ms
Recherche — paniers retail, 100k100,000 recall@10 0.9851 @ 17.5 ms
Recherche — synthétique, 50k1.8×10⁶ recall@10 1.000 @ 15.7 ms
Plongement — ChEMBL UMAP, 50k3×10⁷ graph k-NN recall 0.9996 vs exact
Recommandation — MovieLens-20M20,720 égale une MF entraînée, zéro entraînement
Factorisation — dépenses retail corrélation 0.80, au-dessus du plafond ALS
Anomalies en flux — DBpedia · ChEMBL3×10⁷ AUROC 1.0 · 247/s, temps réel

Tous les chiffres proviennent de l'article technique d'UltraDim, sur un hôte Apple M3 Max unique, mesurés par rapport à des oracles exacts en force brute. Les réserves sur le démarrage à froid et les comparaisons sont divulguées dans l'article — l'approximation est mesurée, pas cachée.

UMAP UltraDim de 50 000 molécules ChEMBL plongées directement depuis 30 000 000 de dimensions brutes
UMAP UltraDim — 50 000 molécules ChEMBL plongées directement depuis 30 000 000 de dimensions brutes. Graph k-NN recall 0.9996 face à l'oracle exact.

Ce qu'il fait

Carte d'anomalies en flux : 987 442 articles DBpedia ajustés en gris, avec les arrivées en direct dessinées sous forme d'anneaux colorés en vert lorsqu'elles sont familières et en rouge lorsqu'elles sont anormales
Détection d'anomalies en flux — 987 442 articles DBpedia ajustés (gris) ; 2 904 arrivées en direct notées à leur atterrissage, rouge lorsqu'elles sont nouvelles. La notation s'exécute à la latence de récupération — 824 arrivées/s sur données denses, et 247/s même à 30 millions de dimensions. Le même angle mesuré pilote la détection de fraude et d'anomalies en temps réel.

L'accès anticipé est ouvert

Nous invitons les groupes de recherche et les équipes industrielles disposant de jeux de données vectorielles difficiles — empreintes moléculaires, profils génomiques, spectres, matrices comportementales éparses. Gratuit pour les universitaires.

demander un accès anticipé lire l'article