UltraDim
La première base de données vectorielle conçue pour les vecteurs larges et aussi pour l'analytique, pas seulement pour la récupération — regroupez, classifiez, visualisez et détectez les anomalies directement depuis l'index, sur les vecteurs complets.
Les bases de données vectorielles classiques supposent des centaines à quelques milliers de dimensions. Les données scientifiques et analytiques brisent cette hypothèse : les profils de méthylation du génome entier couvrent des dizaines de millions de sites CpG, les empreintes moléculaires se hachent dans des espaces de trente millions de bits, les matrices client×produit atteignent des centaines de milliers de colonnes. UltraDim a été conçu exactement pour ce régime — ultra-large et épars — là où les bases conventionnelles s'effondrent sous leur propre coût mémoire bien avant de pouvoir répondre à une requête.
La percée est mathématique, pas seulement d'ingénierie. UltraDim représente les données ultra-larges et éparses dans un nouveau type d'index de données qui reste exact tout en passant à l'échelle avec un meilleur big-O — de sorte que les grands jeux de données qui font céder les autres bases ne constituent tout simplement pas un obstacle pour nous. Nous multiplions aussi les gains — notre index alimente la recherche mais tout autant le regroupement, la visualisation, le plongement, la recommandation et la détection d'anomalies. Pas seulement de la récupération — un environnement analytique.
Mesuré, sur un seul ordinateur portable
| Opération et corpus | largeur | résultat mesuré |
|---|---|---|
| Recherche — ChEMBL, 500k molécules | 3×10⁷ | recall@10 0.9964 @ 29 ms |
| Recherche — DBpedia-1M, dense | 1,536 | precision@10 0.9945 · 1,339 q/s @ 2.99 ms |
| Recherche — paniers retail, 100k | 100,000 | recall@10 0.9851 @ 17.5 ms |
| Recherche — synthétique, 50k | 1.8×10⁶ | recall@10 1.000 @ 15.7 ms |
| Plongement — ChEMBL UMAP, 50k | 3×10⁷ | graph k-NN recall 0.9996 vs exact |
| Recommandation — MovieLens-20M | 20,720 | égale une MF entraînée, zéro entraînement |
| Factorisation — dépenses retail | — | corrélation 0.80, au-dessus du plafond ALS |
| Anomalies en flux — DBpedia · ChEMBL | 3×10⁷ | AUROC 1.0 · 247/s, temps réel |
Tous les chiffres proviennent de l'article technique d'UltraDim, sur un hôte Apple M3 Max unique, mesurés par rapport à des oracles exacts en force brute. Les réserves sur le démarrage à froid et les comparaisons sont divulguées dans l'article — l'approximation est mesurée, pas cachée.
Ce qu'il fait
- Recherche par similarité — k-NN cosinus exact ré-ordonné à une largeur extrême
- Regroupement — k-means sphérique hiérarchique sur des clés réutilisées
- Plongement — cartes UMAP avec transformation hors échantillon en quelques millisecondes
- Recommandation — filtrage collaboratif à pleine fidélité, ou factorisation matricielle
- Diffusion en flux — la nouveauté comme un angle mesuré, la dérive comme un désaccord de lignage
- Détection d'anomalies en temps réel sur des vecteurs ultra-larges — arrivées en direct notées à ~1.1 ms p50, même à 30 millions de dimensions (alias détection de fraude)
L'accès anticipé est ouvert
Nous invitons les groupes de recherche et les équipes industrielles disposant de jeux de données vectorielles difficiles — empreintes moléculaires, profils génomiques, spectres, matrices comportementales éparses. Gratuit pour les universitaires.
demander un accès anticipé lire l'article