L'IA conçoit les outils.
L'extraction, elle, se vérifie.
À partir de vos fichiers sources — typiquement des PDF — l'IA ajuste des scripts d'extraction, plus ou moins fortement. Ce n'est pas un modèle qui « lit » le document à chaque fois : c'est une chaîne d'outils, reproductible, que vous pouvez inspecter.
Un écart se voit dans le pipeline, pas dans une phrase plausible. Déploiement sur vos serveurs, ou sur un mini-PC dédié.
Ce qu'est la Black Box. Ce qu'elle n'est pas.
L'argument n'est pas « l'IA lit vos PDF ». C'est : l'IA conçoit les outils qui les lisent. Si vos besoins ne rentrent pas dans la colonne de gauche, nous vous le dirons.
- Une chaîne d'extraction inspectable : scripts et schéma de sortie, pas une réponse générée à la volée.
- L'IA au service de l'outil : elle conçoit et ajuste les extracteurs, plus ou moins fortement selon le corpus.
- Un écart visible dans le pipeline (champ manquant, règle cassée), plutôt qu'une hallucination dans un paragraphe.
- Déployable en local quand les documents ne peuvent pas sortir : serveurs internes ou mini-PC dédié.
- Déjà une première installation en production, sur un corpus réel.
- Un chat qui « lit » le PDF à chaque demande, sans schéma ni reproductibilité.
- Un extracteur magique sans cadrage : chaque corpus a son plan d'extraction.
- Un hub unique pour tout faire. Les tableaux de bord, c'est NextSight. Les process métier, c'est WorkProba.
- Une dépendance cloud facturée au token, ni une promesse d'IA généraliste meilleure que GPT-4.
- Un produit générique clé en main : le Sprint d'architecture fixe le schéma et le niveau d'automatisation.
Des outils d'extraction, pas un chat sur PDF
Vous décrivez ce que vous attendez du document. L'IA cadre le plan, puis conçoit ou ajuste les scripts. Le livrable, c'est une chaîne : parsing, champs, validation, export. On peut la relire, la corriger, la rejouer.
L'extraction est le métier de Black Box, déjà en production sur un premier déploiement. Les tableaux de bord à partir de bases de données ne sont plus un module de la boîte : c'est NextSight, un produit à part.
-
Extraction
Métier En productionBesoin visé : extraire des données structurées depuis des PDF et dossiers techniques.
L'IA n'extrait pas « au feeling ». Elle aide à concevoir les outils d'extraction : schéma de champs, règles, ajustements plus ou moins forts selon la régularité du corpus. Pipeline de parsing (Docling) et validation, export structuré. Priorité aux dossiers réglementaires, tableaux, formulaires.
Pour qui : équipes qui industrialisent la saisie ou le contrôle documentaire, et qui ont besoin de voir ce qui a été décidé dans l'outil.
-
NextSight
Autre solution Produit distinctBesoin visé : relier bases et SI pour des tableaux de bord, pas extraire des PDF.
NextSight relie les sources de données (bases SQL, SI métier) pour en tirer une cartographie et des tableaux de bord. Produit distinct de Black Box (anciennement présenté comme Data Workspace). Première mise en œuvre au CEA, encore en développement.
Pour qui : organisations qui veulent une cartographie et des indicateurs branchés sur l'existant. Voir NextSight.
Sur votre déploiement, l'extraction s'adapte à vos corpus et à vos procédures. Le schéma de sortie et le niveau d'automatisation des scripts se cadrent avec vous. Même exigence de fiabilité : ce qui sort de l'outil doit pouvoir se relire.
Composition, priorités et calendrier validés au Sprint d'architecture, à partir de vos documents réels.
Spécifications de référence
La Black Box est une spécification d'architecture logicielle, déployée sur vos serveurs internes, vos machines industrielles ou un mini-PC dédié que nous livrons configuré et scellé.
Stack logicielle de l'appliance
L'appliance s'appuie sur une stack locale 100 % open source, orchestrée par notre couche maison. Le parsing documentaire est au centre de l'extraction ; le reste sert l'inférence locale et la recherche dans le corpus.
-
Docling Parsing
Parsing de PDF techniques : transformation de documents complexes (tableaux, formulaires, dossiers réglementaires) en structure exploitable par les outils d'extraction.
-
Ollama Inférence
Moteur d'inférence local qui exécute les LLM et VLM sur votre CPU/GPU. Aucune sortie réseau, aucun appel d'API externe — les modèles restent sur la machine.
-
LightRAG RAG
Graph RAG avec ontologies métier : structuration des connaissances, traçabilité des sources et raisonnement sur graphe plutôt qu'un simple chunking vectoriel.
-
ChromaDB + sentence-transformers Retrieval
Vectoriel local et embeddings pour la recherche sémantique dans vos corpus. Indexation et requête entièrement locales, sans dépendance à un service externe.
-
Couche logicielle maison Improba
Hub lanceur, orchestration Docker, installeur Windows clé en main (livraison USB air-gap) et apps métier (FastAPI + React). Ce qui transforme les briques open source en appliance exploitable sur votre périmètre.
La stack tourne en local sur le boîtier livré. Les choix définitifs (modèles, quantification, connecteurs SI) sont validés projet par projet lors du Sprint d'architecture.
Les choix techniques définitifs (modèles, quantification, déploiement) sont validés à l'issue du Sprint d'architecture, sur votre cas d'usage réel, sans promesse de performance avant mesure.
Nous ne vous vendons pas une boîte noire opaque. La Black Box est une spécification d'architecture logicielle qu'Improba déploie sur vos serveurs internes, vos machines industrielles ou un mini-PC dédié (AMD Ryzen, 128 Go de RAM), ou sur votre infrastructure existante (Jetson, serveur GPU). C'est votre propriété exclusive. Aucun abonnement, aucun coût caché au token.
Votre projet est-il éligible ?
5 questions. 2 minutes. Un rapport part sur votre email professionnel. Si le cas est compatible, nous vous recontactons. Sinon, nous vous l'indiquons — sans inscription. Vous pouvez aussi laisser vos coordonnées plus bas, sans passer par le test.
Quel besoin visez-vous en premier ?
Quel est le niveau de criticité des données traitées ?
Où le système doit-il fonctionner ?
À quelle fréquence le système sera-t-il sollicité ?
Information pour le rapport et le cadrage matériel ; elle ne modifie pas le verdict d'éligibilité.
Quelle est votre situation matérielle actuelle ?
Cette question nous aide à prioriser votre dossier ; elle ne modifie pas le verdict d'éligibilité technique.
Où envoyer votre rapport de faisabilité ?
Nous générons un rapport synthétique adapté à vos réponses et l'envoyons immédiatement. Pas de spam, vos données ne sont jamais revendues. Adresse professionnelle requise.
Projet éligible à une architecture locale
Vos contraintes de sécurité et la nature documentaire du besoin excluent souvent les API cloud publiques. Une chaîne d'extraction locale, conçue avec l'IA et inspectable, peut tourner sur votre périmètre.
Projet partiellement compatible
Votre contexte combine des éléments favorables et défavorables à une architecture purement locale. Une approche hybride (Cloud souverain + composants locaux) peut être pertinente, mais nécessite une analyse approfondie.
Architecture locale non recommandée
Votre besoin exige un raisonnement généraliste et une plasticité cognitive que seuls les grands modèles Cloud (OpenAI, Anthropic, Mistral hébergé) proposent aujourd'hui à un niveau satisfaisant. Un modèle local générerait trop d'erreurs.
Si vos besoins évoluent vers des tâches industrielles, critiques ou souveraines, nos équipes restent à votre disposition.
Un corpus à industrialiser ? Cadrons-le.
Si vous venez de passer le simulateur, votre demande est déjà enregistrée : inutile de renvoyer ce formulaire. Sinon, laissez vos coordonnées. L'équipe technique vous recontacte sous 48 h ouvrées.
- Priorité de contact : notre équipe technique vous recontacte sous 48 h ouvrées.
- Cadrage offert : si votre corpus est pertinent, diagnostic de faisabilité de 15 minutes.
- Transparence : on vous dit ce que l'extraction sait faire sur vos documents, et ce qu'elle ne sait pas encore.
Autre canal : écrire à l'équipe.
Demande bien reçue
Merci. Notre équipe vous recontacte sous 48 h ouvrées. Un email de confirmation vient de vous être envoyé.
L'extraction n'est pas le sujet ?
Les process et les sources de données relèvent d'autres produits.