Des applications LLM qui répondent à partir de vos données, et qu'on vérifie
Nous construisons des assistants et des pipelines sur des grands modèles de langage. Ils répondent à partir de vos documents et de vos systèmes. Nous les mesurons sur un jeu d'évaluation et les hébergeons là où vos données ont le droit de rester.
- Un regard sur votre installation et votre problème
- Une réponse franche sur la pertinence de l'IA
- Aucune vente forcée
Ce que nous construisons
RAG : des réponses issues de vos documents
Un assistant de questions-réponses sur vos manuels, procédures, tickets ou rapports. Chaque réponse cite le passage dont elle vient : on peut la vérifier au lieu de lui faire confiance aveuglément. La recherche est construite autour de vos documents : découpage, recherche et classement adaptés à votre contenu, car la plupart des mauvaises réponses viennent d'un mauvais contexte.
Extraction : des documents en données structurées
Transformez PDF, formulaires, e-mails et scans en champs validés que vos systèmes peuvent utiliser. Les sorties sont contrôlées par des schémas et des règles métier, et les cas à faible confiance sont confiés à une personne plutôt que devinés.
Agents : des flux de travail qui utilisent des outils
Des agents qui appellent vos API et vos bases de données pour accomplir une tâche bien définie. Les permissions se limitent aux outils fournis, chaque étape est journalisée et un humain valide les actions qui comptent. Le périmètre reste étroit volontairement : un petit agent qui marche vaut mieux qu'un agent général qui marche parfois.
Auto-hébergé : des modèles open-weight sur vos GPU
Vos données ne quittent votre infrastructure que si vous choisissez un modèle hébergé. Quand elles ne peuvent pas sortir, nous servons des modèles open-weight sur votre matériel ou votre cloud privé, dimensionnés et optimisés pour votre budget de latence et de coût.
Un jeu d'évaluation d'abord, pas après le lancement
Une démo de chat est facile. Un système auquel on fait confiance chaque jour demande de la mesure dès la première semaine. Nous convenons avec votre équipe de vraies questions et de bonnes réponses avant de construire, pour que chaque changement soit mesuré face à elles. Le même jeu continue de contrôler la qualité après le lancement.
Garde-fous et permissions
Chaque utilisateur ne voit que ce qu'il a le droit de voir : la recherche respecte les règles d'accès que vous avez déjà. Les agents ne touchent que les outils qu'on leur donne. Quand le système n'est pas sûr, la réponse le dit.
Serving, latence et coût
API hébergée ou modèle auto-hébergé, selon vos contraintes : sensibilité des données, temps de réponse et budget. Nous dimensionnons et optimisons le chemin de serving comme n'importe quelle charge GPU, avec la même ingénierie d'inférence que pour la vidéo temps réel : batching, quantification et profilage de toute la requête.
MLOps : supervision et retours en production
Les systèmes à base de modèles de langage se dégradent aussi en silence. Les documents changent, les questions évoluent, un fournisseur met à jour un modèle. Nous ajoutons des traces journalisées, des contrôles de qualité automatiques et des boucles de retour, pour qu'une baisse de qualité apparaisse sur un tableau de bord avant d'apparaître dans les plaintes. C'est la même rigueur MLOps que pour nos systèmes de vision.
Associer vos caméras, et quand ne pas utiliser un LLM
Les événements et rapports de vision peuvent alimenter un assistant : on peut alors demander en langage naturel ce que les caméras ont vu. Nous vous disons aussi quand un LLM est le mauvais outil. Parfois, un moteur de recherche, une règle ou un classifieur simple suffit, et le premier appel sert à répondre à cette question.
- RAG avec citations
- extraction de documents
- agents outillés
- jeux d'évaluation
- garde-fous & permissions
- modèles open-weight auto-hébergés
- serving GPU & latence
- optimisation des coûts
- suivi de la qualité
- vision + LLM