Aller au contenu principal
Savoir-faire 02

Des applications LLM qui répondent à partir de vos données, et qu'on vérifie

Nous construisons des assistants et des pipelines sur des grands modèles de langage. Ils répondent à partir de vos documents et de vos systèmes. Nous les mesurons sur un jeu d'évaluation et les hébergeons là où vos données ont le droit de rester.

Réserver un appelAppel de 30 min · sans engagement
Ce qui vous attend lors de l'appel
  • Un regard sur votre installation et votre problème
  • Une réponse franche sur la pertinence de l'IA
  • Aucune vente forcée

Ce que nous construisons

01

RAG : des réponses issues de vos documents

Un assistant de questions-réponses sur vos manuels, procédures, tickets ou rapports. Chaque réponse cite le passage dont elle vient : on peut la vérifier au lieu de lui faire confiance aveuglément. La recherche est construite autour de vos documents : découpage, recherche et classement adaptés à votre contenu, car la plupart des mauvaises réponses viennent d'un mauvais contexte.

02

Extraction : des documents en données structurées

Transformez PDF, formulaires, e-mails et scans en champs validés que vos systèmes peuvent utiliser. Les sorties sont contrôlées par des schémas et des règles métier, et les cas à faible confiance sont confiés à une personne plutôt que devinés.

03

Agents : des flux de travail qui utilisent des outils

Des agents qui appellent vos API et vos bases de données pour accomplir une tâche bien définie. Les permissions se limitent aux outils fournis, chaque étape est journalisée et un humain valide les actions qui comptent. Le périmètre reste étroit volontairement : un petit agent qui marche vaut mieux qu'un agent général qui marche parfois.

04

Auto-hébergé : des modèles open-weight sur vos GPU

Vos données ne quittent votre infrastructure que si vous choisissez un modèle hébergé. Quand elles ne peuvent pas sortir, nous servons des modèles open-weight sur votre matériel ou votre cloud privé, dimensionnés et optimisés pour votre budget de latence et de coût.

05

Un jeu d'évaluation d'abord, pas après le lancement

Une démo de chat est facile. Un système auquel on fait confiance chaque jour demande de la mesure dès la première semaine. Nous convenons avec votre équipe de vraies questions et de bonnes réponses avant de construire, pour que chaque changement soit mesuré face à elles. Le même jeu continue de contrôler la qualité après le lancement.

06

Garde-fous et permissions

Chaque utilisateur ne voit que ce qu'il a le droit de voir : la recherche respecte les règles d'accès que vous avez déjà. Les agents ne touchent que les outils qu'on leur donne. Quand le système n'est pas sûr, la réponse le dit.

07

Serving, latence et coût

API hébergée ou modèle auto-hébergé, selon vos contraintes : sensibilité des données, temps de réponse et budget. Nous dimensionnons et optimisons le chemin de serving comme n'importe quelle charge GPU, avec la même ingénierie d'inférence que pour la vidéo temps réel : batching, quantification et profilage de toute la requête.

08

MLOps : supervision et retours en production

Les systèmes à base de modèles de langage se dégradent aussi en silence. Les documents changent, les questions évoluent, un fournisseur met à jour un modèle. Nous ajoutons des traces journalisées, des contrôles de qualité automatiques et des boucles de retour, pour qu'une baisse de qualité apparaisse sur un tableau de bord avant d'apparaître dans les plaintes. C'est la même rigueur MLOps que pour nos systèmes de vision.

09

Associer vos caméras, et quand ne pas utiliser un LLM

Les événements et rapports de vision peuvent alimenter un assistant : on peut alors demander en langage naturel ce que les caméras ont vu. Nous vous disons aussi quand un LLM est le mauvais outil. Parfois, un moteur de recherche, une règle ou un classifieur simple suffit, et le premier appel sert à répondre à cette question.

  • RAG avec citations
  • extraction de documents
  • agents outillés
  • jeux d'évaluation
  • garde-fous & permissions
  • modèles open-weight auto-hébergés
  • serving GPU & latence
  • optimisation des coûts
  • suivi de la qualité
  • vision + LLM

Questions fréquentes

01Nos données peuvent-elles rester sur nos serveurs ?

Oui. Nous pouvons exécuter les modèles sur votre propre matériel ou votre cloud privé.

02Comment démarre un projet ?

Par un appel de cadrage. Nous vérifions d'abord vos données et votre objectif.

03Avec qui allons-nous travailler ?

L'ingénieur de votre premier appel est celui qui le construit.

04Et si l'IA n'est pas le bon outil ?

Nous vous le disons pendant l'appel. Parfois, une règle simple suffit.

05Travaillez-vous hors du Maroc ?

Oui. Nous sommes basés au Maroc et travaillons dans le monde entier.

Des documents ou des données dont on vous parle sans cesse ?

Réservez un appel de 30 minutes. Nous vous dirons si une application LLM convient, et ce que demanderait une première version.

Réserver un appelVous parlez à l'ingénieur qui le construirait