Salle serveurs peinte à l'aquarelle, en arrière-plan
Savoir-faire

Savoir-faire technologique

Un logiciel d'IA générative repose sur une chaîne technique complète : l'infrastructure qui fait tourner les modèles, les données qui les alimentent, l'orchestration qui les met au travail, le produit que vos équipes prennent en main.

Kalaia a la compétence technologique à chacun de ces niveaux. Ce que nous recommandons en mission, nous l'avons d'abord construit, déployé et opéré nous-mêmes.

Voici ce que ça recouvre concrètement.

01

Modèles et inférence

Nous travaillons avec l'ensemble des familles de modèles : les grandes API commerciales comme les modèles open source et privés. Le choix se fait cas d'usage par cas d'usage, sur des critères mesurés : qualité des sorties, latence, coût par requête, exigences de confidentialité.

Les prompts sont versionnés comme du code. Quand un modèle est déprécié ou qu'une nouvelle version sort, la bascule est testée avant d'être déployée, pas subie.

API commercialesModèles open sourceModèles privésPrompts versionnésQualité / latence / coût
Comparatif de modèles : qualité des sorties, latence, coût par requête
02

Déploiement et infrastructure : de l'API au on-premise

Un même besoin peut être servi de bien des façons : API commerciale, instance privée chez un fournisseur, hébergement sur un cloud public ou souverain, serveurs dédiés, jusqu'au on-premise complet avec des modèles open source. Chaque option a son profil de coût, de latence, d'exposition des données et de charge d'exploitation.

Nous savons arbitrer entre ces options, et surtout les mettre en œuvre. Pour les déploiements sur serveurs, cela descend jusqu'au matériel : dimensionnement des GPU selon le modèle et la charge (mémoire, débit de tokens, nombre d'utilisateurs simultanés), quantization pour tenir sur les cartes disponibles, serveur d'inférence optimisé, supervision et redondance.

Y compris conclure qu'une simple API suffit, quand c'est le cas.

APICloud souverainServeurs dédiésOn-premiseDimensionnement GPUQuantization
De l'API commerciale au on-premise : arbitrer, puis mettre en œuvre
03

Données et retrieval

La plus grosse partie d'un projet d'IA générative se joue avant le modèle. Ingestion, nettoyage, structuration, découpage des documents, embeddings, stratégie de recherche : c'est là que se gagne ou se perd la qualité des réponses. Nous construisons ces pipelines depuis 2023. Pulse repose entièrement sur ce type d'architecture, de la collecte des avis clients jusqu'à la restitution analysée.

IngestionEmbeddingsDécoupage de documentsStratégie de recherche
Pipeline d'ingestion : de la collecte des avis à la restitution analysée
04

Architectures agentiques et intégration au SI

Nous concevons des systèmes agentiques : orchestration multi-étapes, appels d'outils, accès contrôlé aux données de l'entreprise. Nous contribuons au protocole MCP (Model Context Protocol) avec plusieurs serveurs open source publiés sur GitHub, dont un serveur pour l'API Carto de l'IGN.

Un agent isolé ne sert à rien. Sa valeur vient de sa connexion au système d'information existant : ERP, CRM, bases métier, outils internes. Cette connexion, avec les bons contrôles d'accès, c'est précisément ce que MCP permet de faire proprement, et ce que nous pratiquons au quotidien.

MCPOrchestration multi-étapesOpen sourceERP / CRM
Un serveur MCP connecté aux données métier, avec contrôles d'accès
05

Évaluation et fiabilité

Mettre un LLM devant des clients suppose de savoir mesurer ce qu'il produit. Nous mettons en place des jeux d'évaluation adaptés à chaque cas d'usage, des garde-fous sur les sorties, et du monitoring en production. Quand un prompt évolue ou qu'un modèle change, nous savons ce que ça modifie, chiffres à l'appui. C'est ce qui sépare un démonstrateur d'un outil qu'une entreprise peut mettre entre les mains de ses équipes ou de ses clients.

Jeux d'évaluationGarde-fousMonitoring en production
Tableau de bord d'évaluation : l'effet mesuré d'un changement de prompt
06

Ingénierie et industrialisation

Sur nos produits, nous choisissons nos outils. Chez nos clients, nous travaillons dans les leurs : langages, cloud, conventions internes, chaîne de CI/CD existante. Un outil IA qui impose sa propre stack devient une dette le jour où l'équipe interne doit le reprendre. Nous construisons pour que cette reprise soit possible.

La méthode, elle, reste la même partout : un premier outil fonctionnel en quelques semaines, puis une montée vers la production sans réécriture.

Stack du clientCI/CD existanteReprise par l'équipe interneMontée en production
S'insérer dans la chaîne de livraison existante du client
07

Product engineering

Nous construisons des produits logiciels complets : interface, backend, gestion des comptes et des droits, architecture multi-tenant, onboarding, itérations guidées par l'usage réel. Pulse est un SaaS à part entière, conçu, développé et opéré par nos soins, du premier écran jusqu'à l'exploitation quotidienne.

L'IA générative ajoute à ce socle ses propres problèmes de produit : affichage des réponses en streaming, gestion de l'incertitude du modèle, boucles de feedback utilisateur, latence perçue. Nous avons rencontré et résolu ces problèmes sur nos propres produits. Nos clients en héritent directement.

SaaSMulti-tenantComptes et droitsStreamingLatence perçue
Pulse : interface, comptes et droits, réponses en streaming
08

Sécurité et conformité

Nous travaillons pour des secteurs réglementés, l'assurance en particulier. Chaque architecture est conçue avec cette contrainte dès le départ : localisation des données, cloisonnement par client, maîtrise de ce qui transite par les fournisseurs de modèles, conformité RGPD. Et quand rien ne doit sortir, nous déployons le modèle directement dans l'environnement du client. Nous savons répondre à un questionnaire sécurité de DSI, parce qu'on nous en envoie régulièrement.

RGPDLocalisation des donnéesCloisonnement par clientDéploiement chez le clientQuestionnaire DSI
Cloisonnement par client, localisation et sortie maîtrisée des données
Ciel peint à l'aquarelle, en arrière-plan

Le plus simple pour juger ce savoir-faire reste de le voir fonctionner.

Pulse est notre meilleure démonstration.

Demander une démo