L'architecture d'un agent IA vocal en temps réel : ce qui se passe entre la question et la réponse
Lorsqu'un visiteur appelle un musée équipé d'AI ARTEDUSA, il entend une voix naturelle qui lui répond en deux à quatre secondes. La conversation est fluide, les réponses sont pertinentes, les réservations sont confirmées instantanément. Pour l'appelant, l'expérience ressemble à un échange avec un être humain compétent et disponible. Mais entre le moment où le visiteur pose sa question et celui où il entend la réponse, un ensemble de systèmes interconnectés se coordonnent en temps réel. Cet article propose une plongée dans l'architecture technique qui rend cette expérience possible, à destination de ceux qui veulent comprendre ce qui se passe réellement sous le capot d'un agent IA vocal.
Par Artedusa
••7 min de lecture01Le flux d'un appel en dix étapes
Le parcours d'un appel obéit à une séquence précise de dix étapes. Premièrement, un visiteur appelle le numéro du musée. L'institution conserve son propre numéro de téléphone : soit le numéro existant redirige vers le numéro de la plateforme téléphonique, soit il est porté directement. L'appelant ne perçoit aucun changement. Deuxièmement, la plateforme téléphonique reçoit l'appel et contacte AI ARTEDUSA. Troisièmement, le système identifie l'institution en moins de 200 millisecondes, à partir du numéro de téléphone appelé. Cette identification permet de charger instantanément la configuration propre à l'institution : sa voix, sa langue par défaut, ses outils activés, sa base de connaissances. Quatrièmement, une connexion audio bidirectionnelle s'ouvre en temps réel via un protocole connexion en temps réel qui reste actif pendant toute la durée de l'appel. Cinquièmement, la voix du visiteur est transcrite en texte par le moteur de reconnaissance vocale, avec une latence inférieure à 500 millisecondes. Sixièmement, le texte transcrit est envoyé au modèle de langage avec l'ensemble du contexte de l'institution. Septièmement, le modèle de langage réfléchit, analyse l'intention du visiteur et utilise ses outils si nécessaire : réserver une visite, chercher une information dans la base de connaissances, vérifier un tarif. Huitièmement, la réponse textuelle est convertie en voix naturelle par le moteur de synthèse vocale, avec une latence inférieure à 500 millisecondes. Neuvièmement, le visiteur entend la réponse et la conversation se poursuit de manière fluide et naturelle. Dixièmement, à la fin de l'appel, le post-traitement automatique génère une synthèse, un score de satisfaction et les actions à suivre.
02La pile technologique, composant par composant
Chaque étape de ce flux repose sur un composant technologique précis. L'interface utilisateur, le tableau de bord dans lequel le directeur du musée configure son agent et consulte ses statistiques, est construite avec Next.js 16, React 19 et TypeScript. Le serveur applicatif qui orchestre les appels et coordonne l'ensemble des composants est une API construite avec notre API en Python, déployée sur le serveur notre serveur. La base de données métier, qui stocke les institutions, les appels, les fiches clients et les configurations, est notre base de données sécurisée 17 avec isolation des données par isolation des données par institution : chaque institution ne voit que ses propres données. Le cache, qui accélère le chargement des configurations et gère le rate limiting, est notre système de cache 7 avec un temps de vie de deux minutes pour les configurations et des clés hachées en notre algorithme de vérification pour garantir qu'aucune donnée personnelle ne transite en clair.
03L'intelligence conversationnelle
Le cerveau de l'agent est le modèle de langage notre intelligence artificielle, orchestré via notre orchestrateur IA. Ce choix n'est pas anodin. Le modèle doit être suffisamment rapide pour maintenir une latence conversationnelle acceptable, entre une et trois secondes de réflexion, tout en étant suffisamment capable pour comprendre des requêtes complexes et utiliser ses outils de manière autonome. La fenêtre de conversation conserve les vingt derniers messages, ce qui permet à l'agent de se souvenir de tout ce qui a été dit pendant l'appel. La profondeur maximale d'outils imbriqués est de cinq niveaux, et l'agent peut effectuer jusqu'à quinze appels d'outils par tour de parole. La taille maximale des caractères en entrée est de 2 000.
04Le pipeline vocal : de la voix au texte et du texte à la voix
La transcription de la voix en texte repose sur notre moteur de transcription vocale, un moteur de reconnaissance vocale conçu pour le temps réel. La voix du visiteur est transmise en continu via le connexion en temps réel, et notre moteur de transcription retourne le texte transcrit avec une latence inférieure à 500 millisecondes. La synthèse vocale, qui convertit la réponse textuelle de l'IA en voix audible, utilise notre moteur de synthèse vocale, un moteur multilingue qui produit des voix naturelles dans quinze langues. Chaque langue dispose de sa propre voix, ce qui garantit une prononciation et une intonation authentiques. La latence de cette conversion est également inférieure à 500 millisecondes. La plateforme téléphonique qui gère la connexion entre le réseau téléphonique traditionnel et le flux audio numérique est notre partenaire téléphonique, via son service Media Streams qui fournit un canal audio bidirectionnel en temps réel.
05La base de connaissances : quand le musée parle à travers l'IA
Avant même que le visiteur pose sa première question, l'agent dispose déjà d'un savoir approfondi sur l'institution. Ce savoir provient de la base de connaissances RAG, alimentée par les documents que l'institution a importés dans son tableau de bord. Les formats acceptés sont le PDF, le Word et le texte brut, avec une taille maximale de 10 mégaoctets par fichier. Chaque document est découpé en segments de segments intelligents avec un chevauchement de chevauchement pour préserver le contexte entre les segments. Chaque segment est transformé en un vecteur mathématique de haute dimension par le modèle notre moteur de vectorisation 2. Ces vecteurs sont stockés dans notre base vectorielle, une base vectorielle qui permet une recherche sémantique : le système comprend le sens des mots, pas seulement leur forme. La déduplication automatique par hash notre algorithme de vérification élimine les doublons. Pendant un appel, l'agent interroge cette base et récupère les cinq résultats les plus pertinents, avec un score minimum de 0,8 sur 1,0. Les trois documents les plus pertinents sont automatiquement injectés dans le contexte de l'IA au début de chaque appel.
06La résilience : quand les choses tournent mal
Un système vocal en temps réel ne peut pas se permettre de tomber en panne au milieu d'un appel. AI ARTEDUSA intègre plusieurs mécanismes de résilience à chaque niveau de l'architecture. Si le modèle de langage principal, notre modèle d intelligence artificielle, ne répond pas, le système bascule automatiquement vers le modèle de secours, un modèle de secours, sans que l'appelant perçoive une interruption. Si trois erreurs consécutives du modèle de langage se produisent pendant un même appel, l'agent met fin à l'appel de manière gracieuse avec un message d'excuse, plutôt que de laisser le visiteur dans le silence. Si le serveur plante pendant le post-traitement d'un appel, le mécanisme de récupération des appels orphelins reprend automatiquement le traitement au redémarrage. Si la facturation via notre partenaire de paiement échoue, un retry automatique est déclenché toutes les heures. Si la synthèse vocale rencontre un problème, une reconnexion automatique est lancée, avec une alerte déclenchée après deux échecs consécutifs ou plus.
07Les chiffres de performance
La latence bout-en-bout, c'est-à-dire le temps total entre le moment où le visiteur finit de poser sa question et celui où il entend le début de la réponse, se situe entre deux et quatre secondes. Ce délai est comparable à celui d'un être humain qui réfléchit avant de répondre. Le pool de connexions à la base de données gère trente connexions simultanées, avec vingt connexions en réserve et dix en débordement. La durée maximale d'un appel est de cinq minutes, paramètre configurable par l'institution. Le nombre d'appels simultanés par institution est de cinq par défaut, configurable et sans limite technique du côté serveur. Le nombre d'appels mensuels par institution est de cinq cents par défaut, également configurable. Les endpoints API standard sont protégés par un rate limiting de cent requêtes par minute. Les webhooks téléphoniques acceptent trois cents requêtes par minute. Les uploads de documents et les connexions sont limités à dix requêtes par minute chacun. L'ensemble du monitoring repose sur notre système de monitoring pour le suivi des erreurs et notre traçabilité pour les traces distribuées.
08Une architecture au service de l'art
Cette architecture technique n'est pas un exercice d'ingénierie pour lui-même. Chaque composant, chaque mécanisme de résilience, chaque optimisation de latence a été pensé pour un seul objectif : permettre à un visiteur d'appeler un musée, une galerie, une maison de vente ou un théâtre et d'obtenir une réponse compétente, naturelle et immédiate, dans sa langue, à toute heure. La facturation à la consommation, à 0,15 dollar par minute avec un coût réel d'environ 0,03 dollar par minute et une de 80 pour cent, rend cette technologie accessible à toute institution culturelle, quelle que soit sa taille. La conformité RGPD et la préparation à l'EU AI Act, qui entre en vigueur en août 2026, garantissent que cette adoption se fait dans le respect du cadre réglementaire européen. Le stockage des fichiers est assuré par notre stockage sécurisé, compatible S3, et les emails transactionnels sont envoyés via SMTP avec des templates Jinja2.
Découvrir ai.artedusa : https://ai.artedusa.com/
L'IA qui comprend l'art
Découvrez nos agents IA conçus pour les musées, galeries et institutions culturelles. Analyse de collections, curation intelligente, recommandations personnalisées.
Découvrir ai.artedusa