{"version":"https://jsonfeed.org/version/1.1","title":"CONGO VOICE AI OS — Blog","home_page_url":"https://congovoicecd.com/blog","feed_url":"https://congovoicecd.com/blog/feed.json","description":"IA vocale en langues congolaises : santé communautaire, agriculture, éducation, corpus linguistique et sécurité des systèmes.","language":"fr-CD","authors":[{"name":"Groupe Nseya Digital / JNN Global Ltd","url":"https://congovoicecd.com"}],"items":[{"id":"https://congovoicecd.com/blog/ia-vocale-langues-congolaises","url":"https://congovoicecd.com/blog/ia-vocale-langues-congolaises","title":"IA vocale en langues congolaises : le guide complet","summary":"Construire une IA vocale en langues congolaises fiable : données, code-switching, seuils de qualité et boucle d'apprentissage, par un programme public en cours.","content_text":"Un service public vocal ne se juge pas sur une démonstration en studio. Il se juge le jour où une mère de famille du Kongo-Central décrit, en kikongo mélangé de français, un enfant qui convulse — et où le système doit comprendre assez vite pour dire la bonne chose. Ce texte décrit ce que nous avons appris en construisant une IA vocale en langues congolaises pour un service national de santé, d'agriculture et d'éducation, et ce que nous publions comme limites. Pourquoi les langues congolaises résistent aux modèles vocaux standards La République Démocratique du Congo parle quatre langues nationales à côté du français : le lingala , le kikongo, le kiswahili et le tshiluba . Aucune n'est traitée par les moteurs commerciaux avec la qualité dont bénéficie le français ou l'anglais. Trois raisons se cumulent. Les données transcrites manquent Un modèle de reconnaissance vocale apprend d'heures d'audio alignées avec leur transcription. Pour le français, ces heures se comptent en dizaines de milliers. Pour le tshiluba, elles se comptent en dizaines. Les initiatives ouvertes comme le projet Common Voice de Mozilla ont montré qu'une collecte communautaire est possible, mais la couverture des langues bantoues d'Afrique centrale reste marginale. Les modèles massivement multilingues publiés ces dernières années, à commencer par le travail de Meta AI sur plus de mille langues , élargissent la couverture nominale sans garantir l'exactitude sur un dialecte donné. Le code-switching est la norme Une phrase entendue à Kinshasa ressemble rarement à du lingala pur. Elle passe du lingala au français au milieu d'une proposition, souvent sur les mots techniques : « mwana na ngai azali na fièvre banda mikolo mibale ». Un système qui force l'utilisateur à choisir une langue au début de l'appel se trompe donc structurellement. L'étiquetage doit se faire au niveau de la portion d'énoncé, et la transcription d'origine doit être conservée telle quelle. L'audio de terrain n'est pas de l'audio de studio Un appel passé depuis un village arrive compressé en 8 kHz, avec du vent, des enfants, une radio, et une ligne qui coupe. Les scores publiés sur des jeux de test propres ne prédisent pas le comportement dans ces conditions. Nous mesurons donc systématiquement deux fois : sur audio propre et sur audio de terrain . Comment mesurer la qualité d'une IA vocale dans une langue peu dotée ? Un score moyen de transcription ne dit rien d'utile pour un service de santé. Ce qui compte, c'est le comportement dans les cas rares et graves. Le programme publie donc des seuils par langue, et une langue n'est ouverte dans un module qu'après les avoir franchis. Mesure Seuil d'ouverture Pourquoi ce seuil Taux d'erreur de mots, audio propre 20 % maximum (12 % en français) Au-delà, l'extraction d'entités devient trop bruitée Taux d'erreur de mots, audio de terrain 8 kHz 30 % maximum Reflète l'appel réel, pas la démonstration Exactitude de l'intention 90 % en santé, 85 % en agriculture et éducation Une intention fausse envoie vers le mauvais protocole Rappel des situations d'urgence 98 % minimum Un faux négatif en santé est inacceptable Intelligibilité de la voix de synthèse 3,8 sur 5 en écoute native En dessous, la personne raccroche Identification de la langue 95 % minimum Conditionne toute la suite de la chaîne Ces seuils sont publics, avec la conduite à tenir quand ils ne sont pas atteints : la langue bascule en mode guidé, avec des messages enregistrés par des locuteurs natifs et une navigation par touches, plutôt que de laisser un modèle deviner. Le détail par langue est publié sur la page consacrée aux langues nationales du programme. La chaîne de traitement, étape par étape Sept étapes séparent l'enregistrement de la réponse parlée. Chacune produit une trace consultable. Segmentation de l'audio et détection de la parole, pour ne transcrire que ce qui est dit. Identification de la langue au niveau de l'énoncé, avec les deux hypothèses les plus probables et leur probabilité. Transcription , avec un score de confiance par segment, et non un score global unique. Normalisation du mélange de langues , en gardant les étiquettes de langue par portion. Forme française canonique , utilisée pour le raisonnement, l'audit et la lecture par un agent humain, la transcription d'origine étant conservée. Traitement métier , qui applique des règles écrites avant toute génération de texte. Rendu dans la langue du citoyen , avec un glossaire imposé sur les termes médicaux et agricoles, puis synthèse vocale. L'ordre compte. La détection des signes de danger intervient avant l'appel au modèle de langage : un mot comme « convulsions », « degedege » ou « akoki kopema te » déclenche la même réponse même si tous les fournisseurs d'IA sont indisponibles. C'est ce que nous appelons des garde-fous déterministes , et c'est la raison pour laquelle la gouvernance clinique du service peut être auditée ligne par ligne. Faire apprendre le système à partir des conversations Un modèle générique ne suffit pas ; il faut une boucle qui transforme l'usage réel en amélioration mesurable. La nôtre a six étapes. Chaque conversation devient un échantillon de corpus : ce qui a été entendu, le sens compris en français, l'audio, la province, l'intention et la confiance du système. Le citoyen peut signaler « le système ne m'a pas compris » et noter la voix de synthèse. Des relecteurs, locuteurs natifs, vérifient, corrigent et enrichissent un lexique local avec des indications de prononciation. Les exemples vérifiés et le lexique sont réinjectés dans chaque nouvelle demande, ce qui améliore la compréhension immédiatement, sans réentraînement. Les paires audio/transcription vérifiées sont exportées pour l'entraînement de modèles de parole adaptés. Un indicateur de maîtrise par langue — écoute, compréhension, parole — est recalculé en continu. Ce dernier point est important pour un financeur : il rend visible ce qui progresse et ce qui stagne, langue par langue, au lieu d'un score global qui masque les écarts. Choisir des fournisseurs sans dépendre d'aucun Aucun fournisseur ne couvre correctement les cinq langues. La conséquence pratique est qu'il faut router chaque tâche vers le moteur le moins mauvais pour cette tâche et cette langue, et pouvoir en changer sans réécrire le service. Nous avons isolé un seul point de contact avec les fournisseurs. Les agents métier n'appellent jamais un moteur directement : ils demandent une transcription, une compréhension structurée ou une synthèse vocale, et une passerelle décide qui répond. Trois conséquences suivent. Le basculement est automatique. Si le moteur préféré échoue, refuse ou renvoie une sortie non conforme au schéma attendu, la demande passe au suivant dans la chaîne, sans que le citoyen le sache. Le mode dégradé est réel. Quand tous les moteurs sont indisponibles, les arbres de décision continuent de tourner et les scripts d'urgence enregistrés sont diffusés. Le service perd la conversation, pas la sécurité. Aucun nom de fournisseur ne sort. Ni dans l'interface, ni dans une réponse d'API, ni dans un message d'erreur. Un service public ne fait pas la promotion d'un moteur commercial, et le programme doit pouvoir en changer sans renégocier sa communication. Cette organisation a un coût : chaque sortie de modèle doit être validée contre un schéma strict avant d'être utilisée, et une sortie non conforme est traitée comme une panne. C'est plus lent à écrire, mais c'est ce qui rend le comportement du service prévisible quand un fournisseur change son modèle sans prévenir. Concevoir pour la 2G, l'électricité intermittente et le téléphone partagé Les contraintes de terrain déterminent l'architecture plus sûrement que les préférences techniques. La bande passante impose un audio compressé et un envoi par morceaux, avec reprise après coupure. Une photo agricole est vérifiée avant d'être envoyée : si elle est floue ou trop sombre, l'application demande une nouvelle prise plutôt que de consommer une analyse pour rien. L' électricité intermittente interdit les sessions longues. Une conversation interrompue doit pouvoir reprendre là où elle s'est arrêtée, ce qui suppose de stocker l'état de la session et non seulement le dernier message. Le téléphone partagé interdit d'assimiler l'identité au numéro. Une même ligne peut servir à plusieurs personnes du ménage ; le service demande donc une confirmation légère en début de session et n'attache aucune inférence de santé au profil. Enfin, la voix reste l'interface principale . Le texte est un secours, pas l'inverse. Une réponse parlée dépasse rarement vingt-cinq secondes, et au-delà elle est découpée avec une proposition explicite de continuer. Ces choix ne sont pas des détails d'ergonomie : ils décident si une personne qui ne lit pas couramment peut utiliser un service public numérique, ou si elle en est exclue une fois de plus. Ce que cela change pour un service public Une IA vocale qui tient dans ces conditions ouvre trois usages que le numérique classique n'atteignait pas. En santé communautaire , une personne décrit des symptômes et reçoit une orientation , avec détection des signes de danger et alerte d'un relais communautaire quand la situation est grave. En agriculture , un producteur décrit ou photographie une maladie des cultures et reçoit d'abord des actions gratuites, puis peu coûteuses, avant toute mention d'un produit du registre des intrants . En éducation , un élève révise à voix haute, y compris pour le TENAFEP , dans la langue où il comprend le mieux. Dans les trois cas, la valeur ne vient pas de la conversation mais de ce qui suit : un cas ouvert, un humain prévenu, un délai de prise en charge suivi. C'est ce que décrit le programme dans son ensemble. Les limites que nous annonçons publiquement Publier ses limites fait partie de la méthode. Aujourd'hui : Le kikongo et le tshiluba sont les moins bien servis ; leur ouverture dépend de la collecte de corpus en cours. Les traductions d'interface dans les quatre langues nationales sont des versions de travail, en attente de validation par des locuteurs natifs. Les protocoles de santé portent la mention « en attente du comité de revue clinique » tant que ce comité n'est pas constitué. Aucun chiffre national n'est publié : les volumes visibles proviennent de l'environnement de préparation du pilote et sont étiquetés comme tels. Un service public qui parle aux gens dans leur langue doit être aussi clair sur ce qu'il ne sait pas encore faire que sur ce qu'il fait. C'est la condition pour que la confiance, une fois accordée, résiste au premier échec.","date_published":"2026-09-08T00:00:00.000Z","date_modified":"2026-09-10T00:00:00.000Z","authors":[{"name":"Direction technique CONGO VOICE AI OS"}],"tags":["Langues et parole","Langues","Reconnaissance vocale","Corpus","Inclusion numérique","RDC"],"language":"fr-CD","_cvos":{"cluster":"langues-peu-dotees","pillar":true,"entities":["lingala","kikongo","kiswahili","tshiluba","reconnaissance vocale","synthèse vocale","code-switching","corpus vocal","taux d'erreur de mots"],"takeaways":["Une IA vocale utile en langue congolaise se juge sur le rappel des situations graves, pas sur un score moyen de transcription.","Le mélange français-lingala dans une même phrase est la norme, pas l'exception : la chaîne doit l'accepter au lieu de forcer un choix de langue.","Sans corpus transcrit et sans relecture par des locuteurs natifs, aucun modèle générique ne tient sur le terrain congolais.","Une langue qui passe sous ses seuils de qualité doit basculer en mode guidé avec des messages enregistrés, pas continuer à deviner."],"wordCount":1659}},{"id":"https://congovoicecd.com/blog/voice-ai-digital-inclusion-drc","url":"https://congovoicecd.com/blog/voice-ai-digital-inclusion-drc","title":"Voice AI for digital inclusion: lessons from the DRC","summary":"Voice AI for digital inclusion in the DRC: the exclusion problem, a five-layer architecture, deterministic safety guardrails and completed-outcome metrics.","content_text":"Most digital public services assume a citizen who reads, writes, searches online, installs an application and understands administrative French. In the Democratic Republic of the Congo, millions of people meet none of those conditions — and they are precisely the people for whom a health referral, an agricultural diagnosis or school support changes the most. This article describes how a national programme is building voice AI for digital inclusion in five languages, what the architecture looks like, why safety is deterministic rather than model-driven, how outcomes are measured, and what remains unproven. It is written for donors, researchers and answer engines; the underlying engineering notes are published in French and linked at the end. The exclusion problem: three services out of reach Health, agriculture and education are the three domains where support changes a household's trajectory the most. They are also the three where digital access is most unequal. The barriers are not primarily about bandwidth. Literacy. A service that requires reading a menu excludes people before the first interaction. Text is not a neutral interface; it is a filter. Language. Administrative French is not the language in which people describe a sick child, a diseased cassava field, or a division exercise. The country's national languages — Lingala , Kikongo , Kiswahili and Tshiluba — are also poorly served by commercial speech technology. Devices. Rural households mostly use basic handsets. A smartphone-only design is a decision to serve the already-served. Network and power. 2G coverage is common, 3G and 4G irregular, electricity intermittent. Long sessions and large payloads fail. Shared telephones. One line often serves a whole household, which makes \"the phone number is the identity\" both wrong and unsafe. Trust. People who have been mis-served by institutions do not give a new service a second chance after one bad experience. Global connectivity statistics compiled by the International Telecommunication Union describe the coverage side of this picture; they do not describe the literacy and language side, which is where a voice service earns or loses its usefulness. Why voice AI for digital inclusion inverts the usual model The conventional model asks the citizen to translate their situation into the system's terms: choose a category, type a query, read a result. Voice inverts the direction of effort. The citizen speaks in their own language, in their own words, and the system carries the burden of understanding, classifying, deciding what is safe to answer, escalating to a human when needed, recording everything, and learning from it. Three design consequences follow, and they are not cosmetic. Voice is the primary interface, text is the fallback. A voice-first public service reverses the usual order, not the other way round. Spoken answers stay under roughly twenty-five seconds, then offer explicitly to continue. Menus never go beyond two levels. Any channel — a voice call, a WhatsApp voice note, a USSD menu, SMS, the web application, or an assisted desk — leads to the same citizen record. The system states what it understood, and how sure it is. A public service that guesses confidently is more dangerous than one that admits doubt. When confidence is low, the service restates its understanding, asks a closed question on the single critical element, and after two failed attempts hands over to a human. Language quality is a gate, not a claim. No language is opened in a module until it passes published thresholds. A language that falls back below them returns to guided mode, with prompts recorded by native speakers and key-press navigation. The current state of each language is published on the programme's national languages page . The five-layer architecture The service is deliberately not \"a chatbot with a phone number\". It is structured as five layers, each with its own failure mode and its own audit trail. Layer What it does Why it is separate Channels Voice call, WhatsApp, USSD, SMS, web application, assisted desk One citizen identity across every entry point, including basic handsets Language Language identification, transcription, span-level handling of mixed speech, French canonical form, speech synthesis Language quality varies per language and must be gated independently Agents Specialist agents for community health triage , agriculture, education, language and risk, coordinated by a deterministic orchestrator Domain rules differ; the orchestrator, not a model, decides the sequence Cases and follow-up Escalation to community health workers, agricultural agents and teachers, with response deadlines and reminders The value of the service is what happens after the conversation Intelligence Regional trends, early signals on outbreaks and crop pests, learning gaps, dashboards for the state and NGOs Institutions need aggregates, never individual surveillance Two architectural choices deserve emphasis. First, a single gateway is the only component that knows which AI vendor is used; business logic asks for a transcription, a structured understanding or a spoken answer, and the gateway decides who answers, falls back automatically on failure, and rejects any model output that does not match the expected schema. Second, no vendor name is ever exposed — not in the interface, not in an API response, not in an error message. A public service does not advertise a commercial engine, and the programme must be able to change engines without renegotiating its communication. Deterministic safety: what a model is never allowed to decide This is the part that distinguishes a public service from a demonstration. Large language models are used to understand, explain and summarise. They are never used to decide risk. The deterministic safety guardrails below are code and configuration, readable line by line and testable without a model. Danger-sign detection runs before any model call. Keyword lists covering French and the four national languages — including spoken variants such as degedege in Kiswahili or akoki kopema te in Lingala — are applied to the raw transcript. If every AI provider is unavailable, detection and the recorded emergency script still run. Severity, delay and referral come from a protocol engine. The model's only jobs are to map free speech onto protocol answers and to explain an outcome that has already been decided. It may not propose a severity level, a deadline or an escalation. Forbidden outputs are filtered mechanically. Dose statements, definitive diagnoses and prescription-like phrasing are removed by pattern rules after generation, not left to prompt discipline. Silence is never a \"no\". If a message says nothing about a danger sign, the answer is \"unanswered\", not \"absent\". This single rule prevents a large class of false reassurance. Escalation is a tracked object, not a message. A danger sign opens a case assigned to a named human role, with a response deadline, reminders and an audit record. Health protocols follow the case-management logic published by the World Health Organization for childhood illness, and they carry the notice « en attente du comité de revue clinique » — pending clinical review committee — until that committee is constituted. The full rule set is described on the safety and governance page . What should a voice service actually measure? Message counts are the wrong denominator. A service can generate millions of messages and change nothing. The programme's reference measure is the completed outcome : a referral that was understood, an escalation that was actually picked up, an agricultural action that was carried out, a school concept that was acquired. Indicator Definition used Why not the obvious alternative Completed outcomes Interactions that ended in an understood action or a picked-up escalation Message volume rewards chattiness, not usefulness Escalation pick-up time Delay between case creation and first human action An alert nobody answers is not a safety net Emergency recall Share of danger situations correctly detected, per language Average accuracy hides the rare, serious cases Comprehension gap by language Citizen \"it did not understand me\" flags per hundred sessions Model confidence is self-reported and optimistic Reach among the excluded Share of sessions from basic handsets, USSD and voice calls Smartphone traffic measures the already-connected Repeat use Return within a defined window, per province One-off curiosity is not adoption Each indicator is published with its definition, its period, its denominator and a small-cell suppression rule. Aggregates are institutional; the service takes no eligibility, sanction or surveillance decision about an individual. Development and poverty indicators maintained by the World Bank provide the wider context in which these programme measures should be read, but they are not a substitute for measuring the service itself. Cost per completed outcome, not cost per message Funders reasonably ask what an interaction costs. The programme answers with a method rather than a number, because a number without pilot volumes would be a marketing figure. Every AI call — language understanding, transcription, speech synthesis, image analysis — is normalised into a single internal compute unit and attributed to a tenant, a module, a language and a channel. Institutions are metered and capped in those units, never in vendor tokens, so the accounting survives a change of provider. Three cost families are then summed and divided by completed outcomes: Compute , from the metered units, weighted by the class of model actually used. Telecommunications , which for a citizen-free service means the cost of calls, messages and short codes negotiated with operators. Human time , which is the item most often omitted: corpus review by native speakers, case handling by community health workers and agricultural agents, and supervision. When a tenant reaches its monthly cap, non-emergency traffic degrades to scripted mode; emergency handling is never degraded. That rule matters for cost modelling, because it converts a budget overrun into a graceful quality reduction rather than an outage. No cost-per-outcome figure is published today: the pilot has not opened at the scale that would make one honest. Evidence gaps: what voice AI for digital inclusion has not yet proven Publishing limits is part of the method, and this programme has many. Two of five languages are weakly supported. Kikongo and Tshiluba have little public data; their coverage depends on corpus collection under way. Interface strings in the four national languages are working drafts awaiting linguist validation. No speech model has been fine-tuned yet. The dataset export path exists; the training does not. Claiming a Congolese speech model today would be false, as the French article on speech recognition for Lingala states in detail. Corpus ownership is undecided. Whether the collected recordings become a public asset, an openly licensed dataset or a shared academic trust is an open programme decision, discussed in the French article on building a voice corpus in national languages . The clinical review committee is not constituted. Until it is, no protocol may be described as clinically approved. No national figures exist. Volumes visible in the platform come from the pilot preparation environment and are labelled as such. Short codes with operators are still being attributed. No independent evaluation has been conducted. There is no external study, no control group, and no published comparison against existing outreach channels. Any claim of impact would be premature. What can be said with confidence is narrower and more useful: the architecture makes safety independent of model availability, it records every step for audit, and it degrades to something that still works when providers, networks or budgets fail. Reading further, in French The engineering detail behind this overview is published in French, closer to the code: The complete guide to voice AI in Congolese languages — the pipeline end to end, quality thresholds and the learning loop. Speech recognition for Lingala — tone, agglutination , dialect variation and field-audio evaluation. Building a voice corpus in national languages — consent by voice, de-identification, balancing and dataset export. Code-switching between French and Lingala — span-level tagging and what mixed speech changes for safety-critical instructions. The programme overview — the problem, the response, the phased rollout and the stated limits. Work on low-resource speech such as Meta AI's massively multilingual speech models has made the starting point credible for languages that had none. Turning that starting point into a public service that a mother in Équateur can rely on at two in the morning is a different problem, and it is mostly not a modelling problem.","date_published":"2026-09-07T00:00:00.000Z","date_modified":"2026-09-10T00:00:00.000Z","authors":[{"name":"Direction technique CONGO VOICE AI OS"}],"tags":["Digital inclusion","Digital inclusion","Voice AI","Public services","Governance","DRC"],"language":"en","_cvos":{"cluster":"digital-inclusion","pillar":true,"entities":["Democratic Republic of the Congo","digital inclusion","voice interface","low-resource languages","deterministic safety","community health worker","completed outcome","national languages","answer engines"],"takeaways":["Voice inverts the usual assumption of digital public services: the citizen speaks, and the system carries the burden of reading, writing and searching.","Safety in a public service cannot be a model judgement: danger signs, severity and escalation are code and configuration, checked before any model is called.","The unit of measurement is the completed outcome — an understood referral, an escalation actually picked up — never the number of messages exchanged.","Nothing here is proven at national scale yet: two of the five languages are weakly supported, no speech model has been fine-tuned, and the clinical review committee is not yet constituted."],"wordCount":1979}},{"id":"https://congovoicecd.com/blog/garde-fous-ia-service-public","url":"https://congovoicecd.com/blog/garde-fous-ia-service-public","title":"Les garde-fous d’une IA de service public","summary":"Règles déterministes, gravité qui ne peut que monter, sources obligatoires, audit chaîné : les garde-fous d’une IA de service public, et ce qui manque encore.","content_text":"Un service public qui parle de santé, d’agriculture et d’école à des millions de personnes ne peut pas faire reposer la sécurité des gens sur la bonne volonté d’un modèle génératif. Les garde-fous d’une IA de service public ne sont donc pas des consignes écrites dans une invite : ce sont des règles compilées, testées, versionnées et rejouables, qui s’exécutent avant et après chaque génération de texte. Ce document décrit celles qui sont en place dans CONGO VOICE AI OS, la façon dont elles se vérifient, et — aussi précisément — celles qui ne sont pas encore en place. Deux systèmes, deux rôles, aucune confusion La distinction entre règles déterministes et IA générative n’est pas une figure de style : elle correspond à deux parties du logiciel écrites, testées et déployées séparément. Le partage des rôles est fixe. Ce que décident les règles Ce que fait le modèle La détection des signes de danger , par mots-clés, dans les cinq langues, avant tout appel à un modèle Transcrire la parole, reconnaître la langue, gérer les phrases qui mélangent deux langues Le niveau de gravité de 0 à 4, calculé par un arbre de décision versionné Extraire ce qui a été dit — symptômes, durées, âge — pour alimenter l’arbre Le déclenchement d’un drapeau rouge, qui impose immédiatement la gravité maximale Expliquer, dans la langue de la personne, une décision déjà prise et figée L’obligation d’escalader, la file d’attente destinataire et le délai de prise en charge Résumer l’échange pour l’agent qui rappellera Le texte d’urgence et les consignes de route, fixes et traduits à l’avance Décrire ce qu’une photo de culture ou d’animal montre Le refus de toute formulation de diagnostic ou de posologie dans la réponse finale Proposer des hypothèses classées, avec leurs indices favorables et contraires Cette séparation a une conséquence pratique décisive : les chemins de sécurité ne contiennent aucun appel de modèle. Un mot comme « convulsions » déclenche la même réponse, avec le même texte, que tous les fournisseurs d’IA soient disponibles ou non. Les listes de signes de danger et la conduite à tenir sont publiées côté citoyen sur la page urgence du service , dans les mots exacts que le système prononce. Pourquoi le modèle peut-il relever une gravité, mais jamais l’abaisser ? C’est la règle la plus importante de tout l’édifice, et elle est asymétrique à dessein. Le niveau de gravité — de 0, auto-prise en charge, à 4, urgence immédiate — est produit par un moteur de protocoles : un arbre de décision versionné, relu, rejoué à l’identique, dans lequel aucun modèle de langage n’intervient. Ce niveau constitue un plancher. Les autres signaux du système ne peuvent que le relever : une confiance basse sur un échange de santé ne reste jamais classée en risque faible ; une grossesse ou un nourrisson relèvent le niveau, même quand les symptômes décrits paraissent bénins ; une divulgation relevant de la protection des personnes impose une revue humaine quelle que soit l’évaluation clinique, et relève le risque au minimum au seuil de la consultation du jour ; l’absence de source approuvée relève également le niveau et bloque la réponse rédigée. Abaisser un niveau reste possible, mais uniquement pour une personne habilitée, et jamais pour le système. L’opération exige un motif écrit , et elle conserve côte à côte la valeur proposée par le système, la valeur retenue par la personne, son nom, son rôle et l’horodatage. Un service qui ne pourrait jamais être corrigé par un professionnel serait aussi dangereux qu’un service qui se corrigerait tout seul ; la différence tient à la trace laissée. Cette asymétrie répond à une caractéristique connue des modèles génératifs : leur tendance à produire une réponse plausible et rassurante quand les éléments manquent. Les cadres de gestion des risques publiés par le National Institute of Standards and Technology comme les principes adoptés par l’Organisation de coopération et de développement économiques insistent sur le même point : la fiabilité d’un système ne se décrète pas, elle se contraint. Aucune recommandation sans source, et un repli quand la source manque L’ancrage documentaire est le deuxième pilier. Toute recommandation de santé ou d’agriculture doit citer au moins un document de la base de connaissances approuvée, ou l’identifiant du protocole dont elle découle. Les documents sont des fichiers versionnés portant leur autorité d’origine, leur version, leur zone géographique, leur niveau de preuve, leur approbateur et leur date de revue. Ils sont chargés avec une empreinte, et seuls ceux dont le statut est « approuvé » peuvent être retrouvés par le service. La recherche documentaire s’exécute avant la rédaction, et les identifiants annoncés ensuite par le modèle sont revérifiés en base : un identifiant inexistant ou non approuvé est écarté sans discussion. S’il ne reste aucune source après cette vérification, trois choses se produisent ensemble : la réponse rédigée est remplacée par un texte de repli qui n’affirme rien et oriente vers un professionnel ou un centre de santé ; un événement de violation de contrat est enregistré, avec le protocole, sa version, le niveau de gravité et les identifiants revendiqués ; la revue humaine devient obligatoire et le niveau de gravité ne peut pas rester en dessous du seuil de consultation. Le même filet existe pour les formulations interdites : toute phrase qui pose un diagnostic ou qui donne une posologie chiffrée est retirée de la réponse, et la coupure est journalisée. Côté agriculture, la règle prend une forme spécifique — aucun produit n’est nommé s’il ne correspond pas à une entrée homologuée du registre des intrants , avec son étiquette, sa protection obligatoire et son délai avant récolte. Ce mécanisme est décrit en détail dans le guide de l’ IA agricole vocale pour les petits producteurs . Un vecteur de confiance plutôt qu’un score opaque Un chiffre unique donne l’illusion de la précision et cache l’endroit exact où le système a douté. Chaque échange conserve donc plusieurs dimensions distinctes, stockées avec l’interaction et visibles par l’agent qui reprend le cas. Dimension du vecteur de confiance Ce qu’elle mesure Ce qu’une valeur basse déclenche Qualité de la transcription La fiabilité de ce qui a été entendu Confirmation ciblée, puis orientation vers un humain Identification de la langue La langue et le mélange de langues reconnus Bascule en mode guidé pour cette langue Reconnaissance de l’intention Ce que la personne demande réellement Question de clarification plutôt que réponse Solidité des éléments recueillis Ce qui manque pour trancher Deuxième photo, question de suivi, ou renvoi vers un agent Couverture documentaire L’existence d’une source approuvée sur le sujet Texte de repli et revue humaine obligatoire C’est la dimension la plus faible , et non la moyenne, qui gouverne le comportement du système. Une transcription douteuse suffit à faire relever le risque d’un échange de santé, même si tout le reste paraît clair. Et aucune de ces valeurs n’est jamais présentée au citoyen comme une probabilité clinique : le service dit ce qu’il a compris et à quel point il en est sûr, pas ce dont la personne souffre. La façon dont ces seuils sont fixés langue par langue est développée dans l’article sur l’IA vocale en langues congolaises . Un journal d’audit que l’on ne peut pas réécrire sans que cela se voie Toute action privilégiée et tout changement significatif d’un cas écrivent une ligne d’audit : l’auteur, son rôle, l’entité concernée, l’état avant, l’état après, la finalité, l’identifiant de trace, l’organisation et l’adresse d’origine. Cette ligne est ensuite chaînée. Son empreinte est calculée à partir de l’empreinte de la ligne précédente et de son propre contenu, sérialisé de façon canonique — clés triées à chaque niveau, dates en format normalisé — pour que le calcul soit reproductible. La chaîne repart d’une valeur d’origine à chaque journée civile, ce qui permet de vérifier une journée isolément et d’en archiver une à la fois. Les écritures sont sérialisées, afin que la chaîne ne puisse pas se dédoubler quand plusieurs actions arrivent en même temps. Une vérification quotidienne recalcule la chaîne de la veille et détecte trois choses : une ligne modifiée, une ligne supprimée et une ligne insérée après coup. Une rupture déclenche une alerte à accusé de réception obligatoire, avec la position et l’action de la première ligne fautive. La consultation du journal est elle-même journalisée. Enfin, le journal survit à une demande d’effacement : il ne contient aucune donnée personnelle en texte libre, et il constitue la preuve de ce que le programme a fait. Les droits des personnes et les durées de conservation sont détaillés sur la page de protection des données . Des fournisseurs interchangeables, et invisibles La neutralité des fournisseurs d’IA est une exigence de souveraineté autant qu’une précaution technique. Un seul module de la plateforme sait quel fournisseur est appelé ; tout le reste demande une capacité — transcrire, comprendre, expliquer, décrire une image, synthétiser une voix — et ignore qui l’exécute. Des chaînes de repli configurables. Chaque capacité dispose d’un ordre de fournisseurs modifiable par configuration, terminé par un fournisseur de règles hors ligne. Changer de fournisseur est un paramètre, pas une réécriture. Une validation stricte des sorties. Une réponse de modèle qui ne respecte pas le schéma attendu est traitée comme une panne et la demande passe au fournisseur suivant. Rien ne fuit vers le client. Ni nom de fournisseur, ni consigne système, ni clé d’interface n’atteint un navigateur ou un téléphone, y compris dans les messages d’erreur. Aucun identifiant n’accompagne un appel. Le fournisseur reçoit le strict nécessaire — un extrait audio, un texte pseudonymisé, une photo dont les métadonnées ont été retirées — jamais un nom, un numéro ou un identifiant de dossier. Aucun entraînement par défaut. Les données des citoyens ne servent pas à entraîner des modèles de tiers ; les échantillons de corpus ne sont exportables que dé-identifiés et sous consentement de recherche. Tout appel est mesuré. Capacité, clé interne du fournisseur, durée, succès ou échec, unités consommées : la dépendance à un fournisseur devient visible et chiffrable. Modes dégradés et plafonds de budget : ce qui ne s’éteint jamais La question n’est pas de savoir si un fournisseur tombera, mais ce que reçoit le citoyen ce jour-là. Les modes dégradés d’un service public doivent être décidés à l’avance, pas improvisés pendant l’incident. Ce qui tombe Ce que fait le service Un fournisseur d’IA Passage au suivant dans la chaîne, même requête, le citoyen ne voit rien Tous les fournisseurs d’IA Fournisseur de règles hors ligne : les arbres de protocoles tournent, les explications viennent du texte approuvé, la confiance est signalée comme basse La reconnaissance vocale Mode écrit ou menu guidé par touches, sur USSD ou par serveur vocal Le plafond mensuel d’un programme L’IA non urgente bascule en mode scripté ; les garde-fous ne s’éteignent pas Le téléphone du citoyen, hors ligne Notes vocales et photos attendent dans l’appareil et repartent seules, sans doublon Un canal de notification Bascule d’un canal à l’autre, avec relances et événements de livraison Le quatrième cas mérite d’être explicité, parce qu’il est le plus souvent mal conçu ailleurs. La consommation d’intelligence artificielle est mesurée en unités normalisées, indépendantes du vocabulaire commercial des fournisseurs, et chaque programme dispose d’un plafond mensuel. Quand ce plafond est atteint, ce qui se dégrade est le confort — la conversation libre, la reformulation, le résumé — jamais la sécurité. Les urgences ne sont jamais dégradées, et pour une raison structurelle : le chemin d’urgence ne dépend d’aucun appel payant. Ce qui n’est pas encore en place Publier ses manques fait partie des garde-fous d’une IA de service public, au même titre que les règles elles-mêmes. À ce jour : Les six comités de revue ne sont pas constitués. Comité de revue clinique , comité de protection de l’enfance et d’éducation, comité de contenu agricole, comité d’inclusion linguistique, comité d’éthique des données, comité de risque modèle : la structure de données qui enregistre leurs décisions existe, les versions de protocoles portent la mention d’un approbateur en attente et non le nom d’une personne. Aucun contenu de santé ne doit atteindre la production dans cet état. Le cloisonnement au niveau des lignes de la base de données est prévu pour une phase ultérieure. Il est aujourd’hui appliqué par l’application et non par le moteur de base de données : c’est le point de sécurité ouvert le plus important du programme. Aucun audit indépendant n’a eu lieu. Ni sur la sécurité, ni sur l’ accessibilité , ni sur la conformité des traitements. Les vérifications décrites ici sont internes et automatisées ; elles ne remplacent pas un tiers. Le corpus adverse multilingue complet reste à constituer. Chaque garde-fou déterministe dispose de ses tests ciblés, mais les campagnes systématiques dans les cinq langues sont encore partielles. Le déploiement par paliers et le retour arrière automatiques sont prévus plus tard ; ces deux étapes sont opérées manuellement aujourd’hui. L’export quotidien du journal vers un stockage froid n’est pas encore en place. Ce qui précède est vérifiable dans le code et dans les tests, pas seulement affirmé. Le détail des décisions, de leurs responsables et de ce qui en reste est publié sur la page sécurité et gouvernance , et l’ambition générale du service sur la page du programme . Un garde-fou dont personne ne peut vérifier l’existence n’est pas un garde-fou : c’est une promesse.","date_published":"2026-09-06T00:00:00.000Z","date_modified":"2026-09-10T00:00:00.000Z","authors":[{"name":"Direction technique CONGO VOICE AI OS"}],"tags":["Sécurité et gouvernance","Gouvernance","Sécurité","Audit","Transparence","RDC"],"language":"fr-CD","_cvos":{"cluster":"gouvernance-ia","pillar":true,"entities":["règles déterministes","moteur de protocoles","niveau de gravité","journal d’audit","chaîne de hachage","passerelle IA","comités de revue","supervision humaine","mode dégradé","ancrage documentaire"],"takeaways":["La sécurité n’est pas confiée au modèle : détection des signes de danger, niveau de gravité, escalade et texte d’urgence relèvent de règles écrites, versionnées et rejouables.","Le système peut relever une gravité, jamais l’abaisser ; seule une personne habilitée peut la réduire, avec un motif écrit conservé à côté de la valeur d’origine.","Une recommandation sans source approuvée n’est pas servie : un texte de repli la remplace, une violation de contrat est enregistrée et une revue humaine devient obligatoire.","Le journal d’audit est chaîné par empreintes et vérifié chaque jour ; une ligne modifiée, supprimée ou insérée après coup est détectée et alerte un responsable."],"wordCount":2153}},{"id":"https://congovoicecd.com/blog/ia-educative-vocale-tenafep","url":"https://congovoicecd.com/blog/ia-educative-vocale-tenafep","title":"Révision vocale pour le TENAFEP : apprendre en parlant","summary":"La révision vocale pour le TENAFEP en zone rurale : boucle enseigner-vérifier-adapter, quiz oraux corrigés au barème, répétition espacée et règles de protection.","content_text":"Dans beaucoup d'écoles rurales de la République Démocratique du Congo, un manuel est partagé entre plusieurs élèves, l'électricité s'arrête à la tombée du jour et la personne qui pourrait faire réciter la leçon n'a pas elle-même terminé le primaire. C'est dans ce contexte que la révision vocale pour le TENAFEP prend son sens : un élève de sixième primaire parle à un téléphone simple, on lui pose des questions, on l'écoute, on corrige, on revient quelques jours plus tard sur ce qu'il n'a pas retenu. Ce texte décrit comment ce module est construit, et surtout ce qu'il refuse de faire. Réviser à voix haute quand il n'y a ni manuel ni électricité Trois contraintes de terrain ont décidé de l'architecture bien plus que les préférences pédagogiques. La voix d'abord. Un élève qui déchiffre lentement ne révisera pas en lisant un écran. Il révise en parlant et en écoutant, dans la langue où il comprend le mieux — français, lingala , kikongo , kiswahili ou tshiluba . Des séances courtes. Une explication parlée est plafonnée à quatre-vingt-dix secondes, soit environ deux cent vingt-cinq mots. Au-delà, la personne décroche, la batterie descend et le crédit s'épuise. Des canaux modestes. L' appel vocal , le message WhatsApp et l'USSD sont des points d'entrée de plein droit, décrits sur la page des moyens d'accès au service . Rien n'exige un téléphone récent. Le module est rattaché au programme national : chaque séance est accrochée à un objectif codé du curriculum, avec sa classe, sa matière, ses prérequis et son poids dans les examens nationaux. C'est ce rattachement qui permet de dire « cet élève travaille les fractions de quatrième primaire », plutôt que de porter un jugement sur l'élève lui-même. Matière Objectif de fin de primaire Ce que le service fait vérifier Mathématiques Proportionnalité et pourcentage Résoudre un problème simple, calculer un pourcentage Mathématiques Nombres décimaux Lire, comparer et additionner des décimaux Mathématiques Périmètre et aire Calculer sur un rectangle et un carré Français Futur simple et accord sujet-verbe Conjuguer et accorder à l'oral Français Rédaction courte Construire dix lignes avec introduction et conclusion Sciences Alimentation et santé Composer un repas équilibré avec des aliments locaux Histoire-géographie Géographie et histoire de la RDC Situer provinces, fleuves et grandes étapes La boucle enseigner, vérifier, adapter Une séance ne se termine pas sur une explication. Elle suit une boucle en trois temps, répétée jusqu'à ce que la notion tienne. Enseigner. Une micro-explication, un exemple ancré dans la vie locale — un champ, un marché, un trajet — puis une tentative guidée où l'élève est accompagné pas à pas. Vérifier. Une tentative autonome, ou un court quiz oral. C'est le seul moment qui produit une donnée d'apprentissage. Adapter. Selon le résultat, le service revient sur le prérequis manquant, propose une variante, ou passe à la suite et programme une révision espacée. Deux règles encadrent cette boucle. D'abord, le profil de l'élève est confirmé, jamais deviné . Le niveau, l'âge et la langue d'explication sont demandés ; tant qu'ils ne sont pas confirmés, le service enseigne à un niveau intermédiaire prudent et plafonne lui-même sa confiance. Ensuite, la trace enregistrée décrit un moment, pas un enfant : « tentative sur les fractions, réussie avec aide, le 14 mai », et non « élève faible en mathématiques ». La différence est essentielle pour un service public qui parle à des mineurs. Comment un quiz oral est-il corrigé sans que la machine tranche à l'aveugle ? La génération des questions est un travail de modèle ; la correction n'en est pas un. Une réponse orale passe par une chaîne déterministe, testée, qui donne toujours le même verdict pour la même réponse. La normalisation d'une réponse parlée Un élève ne répond pas « 0,5 ». Il répond « euh, je pense que ça fait la moitié, madame ». La normalisation retire les accents, les hésitations et les formules de politesse, convertit les nombres écrits en lettres, transforme les fractions dites en toutes lettres — « la moitié » devient un demi, « trois sur quatre » devient trois quarts — et remplace la virgule décimale par un point quand elle sépare deux chiffres. La comparaison est ensuite tolérante là où il le faut : deux fractions équivalentes sont acceptées comme égales, un écart numérique de un pour cent est admis, et une bonne réponse noyée dans une phrase plus longue est reconnue. Un élève n'est jamais sanctionné pour la forme de sa parole. Le barème et les erreurs typiques Chaque question porte trois éléments écrits à l'avance : la réponse attendue, un critère de réussite, et une liste d'erreurs fréquentes avec leur explication. La correction s'appuie sur ces trois éléments. Résultat Ce qui le déclenche Ce que l'élève entend Acquis La réponse correspond, à la tolérance près Une confirmation, puis le critère atteint Partiel L'idée est là, la forme ne l'est pas Le critère visé, un indice, puis la réponse attendue Erreur typique reconnue La réponse correspond à une erreur déclarée Le nom de l'erreur, pourquoi elle est fréquente, comment l'éviter À reprendre Rien ne correspond Une reprise calme, le critère, un indice, la réponse L'élève n'entend jamais un « faux » sec. Le retour nomme toujours le critère à atteindre — c'est ce qui distingue une correction utile d'une note. Sur l'ensemble du quiz, un score d'au moins quatre-vingts pour cent signale une notion acquise, cinquante pour cent une notion en cours, en dessous une notion à reprendre depuis le début. Les devoirs : l'indice avant la réponse Un service qui donne les réponses des devoirs détruit exactement ce qu'il prétend soutenir : l'apprentissage de l'élève et la capacité de l'enseignant à voir où il en est. La règle est donc écrite dans le code, pas confiée au jugement du modèle. Quand la demande porte sur un travail noté — devoir, interrogation, contrôle du lendemain — et qu'aucune tentative n'est détectée dans ce que l'élève a dit, la réponse finale est retenue. L'élève reçoit à la place : une phrase qui explique pourquoi la réponse est retenue, sans reproche ; des indices ordonnés du plus léger au plus fort , du type « relis l'énoncé et dis à voix haute ce qu'on te demande » avant toute piste technique ; un exemple entièrement résolu sur un exercice semblable , jamais sur le sien ; une invitation explicite à essayer maintenant et à revenir dire ce qu'il a trouvé. Dès qu'une tentative est exprimée, la séance redevient normale : correction complète, critère de réussite, erreur typique nommée s'il y en a une. Ce sont des devoirs avec indices avant réponse, et non un service de corrigés. Un plan de révision qui compte les semaines qui restent Un élève qui prépare le TENAFEP n'a pas besoin d'un cours de plus. Il a besoin de savoir quoi travailler cette semaine. Le plan part d'une donnée simple : le nombre de semaines entre aujourd'hui et la date de l'examen, calculé à partir du profil confirmé. Sans date connue, le plan est construit sur six semaines par défaut, et le service le dit. Chaque semaine porte trois choses : un petit nombre de points à travailler, des activités concrètes réalisables sans manuel, et un point de contrôle qui permet de savoir si la semaine a servi. Une routine quotidienne courte complète l'ensemble. Le plan n'est pas un document que personne ne relira : il alimente des rappels programmés, envoyés au fil des semaines, dans la langue de l'élève. La même mécanique sert pour l'Examen d'État en fin de secondaire. La répétition espacée, réglée pour l'oral Réviser une fois ne suffit pas ; réviser tous les jours la même chose est un gaspillage. Le module utilise une variante déterministe de l'algorithme SM-2, réglée pour des séances orales courtes sur un téléphone d'entrée de gamme. Étape Intervalle avant la révision suivante Remarque 1re réussite 1 jour Reprise rapide, la notion est fragile 2e réussite 3 jours Consolidation 3e réussite 7 jours La notion tient une semaine Réussites suivantes Intervalle précédent multiplié par le facteur de facilité Facteur borné entre 1,3 et 2,6 Échec de rappel Retour à 1 jour Le compteur de réussites est remis à zéro Le facteur de facilité part de 2,5 et bouge lentement, à la hausse comme à la baisse. Une réussite obtenue avec de l'aide compte moins qu'une réussite autonome : la qualité du rappel est diminuée d'un cran, ce qui rapproche mécaniquement la révision suivante. Cette répétition espacée pour élèves ruraux ne suppose ni application installée, ni connexion permanente : c'est une date de rappel, et un message vocal ce jour-là. Le mode parent, sans les mots de l'enfant Un parent a le droit de savoir comment son enfant progresse. L'enfant a le droit que ses phrases ne soient pas rapportées. Le point d'étape destiné au parent contient donc cinq éléments : les matières travaillées, les points forts, ce qui reste à retravailler, deux ou trois activités à faire à la maison, et un encouragement. Avant d'être prononcé, il passe par un filtre qui supprime toute phrase reprenant une suite d'au moins six mots consécutifs dits par l'enfant . Ce n'est pas une paraphrase demandée poliment au modèle : c'est une règle appliquée sur le texte produit. Trois autres limites s'appliquent au mode parent sans transcription verbatim : aucune étiquette durable n'est posée sur l'enfant, aucune comparaison avec d'autres élèves n'est produite, et les finalités comme les durées de conservation relèvent de la page consacrée à la protection des données . Les règles de protection de l'enfance Trois filtres déterministes s'exécutent avant, pendant et après l'enseignement. Contenu réservé aux adultes. Sujets sexuels, drogues, alcool, armes, jeux d'argent : le service n'explique pas, il redirige vers un adulte de confiance — un parent, un enseignant, l'infirmier du centre de santé — et propose de revenir à une leçon. Aucune persuasion commerciale. Le service est gratuit et ne vend rien. Une phrase qui pousse à acheter, à s'abonner ou qui cite une marque est supprimée, pas reformulée. Cette règle s'applique aussi à ce que le modèle produit. Divulgation grave. Violence, exploitation, négligence, mariage forcé, pensées suicidaires : la leçon s'arrête. Une réponse écrite à l'avance est lue, un dossier à accès restreint est ouvert pour une personne formée, et aucun détail ne circule dans les notifications ordinaires. Le service ne demande jamais de détails à l'enfant. Ces règles sont écrites dans le code, testées, et ne dépendent d'aucun modèle. Elles reprennent la même philosophie que le reste de la plateforme : ce qui protège une personne ne relève pas de la bonne volonté d'un moteur génératif. Ce que nous ne savons pas encore faire Les explications en langues nationales restent des versions de travail pour les notions techniques ; le vocabulaire mathématique en kikongo et en tshiluba est particulièrement fragile, un sujet traité dans le guide sur l'IA vocale en langues congolaises . Aucun résultat d'apprentissage n'est publié. Les gains réels sur les acquis des élèves ne pourront être mesurés qu'après un pilote suivi avec des enseignants, en comparant des groupes comparables. Les travaux de l'UNESCO et les analyses de la Banque mondiale rappellent que l'accès à un outil ne produit pas mécaniquement de l'apprentissage. La reconnaissance vocale des enfants est plus difficile que celle des adultes : voix aiguës, débit irrégulier, bruit de fond scolaire. Les seuils par langue et par canal sont publiés sur la page des langues nationales . Le service ne certifie rien. Il ne délivre ni note officielle, ni attestation, et n'intervient pas dans l'organisation des examens nationaux. Une révision vocale pour le TENAFEP réussie ne se mesurera pas au nombre de questions posées, mais à trois choses : un élève qui revient de lui-même, un enseignant qui voit enfin où sa classe bloque, et un parent qui sait quoi faire le soir sans avoir à lire un rapport. Le détail des trois services du programme est décrit sur la page des services .","date_published":"2026-09-05T00:00:00.000Z","date_modified":"2026-09-10T00:00:00.000Z","authors":[{"name":"Direction technique CONGO VOICE AI OS"}],"tags":["Éducation","Éducation","TENAFEP","Apprentissage vocal","Protection de l'enfance","RDC"],"language":"fr-CD","_cvos":{"cluster":"education-vocale","pillar":true,"entities":["TENAFEP","quiz oral","répétition espacée","programme national","mode parent","protection de l'enfance","objectif pédagogique","apprentissage vocal","élève rural"],"takeaways":["Un élève rural peut réviser à voix haute depuis un téléphone simple, sans manuel, sans connexion continue et sans savoir lire couramment.","Le quiz oral est corrigé par des règles : normalisation de la réponse parlée, tolérance numérique, puis rapprochement avec les erreurs typiques déclarées.","Devant un travail noté, le service donne des indices et un exemple résolu voisin, jamais la réponse tant que l'élève n'a pas essayé.","Le résumé destiné au parent ne reprend jamais les mots exacts de l'enfant, et une divulgation grave interrompt la leçon au lieu de la poursuivre."],"wordCount":1915}},{"id":"https://congovoicecd.com/blog/chenille-legionnaire-mais","url":"https://congovoicecd.com/blog/chenille-legionnaire-mais","title":"Chenille légionnaire d’automne sur le maïs : que faire","summary":"Reconnaître les dégâts de la chenille légionnaire d’automne sur le maïs, compter sur cinquante plants, agir sans dépense et savoir quand alerter l’agent.","content_text":"Un champ de maïs troué en quelques nuits provoque deux réflexes : acheter n’importe quoi au marché, ou ne rien faire. Les deux coûtent cher. La chenille légionnaire d’automne sur le maïs se combat d’abord par l’observation et par des gestes qui ne demandent aucune dépense, et la décision d’aller plus loin repose sur un comptage précis, pas sur une impression. Ce texte explique ce que le service répond à un producteur qui décrit ces dégâts au téléphone, quelles règles sont écrites dans le code, et pourquoi il refuse de nommer un produit tant qu’une correspondance homologuée n’est pas vérifiée. Reconnaître les dégâts avant de chercher la chenille Le ravageur est arrivé récemment en Afrique centrale et il a une habitude qui le rend reconnaissable : la chenille se cache au fond du cornet du plant, mange les jeunes feuilles encore enroulées, et laisse derrière elle une sciure humide qui ressemble à de la sciure de bois. Les signes, dans l’ordre où ils apparaissent De petits trous alignés sur les jeunes feuilles, souvent en rangées régulières, parce que la feuille était enroulée quand elle a été mangée. De grands trous irréguliers ensuite, à mesure que la chenille grossit et que la feuille se déploie. Une sciure claire et humide dans le cornet , le signe le plus fiable de tous, visible même quand la chenille est introuvable. La chenille elle-même , de couleur variable, avec deux repères constants : quatre points noirs formant un carré sur l’avant-dernier segment, et un Y renversé clair sur la tête. Ce avec quoi on la confond Un plant grignoté par des criquets ou des sauterelles montre des morsures sur le bord du limbe, pas une sciure dans le cornet. Une attaque de foreurs de tige perce la tige et non le cornet. Une brûlure d’engrais mal enfoui dessèche le bord des feuilles sans les trouer. Le service demande donc au moins une photo du cornet, prise de jour, à environ trente centimètres, en plus de la description : c’est le même protocole d’image que pour les maladies foliaires du manioc . Pourquoi compter cinquante plants plutôt que regarder un plant abîmé ? Un producteur devant trois plants dévastés surestime presque toujours l’infestation, et c’est ainsi que se déclenchent des achats inutiles. Le seuil de décision retenu par les fiches approuvées repose donc sur un comptage simple, réalisable en une vingtaine de minutes et sans matériel. La méthode tient en trois phrases : inspecter cinq groupes de dix plants pris au hasard dans la parcelle, soit cinquante plants ; compter ceux dont le cornet est attaqué ; comparer au seuil. Le comptage se refait une semaine après toute intervention, pour vérifier qu’elle a servi. Ce chiffre est aussi ce que le service demande au producteur de rapporter. À la fin de chaque échange, une consigne de suivi est formulée : ce qu’il faut observer, sur combien de plants, et à quelle date revenir. C’est la seule mesure de terrain dont dispose ensuite l’ agent agricole , et c’est elle qui permet de dire si une intervention a marché ou si la parcelle continue de se dégrader. Un signalement qui contient un comptage daté vaut, pour le réseau agricole, bien plus qu’une photo isolée. Résultat du comptage sur cinquante plants Ce que fait le producteur Ce que fait le service Moins de 10 plants attaqués (moins de 20 %) Ramassage manuel, sable ou cendre dans le cornet, sarclage Actions sans dépense, suivi à une semaine, aucun produit évoqué 10 plants attaqués ou plus (20 % et plus) Renforcement par une intervention localisée sur le cornet Orientation vers l’agent agricole avant tout achat Attaque après la floraison mâle Ne plus traiter Explique que le rendement est déjà fixé et que le risque de résidus augmente Plus de la moitié de la parcelle atteinte Prévenir immédiatement Cas marqué urgent, agent agricole saisi quelle que soit la confiance Premier foyer dans un village indemne Signaler sans attendre le seuil Alerte déclenchée : ravageur à déclaration obligatoire Le seuil de vingt pour cent n’est pas une opinion du modèle : il vient d’une fiche technique versionnée, approuvée, citée dans la réponse. Ces repères de comptage sont ceux que diffusent les guides de gestion intégrée de l’Organisation des Nations unies pour l’alimentation et l’agriculture , reprises par les réseaux de santé des plantes animés par CABI . Que faire d’abord, sans dépenser un franc C’est le premier des trois niveaux d’action du service, et il n’est jamais sauté. Face à la chenille légionnaire d’automne sur le maïs, cinq gestes gratuits ont un effet mesurable : Inspecter tôt le matin ou en fin de journée , quand les chenilles remontent dans le cornet et deviennent visibles. Ramasser les chenilles à la main et les écraser, ou les donner aux volailles. Sur une petite parcelle, c’est la mesure la plus efficace des cinq. Verser une pincée de sable sec ou de cendre de bois dans le cornet des plants attaqués : la chenille supporte mal le contact abrasif. Sarcler et détruire les graminées adventices autour du champ, qui servent de relais au ravageur. Semer en même temps que les voisins. Un champ semé en retard concentre les pontes de toute la zone ; la synchronisation des semis est une mesure collective, gratuite, et sous-estimée. À ces gestes s’ajoute une liste de ce qu’il ne faut pas faire, aussi importante que la précédente : ne pas traiter le champ en couverture totale, ne pas mélanger plusieurs produits, ne pas traiter après la floraison mâle, ne pas réutiliser un emballage de produit pour l’eau ou la nourriture. Les petits moyens locaux, deuxième niveau Quand le comptage justifie de renforcer, le service propose ce qui se trouve au village ou au marché voisin avant tout achat de produit chimique. Deux leviers figurent dans les fiches approuvées. L’ extrait de feuilles de neem , pulvérisé en fin de journée directement dans le cornet, agit surtout sur les jeunes chenilles ; il demande d’être renouvelé et perd son effet après une forte pluie. Les associations culturales — maïs et niébé, maïs et arachide — favorisent les ennemis naturels du ravageur : fourmis, punaises prédatrices, guêpes parasitoïdes. Ces auxiliaires font une part du travail gratuitement, et c’est précisément eux qu’un traitement en couverture totale détruit en premier. C’est la logique de la lutte intégrée contre les ravageurs du maïs : additionner des moyens modestes plutôt que chercher une solution unique. Deux précisions honnêtes accompagnent ce niveau. La première est que l’extrait de neem préparé à la maison n’a pas une concentration connue : son effet varie avec la fraîcheur des feuilles, la quantité d’eau et le moment de l’application. Le service le présente donc comme un appui, jamais comme un traitement calibré. La seconde est que ces moyens agissent sur les jeunes chenilles ; passé un certain stade, la chenille est trop grosse et trop profondément installée dans le cornet pour qu’une pulvérisation change quelque chose. C’est une raison de plus pour inspecter tôt, dès la levée, plutôt que d’attendre que les dégâts soient spectaculaires. Pourquoi le service refuse de nommer un pesticide C’est la règle la plus stricte du module agricole, et elle vaut aussi pour la chenille légionnaire d’automne sur le maïs. Toute phrase de conseil qui mentionne un insecticide, un fongicide, un herbicide, un engrais minéral ou un produit vétérinaire est confrontée au registre officiel des intrants tenu par la plateforme, avant d’être servie au producteur. Si le registre classe le produit comme homologué , la phrase est conservée, mais quatre informations lui sont ajoutées d’office : le mode d’emploi de l’étiquette, l’équipement de protection obligatoire, le délai avant récolte ou consommation, et le délai avant de retourner dans la parcelle traitée. Si le produit est interdit en République Démocratique du Congo, il n’est nommé que pour être déconseillé explicitement. Si le produit est réservé au vétérinaire ou à un professionnel , la réponse le dit et précise qu’il ne s’achète pas au marché. Si aucune correspondance homologuée n’est trouvée , la phrase est supprimée. Elle est remplacée par des actions non chimiques et par une orientation : n’achetez rien sur simple conseil, passez par l’agent agricole de votre secteur, qui confirmera et, si un produit est nécessaire, indiquera lequel et à quelle dose. Quand un doute subsiste entre deux entrées du registre, c’est la plus restrictive qui l’emporte : le blocage plutôt que l’autorisation. Le service ne calcule jamais une dose, n’adapte jamais une dose à une surface, et n’invente jamais un prix d’achat. Cette contrainte est détaillée dans le guide de l’ IA agricole vocale pour les petits producteurs et sur la page publique des services . Il faut assumer la conséquence : sur cette question, le service est délibérément moins bavard qu’un vendeur de marché. Un nom de produit prononcé au téléphone, sans que personne n’ait vu la parcelle, produit des achats inadaptés, des dosages approximatifs, des intoxications et des résidus dans une récolte destinée à la famille. Comment des signalements répétés ouvrent un foyer à valider La chenille légionnaire figure sur la liste des ravageurs à déclaration obligatoire tenue par la plateforme. Un seul signalement suffit donc à prévenir le réseau agricole du secteur, même si la parcelle concernée est peu touchée, et il est demandé au producteur de ne pas déplacer de matériel végétal hors de la parcelle avant le passage de l’agent. La détection de foyers agricoles ajoute une seconde couche, purement statistique et entièrement déterministe. Quand au moins cinq signalements décrivent le même problème sur la même culture, dans le même territoire — ou à défaut la même province — sur une fenêtre glissante de quatorze jours, un foyer est ouvert avec le statut « non vérifié », un événement est enregistré et les agents concernés sont alertés. Trois garanties encadrent ce mécanisme : La plateforme ne déclare jamais une infestation régionale. Elle ouvre un dossier ; un agent qualifié le confirme, le met en revue, le rejette ou le clôt. Un foyer trop peu documenté est publié sans son territoire , afin qu’une poignée d’exploitations ne puisse pas être identifiée. Les seuils sont des paramètres , modifiables par l’autorité agricole sans changement de code : cinq signalements et quatorze jours sont des valeurs par défaut, pas une vérité. Pour le producteur, l’intérêt est direct : un foyer confirmé oriente les tournées des agents et les distributions de semences vers les zones réellement touchées, au lieu de les répartir à l’aveugle. Ce que le service ne fait pas, et ce qui manque encore Il ne confirme pas une identification à partir d’une seule photo : au-dessous de soixante pour cent de confiance, l’hypothèse reste une correspondance possible et une deuxième image est demandée ; au-dessous de quarante pour cent, un agent est saisi. Il ne prescrit aucun produit , ne calcule aucune dose et n’indique aucun prix d’intrant. Il ne remplace pas le comptage. Aucune analyse d’image ne donne le pourcentage de plants attaqués dans une parcelle ; seul le producteur peut le mesurer. Le comité de contenu agricole n’est pas encore constitué : les fiches et le registre portent la mention d’un approbateur en attente. C’est une condition de lancement, décrite sur la page sécurité et gouvernance . La couverture du registre reste partielle et le programme n’a pas arrêté de calendrier de mise en correspondance complète avec l’homologation nationale. Le service se juge donc sur un critère simple : est-ce que le producteur a fait le comptage, appliqué les gestes gratuits et joint l’agent agricole quand il le fallait ? Les autres canaux d’accès, y compris le menu à touches pour les téléphones simples, sont présentés sur la page d’accès au service .","date_published":"2026-09-04T00:00:00.000Z","date_modified":"2026-09-10T00:00:00.000Z","authors":[{"name":"Direction technique CONGO VOICE AI OS"}],"tags":["Agriculture","Agriculture","Maïs","Ravageurs","Lutte intégrée","RDC"],"language":"fr-CD","_cvos":{"cluster":"agriculture-vocale","pillar":false,"entities":["chenille légionnaire d’automne","maïs","cornet du maïs","lutte intégrée","extrait de neem","ramassage manuel","ennemis naturels","maladies à déclaration obligatoire","agent agricole","registre des intrants"],"takeaways":["Le signe le plus fiable n’est pas la chenille mais la sciure humide et claire dans le cornet, accompagnée de trous alignés puis irréguliers sur les jeunes feuilles.","La décision se prend sur un comptage de cinquante plants, pris en cinq groupes de dix au hasard, et non sur l’impression laissée par un plant abîmé.","En dessous de dix plants attaqués sur cinquante, le ramassage manuel suffit ; au-delà, l’intervention se renforce et l’agent agricole est prévenu.","Le service ne nomme aucun produit qui ne corresponde pas à une entrée homologuée du registre, et jamais sans passer par un agent qualifié."],"wordCount":1887}},{"id":"https://congovoicecd.com/blog/code-switching-francais-lingala","url":"https://congovoicecd.com/blog/code-switching-francais-lingala","title":"Code-switching français lingala : traiter la vraie parole","summary":"Le code-switching français lingala est la norme : étiquetage par portion d'énoncé, transcription d'origine conservée, forme française canonique et glossaire imposé.","content_text":"« Mwana na ngai azali na fièvre banda mikolo mibale. » Cette phrase, ordinaire à Kinshasa , contient du lingala , un mot français au milieu, et une durée exprimée dans la langue que la personne a sous la main. Un service public vocal qui traite cet énoncé comme monolingue se trompe dès la première étape. Ce texte décrit comment le programme traite le mélange des langues sans le corriger : ce qui échoue quand on force un choix, comment étiqueter la langue portion par portion, pourquoi conserver la transcription d'origine à côté d'une forme française canonique, comment contraindre la restitution par un glossaire, et ce que tout cela change pour une consigne de sécurité. Pourquoi le code-switching français lingala est la norme, pas l'exception Le mélange n'est pas un accident de parole ni un signe de maîtrise imparfaite. C'est le registre normal d'une grande partie du pays, avec une répartition assez régulière des rôles : la trame de la phrase en langue nationale, les termes techniques, scolaires, administratifs et médicaux en français, les nombres et les dates dans l'une ou l'autre selon l'habitude. Trois conséquences en découlent pour un système. Un menu de langue à l'entrée ne filtre rien. La personne choisit « lingala », puis prononce « fièvre », « tension », « division », « examen ». Le choix décrit une préférence de réponse, pas la composition de l'énoncé. L' identification de la langue au niveau du message est instable. Un même appel peut basculer d'une étiquette à l'autre selon la portion écoutée. Une étiquette unique avec une confiance moyenne est une information de mauvaise qualité présentée comme certaine. Corriger le mélange détruit de l'information. Normaliser « fièvre » en une graphie lingala approximative, ou basculer toute l'hypothèse vers le français, fait perdre soit le terme médical, soit le reste de la phrase. Un service qui exige de choisir une langue avant de parler exclut la manière normale de s'exprimer de millions de personnes. Le menu par touches reste utile — pour la langue de la voix de réponse, pour le mode guidé, pour les personnes qui préfèrent naviguer plutôt que parler — mais il n'est jamais une condition d'entrée. Étiqueter la langue au niveau de la portion d'énoncé L'unité de travail n'est donc pas le message, mais la portion : un segment continu de parole assez court pour porter une seule langue, en pratique un groupe de mots ou une proposition. Chaque portion reçoit une étiquette et une probabilité. Le message, lui, porte une langue dominante et la liste des autres langues présentes. Approche Ce qu'elle produit sur l'exemple d'ouverture Ce qu'elle coûte Étiquette unique par message « lingala », confiance moyenne, « fièvre » transcrit de travers Perte du terme médical, extraction d'entités bruitée Bascule vers le français Une phrase française approximative, le reste effacé Perte du sens principal, orientation faussée Étiquetage par portion Trois portions : lingala, français, lingala, chacune avec sa probabilité Traitement plus complexe, traces plus lourdes Le coût de la troisième approche est réel : plus de champs à stocker, plus de cas à tester, une interface de relecture plus riche. Le bénéfice l'est aussi : l'extraction des entités qui décident — durée en jours, âge en mois, personne concernée — devient beaucoup plus fiable quand le terme est reconnu dans la langue où il a été prononcé. Les modèles ouverts de reconnaissance vocale , comme le modèle Whisper publié par OpenAI ou les travaux de Meta AI sur la parole massivement multilingue , donnent un point de départ pour l'identification de la langue ; ils ne fournissent pas d'eux-mêmes cette granularité, qui relève de la manière dont le service découpe et enregistre. Deux règles pratiques encadrent l'étiquetage. La première : une portion dont la probabilité est basse est signalée comme telle, pas arrondie vers la langue dominante. La seconde : l'étiquette n'est jamais utilisée comme filtre de sécurité, pour la raison développée plus bas. Une troisième règle relève de la convention d'écriture plutôt que du modèle. Avant la première heure de collecte, il faut décider comment se transcrit un mot français prononcé à l'intérieur d'une phrase en langue nationale : orthographe française d'origine, ou graphie phonétique locale. Le programme retient l'orthographe française, avec l'étiquette de portion pour marquer le changement de langue. Ce choix est arbitraire au sens strict, mais il doit être écrit et appliqué par tous les relecteurs : sans convention commune, le désaccord entre annotateurs se transforme en bruit d'apprentissage impossible à distinguer d'une erreur du système. La même question se pose pour les nombres, les dates et les noms de lieux, et elle reçoit la même réponse : une règle écrite, une seule, appliquée partout. Conserver la transcription d'origine à côté de la forme française canonique Le français est la langue pivot du service : les protocoles, les documents approuvés, les règles de sécurité et les journaux d'audit sont écrits en français. Tout message est donc rendu sous une forme française canonique , utilisée pour le raisonnement métier, la lecture par un agent de terrain et la vérification a posteriori. Cette forme canonique ne remplace pas la transcription d'origine. Les deux sont stockées ensemble, avec la langue de chaque portion, la confiance, la province , le module et l'horodatage. Les raisons sont concrètes. Une traduction est une interprétation. Quand une escalade est contestée, ce qui compte est ce que la personne a dit, pas ce que le système en a compris. La relecture ne peut pas travailler sur une traduction. Un relecteur natif corrige trois choses distinctes : la transcription, le sens en français, et la langue reconnue. Confondre ces trois erreurs dans un seul champ rend le corpus inexploitable pour l'apprentissage, comme l'explique le guide sur la constitution d'un corpus vocal en langues nationales . Les termes locaux ne survivent qu'à l'original. Les noms de maladies, de plantes, de gestes et de symptômes alimentent le lexique. Une traduction lissée les efface. L'audit exige la source. Un service public doit pouvoir montrer l'enchaînement complet : audio, transcription d'origine, étiquettes, forme française, décision, action. Rendre la réponse avec un glossaire imposé En sortie, le mouvement est inverse : une réponse écrite en français simple est rendue dans la langue dominante de la personne, prête à être lue à voix haute. Trois contraintes s'appliquent. Les termes sans équivalent courant restent en français, entre parenthèses. Inventer un néologisme médical dans une langue peu dotée est un risque de sécurité, pas une prouesse linguistique. Le glossaire est imposé, pas suggéré. Les termes médicaux et agricoles vérifiés par les relecteurs sont fournis à chaque restitution, avec leur sens et leur prononciation. Le rendu suit le glossaire ; il ne le réinvente pas à chaque appel. Les textes critiques ne sont jamais traduits par une machine. Message d'urgence, avertissement de non-substitution, consignes pendant le trajet vers un centre de santé, menus vocaux : ce sont des textes fixes, rédigés et relus dans les cinq langues, puis figés. Ils sont prononcés à l'identique quel que soit l'état des fournisseurs. La conduite à tenir devant un signe de danger en fait partie. Le service ne cherche pas à imiter le mélange exact de son interlocuteur. Répondre dans la langue dominante, avec les termes techniques en français entre parenthèses, est plus clair et plus vérifiable qu'une imitation stylistique dont personne ne saurait mesurer la justesse. Qu'est-ce que le code-switching français lingala change pour une consigne critique ? C'est ici que le sujet cesse d'être linguistique. Une consigne de sécurité — reconnaître un signe de danger , dire d'aller immédiatement au centre de santé, refuser de donner une dose — ne peut pas dépendre d'une étiquette de langue qui a une chance sur vingt d'être fausse. Le programme applique donc quatre règles. La détection travaille sur la transcription brute. Les listes de termes d'alerte couvrent le français et les quatre langues nationales simultanément, avec leurs variantes parlées. Un énoncé mixte est balayé par toutes les listes à la fois ; aucune étiquette de langue n'est utilisée pour choisir la liste. La détection précède le modèle. Elle s'exécute avant tout appel à un modèle de langage. Si tous les fournisseurs sont indisponibles, la détection et le script d'urgence fonctionnent encore. Le mécanisme est détaillé dans l'article sur la détection automatique des signes de danger . Le silence n'est jamais un « non ». Une portion non comprise est marquée non comprise. L'absence d'un signe de danger dans une phrase à moitié transcrite n'autorise aucune conclusion rassurante. Aucune dose, aucun diagnostic, quelle que soit la langue. Les protocoles suivis s'appuient sur les référentiels de prise en charge diffusés par l'Organisation mondiale de la santé et portent la mention « en attente du comité de revue clinique » tant que ce comité n'est pas constitué. Formulé autrement : le mélange des langues est traité comme une richesse à comprendre en entrée, et comme un risque à neutraliser en sortie. Ce sont deux régimes différents appliqués au même énoncé. Mesurer le code-switching français lingala, pas seulement la langue dominante Un tableau de bord qui n'affiche que l'exactitude de l'identification de la langue passe à côté du sujet. Les mesures suivies sont plus précises. Mesure Ce qu'elle révèle Pourquoi elle existe Part d'énoncés contenant au moins deux langues L'ampleur réelle du phénomène par province et par module Cadre le dimensionnement du corpus Exactitude de l'étiquetage par portion Qualité du découpage, pas seulement de l'étiquette globale Une portion mal étiquetée casse l'extraction Rappel des entités sur énoncés mixtes Durée, âge, personne concernée, quand la phrase mélange C'est ce qui décide de l'orientation Rappel des situations d'urgence sur énoncés mixtes Le seuil qui ne se négocie pas, mesuré sur le cas difficile Un faux négatif y est inacceptable Part de reformulations acceptées du premier coup Utilité réelle de la question de vérification Distingue « incompris » de « mal reformulé » Ces mesures sont découpées par langue, par province et par canal, et le jeu d'évaluation est annoté séparément du corpus d'entraînement. Les seuils appliqués avant l'ouverture d'une langue dans un module sont publiés sur la page des langues nationales ; la manière dont ils sont établis pour le lingala est détaillée dans l'article consacré à la reconnaissance vocale en lingala . Ce que nous ne savons pas encore faire Le sujet est loin d'être clos, et les limites suivantes sont assumées : L'étiquetage par portion est plus fiable sur les frontières nettes — un mot français isolé dans une phrase lingala — que sur les alternances rapides à l'intérieur d'un groupe verbal. Le mélange français-kikongo et français-tshiluba est beaucoup moins bien traité que le mélange avec le lingala, faute de corpus relu ; ces langues restent les moins dotées du service. Aucune mesure publiée ne compare le service à une référence externe sur des énoncés mixtes : il n'existe pas, à notre connaissance, de jeu d'évaluation public et comparable pour ces paires de langues. Les textes d'interface dans les quatre langues nationales sont des versions de travail, en attente de validation par des linguistes de chaque langue. Le principe qui tient tout l'édifice est simple, et c'est celui que développe le guide complet sur l'IA vocale en langues congolaises : on adapte le système à la façon dont les gens parlent, jamais l'inverse — et quand le système n'est pas sûr d'avoir compris, il le dit et passe la main.","date_published":"2026-09-04T00:00:00.000Z","date_modified":"2026-09-10T00:00:00.000Z","authors":[{"name":"Direction technique CONGO VOICE AI OS"}],"tags":["Langues et parole","Langues","Code-switching","Reconnaissance vocale","Sécurité","RDC"],"language":"fr-CD","_cvos":{"cluster":"langues-peu-dotees","pillar":false,"entities":["code-switching","étiquetage de langue","forme canonique","glossaire médical","lingala","identification de la langue","portion d'énoncé","transcription d'origine","mode guidé"],"takeaways":["Demander « choisissez votre langue » au début d'un appel ne règle rien : la personne choisit une langue puis parle dans deux.","L'unité d'étiquetage n'est pas le message mais la portion d'énoncé, avec une probabilité par portion.","La transcription d'origine est conservée telle quelle ; la forme française canonique sert au traitement, à l'audit et à la lecture par un humain — elle ne la remplace pas.","La détection des signes de danger travaille sur la transcription brute, avant traduction et avant tout appel à un modèle, précisément parce que l'étiquette de langue peut être fausse."],"wordCount":1817}},{"id":"https://congovoicecd.com/blog/escalade-relais-communautaires","url":"https://congovoicecd.com/blog/escalade-relais-communautaires","title":"Escalade vers les relais communautaires : cas et délais","summary":"L'escalade vers les relais communautaires, expliquée : machine à états d'un cas, routage par territoire, délais de 15 minutes à 24 heures et correction humaine.","content_text":"Le triage produit une phrase. L' escalade produit une responsabilité. C'est une différence de nature : tant qu'aucun humain n'a un nom, une file et une horloge, un service vocal de santé n'a rien fait d'autre que parler. Ce texte décrit comment fonctionne l' escalade vers les relais communautaires dans CONGO VOICE AI OS — le cycle de vie d'un cas, la façon dont il trouve la bonne personne, les délais annoncés, ce qui se passe quand ils sont dépassés, et le mode de défaillance que la technique ne peut pas corriger. Un cas : une file, un responsable, une horloge Un cas est l'unité de comptabilité du service. Il naît d'une interaction, il porte un module, une province , un territoire, un niveau de gravité , un propriétaire éventuel et une échéance. Son ouverture n'est pas une appréciation : quatre règles déterministes la déclenchent. Le niveau de gravité est supérieur ou égal à 2. Autrement dit, dès qu'une consultation est recommandée, quelqu'un doit pouvoir vérifier qu'elle a eu lieu. La confiance de compréhension est inférieure à 0,40. Un service qui n'a pas compris n'a pas le droit de conclure seul. La situation relève d'une maladie à déclaration obligatoire , en santé comme en agriculture. Le citoyen a demandé à parler à un humain. Cette demande n'a jamais besoin d'être justifiée. Chaque cas est déposé dans une file nommée de façon prévisible, à partir du rôle responsable du module, de la province et du territoire. Cette convention paraît anodine ; elle décide en réalité de qui voit quoi, et elle rend les tableaux de charge comparables d'une province à l'autre. Le rôle responsable en santé est celui du relais communautaire décrit dans les services du programme . Comment un cas trouve-t-il la bonne personne ? Le routage ne cherche pas la meilleure personne au sens absolu. Il cherche une personne proche, disponible et pas déjà submergée , selon un ordre fixe qui donne toujours le même résultat pour la même entrée. Territoire. Les agents rattachés au territoire du cas, y compris ceux qui couvrent plusieurs territoires. Organisation. À défaut, les agents de l'organisation partenaire concernée. Province. À défaut, les agents de la province. Rôle. En dernier ressort, l'ensemble des personnes portant le rôle responsable du module. Dans le premier niveau non vide de cette échelle, les personnes de garde sont retenues en priorité ; s'il n'y en a aucune, tout le groupe redevient éligible. Puis la charge tranche : le nombre de cas actifs déjà attribués, et à égalité un identifiant stable, pour que deux exécutions ne donnent jamais deux résultats différents. L'attribution ne peut pas être prise deux fois Deux superviseurs qui ouvrent le même cas au même instant sont un scénario banal dans un centre de coordination. L'attribution s'effectue donc par comparaison et échange sur la version du cas : le premier écrit gagne, le second reçoit un conflit explicite et doit recharger. Une réattribution efface l'accusé de réception précédent et redémarre l'horloge — le nouveau propriétaire hérite du cas, pas du temps déjà consommé par un autre. La machine à états : ce qu'un cas peut devenir Toutes les transitions possibles sont déclarées dans une table. Ce qui n'y figure pas est refusé, avec la liste des transitions permises en retour. Un cas ne peut donc pas sauter d'un état à un autre parce qu'une interface l'aurait laissé faire. État Ce qu'il signifie Effet sur l'horloge Ouvert Cas créé, personne ne l'a encore pris Horloge lancée Ouvert en urgence Niveau 4, alerte immédiate envoyée Horloge de 15 minutes Attribué Un agent nommé en est responsable Horloge maintenue Accusé de réception Un humain a confirmé la prise en charge Horloge arrêtée En cours Travail engagé, appel ou visite Horloge maintenue Suivi requis En attente du citoyen ou d'un résultat Horloge suspendue, avec motif Réattribué Passage à un autre agent, motif obligatoire Horloge redémarrée Escaladé Monté d'un cran, alerte au responsable Horloge redémarrée Escaladé au superviseur Deuxième cran, administration prévenue Horloge redémarrée Résolu Action terminée, clôture non encore validée Horloge arrêtée Clôturé, annulé, doublon États terminaux Aucune horloge Trois garde-fous méritent d'être signalés. Une annulation, un doublon ou une réattribution exigent un motif écrit . Une clôture exige quatre informations : le résultat, l'action réellement faite, la joignabilité de la personne et une décision de suivi. Enfin, les doublons sont fusionnés, jamais supprimés : les identifiants sont conservés, et le suivi programmé sur le cas source est rattaché au cas cible. Quinze minutes, quatre heures, vingt-quatre heures Les délais de prise en charge sont des tables, pas des objectifs négociés au cas par cas. Ils portent sur l' accusé de réception — le moment où un humain déclare qu'il prend le cas — et non sur la résolution, qui dépend de la distance, du transport et de l'état du centre de santé. Niveau de gravité Délai d'accusé de réception Premier rappel de suivi Ce que voit le citoyen 4 — urgence 15 minutes 2 heures Message d'urgence, départ immédiat, alerte d'un relais 3 — le jour même 4 heures 6 heures Consultation aujourd'hui 2 — sous 24 heures 24 heures 24 heures Consultation dans la journée qui vient 1 — surveillance 72 heures 72 heures Surveillance à domicile 0 — conseils Aucune horloge 7 jours Conseils à la maison Deux précisions comptent. D'abord, seul un acte humain arrête l'horloge : ni l'ouverture automatique, ni l'attribution, ni une notification lue ne suffisent. Ensuite, une horloge suspendue porte toujours un motif — « en attente du citoyen », par exemple — afin qu'un délai suspendu ne devienne pas un délai oublié. Quand le délai est dépassé Un balayage régulier passe sur les cas actifs dont l'échéance est passée sans accusé de réception. Pour chacun : le cas est marqué en dépassement, et cette marque est définitive : elle reste dans l'historique et dans les statistiques, même après la prise en charge ; un événement de dépassement est émis, avec le nombre de minutes de retard, la file et le propriétaire éventuel ; une ligne d'audit est écrite, avec l'auteur système et l'horodatage ; le cas monte d'un cran : escalade vers le responsable, puis, au cran suivant, vers l'administration ; l'agent attribué et le superviseur reçoivent chacun une notification, dédupliquée pour qu'un même retard ne produise pas dix alertes ; une nouvelle échéance est posée. Le cas ne sera repris par le balayage suivant que si cette nouvelle échéance est manquée à son tour. C'est cette dernière règle qui transforme le dépassement en échelle d'escalade plutôt qu'en alarme répétitive. Un cas ignoré ne disparaît pas du radar : il remonte, cran par cran, jusqu'à une personne qui doit en répondre. Un second balayage, distinct, s'occupe des cas bloqués : ceux dont la date de suivi est passée alors qu'ils sont encore actifs. Ils produisent un rappel à leur propriétaire, un rappel à la file quand personne ne les a pris, et une nouvelle échéance à vingt-quatre heures. La logique est la même que pour les signes de danger détectés automatiquement : ce que le système ne sait pas résoudre, il le rend visible. Corriger la machine, avec un motif écrit La correction humaine du niveau de gravité est prévue dès la conception. Une escalade vers les relais communautaires n'a de valeur que si le relais peut contredire le système. Un agent de santé qui voit la personne en sait toujours plus qu'un arbre de décision alimenté par une phrase mal transcrite. La correction du niveau de gravité est donc ouverte à toute personne habilitée, avec quatre conditions : le nouveau niveau est un entier de 0 à 4 ; un motif écrit d'au moins dix caractères est obligatoire ; sans lui, la correction est refusée ; la valeur proposée par le système est conservée à côté de la valeur retenue par l'humain, avec le nom de l'auteur et l'horodatage ; une entrée dédiée est écrite dans le registre des corrections, et un événement est émis. Ce registre n'est pas une formalité administrative : c'est la principale mesure de qualité de l'IA du programme. Un arbre corrigé vers le haut dans une province et pas ailleurs signale un vocabulaire mal couvert ; un arbre systématiquement corrigé vers le bas signale un réglage trop prudent qui use les équipes. La règle asymétrique est rappelée dans la page sécurité et gouvernance : le système, lui, ne peut jamais abaisser un niveau — seule une personne le peut, et seulement en s'expliquant. Le suivi : ce que devient la personne après l'orientation Orienter quelqu'un vers un centre de santé sans jamais savoir s'il y est allé, c'est publier un chiffre sans dénominateur. Chaque cas porte donc une date de suivi calculée à partir de la gravité, et un rendez-vous de suivi peut être programmé explicitement. Le retour est saisi avec un résultat, un texte libre et un statut. La décision de suivi appartient à une liste fermée : pas de suivi nécessaire, suivi programmé, personne référée, surveillance en cours, dossier transmis. Cette liste fermée permet ensuite d'agréger sans interpréter du texte libre, et de répondre à la seule question qui intéresse un financeur public : combien de personnes orientées ont effectivement été prises en charge . Les recommandations sur les agents de santé communautaires publiées par l'Organisation mondiale de la santé insistent depuis longtemps sur ce point, et les travaux de terrain rassemblés par l'UNICEF montrent la même chose : ce qui distingue un dispositif communautaire efficace d'un dispositif décoratif, c'est la boucle de retour, pas l'outil d'entrée. Le vrai mode de défaillance : une file sans personne pour la tenir Tout ce qui précède est du logiciel, et le logiciel est la partie facile. Le mode de défaillance qui nous inquiète n'est pas un bug de transition d'état : c'est une file d'attente qui grossit dans un territoire où aucun agent n'est de garde. Dans cette situation, le système fait exactement ce pour quoi il est écrit — il ouvre, il route, il chronomètre, il escalade — et rien ne se produit dans la vie réelle. Pire, chaque escalade automatique consomme l'attention d'un superviseur déjà débordé, jusqu'à ce que les alertes deviennent du bruit. Nous en tirons quatre conséquences opérationnelles. Les indicateurs de file sont publics dans la console : profondeur, cas non attribués, cas en dépassement, âge du plus ancien, prochaine échéance. Une file saine et une file abandonnée ne se ressemblent pas. Aucune province n'est ouverte sans agents identifiés et formés. Ouvrir le service là où personne ne peut répondre reviendrait à promettre une prise en charge inexistante. Le dimensionnement se discute avant le déploiement , pas après le premier drame : nombre d'agents par territoire, plages de garde, volume soutenable par agent et par jour. Le citoyen n'attend jamais la file quand il y a un signe de danger . Le message lui dit de partir immédiatement, indépendamment de toute escalade. C'est le sens de la page consacrée à la conduite à tenir en cas d'urgence . Ce que nous ne savons pas encore Les volumes réels par territoire sont inconnus tant que le pilote n'a pas tourné ; aucun chiffre national n'est publié. Les règles de dimensionnement — combien de cas par agent et par jour — sont des hypothèses de travail, pas des mesures. Les protocoles qui produisent les niveaux ne sont pas cliniquement approuvés : ils portent la mention « en attente du comité de revue clinique ». Le service oriente et informe ; il ne soigne pas et ne remplace pas un agent de santé. Ce n'est pas un service d'urgence. Une escalade vers les relais communautaires bien conçue ne rend pas un système de santé plus rapide par magie. Elle rend visible, cas par cas et heure par heure, l'écart entre ce qui a été promis à une personne et ce qu'elle a réellement reçu. C'est déjà beaucoup, et c'est le préalable à toute amélioration. La logique de décision qui précède l'escalade est détaillée dans le guide sur l'IA et le triage en santé communautaire .","date_published":"2026-09-02T00:00:00.000Z","date_modified":"2026-09-10T00:00:00.000Z","authors":[{"name":"Direction technique CONGO VOICE AI OS"}],"tags":["Santé communautaire","Santé","Escalade","Opérations","Gouvernance","RDC"],"language":"fr-CD","_cvos":{"cluster":"sante-communautaire","pillar":false,"entities":["cas","file d'attente","délai de prise en charge","escalade","relais communautaire","superviseur","suivi","motif écrit","routage territorial"],"takeaways":["Un cas est l'unité de responsabilité : une file, un propriétaire, une horloge — et rien de tout cela n'est décidé par un modèle.","Le routage suit un ordre fixe : territoire, puis organisation, puis province, puis rôle, en privilégiant les personnes de garde les moins chargées.","Les délais d'accusé de réception sont de 15 minutes en urgence, 4 heures au niveau 3 et 24 heures au niveau 2 ; le dépassement escalade vers un superviseur.","Une file sans agents formés et payés pour la tenir est le véritable mode de défaillance : la technique ne produit pas de la prise en charge."],"wordCount":1927}},{"id":"https://congovoicecd.com/blog/ia-agricole-vocale-petits-producteurs","url":"https://congovoicecd.com/blog/ia-agricole-vocale-petits-producteurs","title":"IA agricole vocale : le guide des petits producteurs","summary":"Contexte de l’exploitation, hypothèses honnêtes, actions gratuites d’abord, registre des intrants : comment une IA agricole vocale conseille sans nuire.","content_text":"Un producteur de Kwilu qui décrit au téléphone des feuilles jaunies ne demande pas un article de vulgarisation. Il demande quoi faire cette semaine, avec ce qu’il a. Une IA agricole vocale utile n’est donc pas celle qui reconnaît le mieux une maladie sur une photo : c’est celle qui refuse de conseiller avant d’avoir compris la parcelle, qui commence par ce qui ne coûte rien, et qui sait dire qu’elle n’est pas sûre. Ce texte décrit comment le module agriculture et élevage de CONGO VOICE AI OS est construit, quelles règles sont écrites dans le code plutôt que confiées au modèle, et ce que le programme n’a pas encore tranché. Ce qu’une IA agricole vocale doit savoir avant de conseiller quoi que ce soit Le premier travail du système n’est pas de reconnaître une des maladies des cultures ou de l’élevage, c’est de reconstituer une situation. Neuf éléments de contexte sont extraits de la parole du producteur avant toute recommandation, et la réponse change selon leur valeur. Quand un élément manque, le service pose une question de plus au lieu de combler le vide. Élément de contexte Pourquoi il change la réponse D’où il vient Culture ou espèce animale Le même symptôme n’a pas la même cause sur manioc, sur maïs ou sur volaille Déclaration du producteur, confirmée si besoin Variété ou race Certaines variétés sont tolérantes ; l’historique de la bouture compte Déclaration du producteur Stade de développement Préparation, semis, levée, croissance, floraison, récolte : les gestes possibles ne sont pas les mêmes Déclaration, recoupée avec la saison Proportion atteinte Quelques plants, un quart, la moitié, plus de la moitié, tout le champ Déclaration, cadrée en catégories Intrants récents Semences, engrais, traitements, aliments : une brûlure d’engrais n’est pas une maladie Déclaration du producteur Date d’apparition Une évolution en trois jours et une évolution en trois mois n’orientent pas vers la même chose Déclaration du producteur Province et territoire Détermine la zone agro-écologique, la saison et le calendrier cultural Profil de session, jamais deviné Saison en cours Saison A, saison B, saison sèche ou petite saison sèche Calcul déterministe à partir de la province et de la date Pièces jointes Photos exploitables, vidéos conservées comme preuve Contrôle technique automatique La saison mérite une précision. Elle n’est jamais demandée au modèle : elle est calculée à partir d’une table qui associe chacune des vingt-six provinces à une zone de pluies — nord, équatorial, sud ou altitude — et du mois en cours. Au sud de l’équateur, la saison A court de septembre à décembre ; au nord, elle court de mars à juin. Un conseil de semis qui se tromperait de saison serait pire qu’un silence, et ce genre d’erreur n’a pas à dépendre d’un modèle génératif. La proportion atteinte n’est pas un détail de formulaire Cette seule valeur décide de plusieurs comportements. Au-dessus de la moitié de la parcelle ou du troupeau, le cas est marqué urgent, la gravité monte et un agent agricole est saisi, quelle que soit la confiance du diagnostic. C’est une règle écrite, pas une appréciation : une infestation généralisée est un problème de moyens et d’organisation, pas un problème de reconnaissance d’image. Pourquoi une correspondance visuelle reste-t-elle « possible » tant que les seuils ne sont pas atteints ? Le vocabulaire du service est contraint par des seuils numériques, et non par le ton du modèle. Le mot « diagnostic » n’est jamais employé comme une affirmation. Avant toute analyse visuelle, chaque pièce jointe passe un contrôle technique lisible : dimensions lues dans l’en-tête du fichier, densité d’information — le nombre d’octets compressés par pixel, un bon indicateur d’une photo très sombre, floue ou trop compressée — et détection des fichiers incomplets. Une photo dont le plus petit côté descend sous quatre cent quatre-vingts pixels, ou dont la densité tombe sous le seuil, n’est pas envoyée à un modèle de vision : le service demande une nouvelle prise de vue et explique comment la réussir. C’est une économie de moyens autant qu’une règle de prudence, et cela évite de facturer au programme une analyse qui ne pouvait rien donner. Une fois l’image jugée exploitable, le classement des hypothèses obéit à deux seuils : au-dessus de 60 % pour la première hypothèse, la formulation devient « correspondance la plus probable, à confirmer sur le terrain » ; en dessous de 60 % , chaque hypothèse reste une « correspondance possible » et une deuxième photo est demandée, sous un autre angle — face inférieure des feuilles, ou l’animal entier puis la partie atteinte ; en dessous de 40 % , le cas est orienté vers un agent agricole quelle que soit l’urgence, parce qu’un avis à distance trop incertain ne doit engager aucune dépense. Trois hypothèses au maximum sont présentées, chacune avec les indices retenus et les indices contraires ou manquants. Cette dernière colonne est celle qui rend l’avis utilisable : elle dit au producteur ce qu’il doit aller regarder lui-même. Quand aucune photo exploitable n’a été reçue, la confiance globale de la réponse est plafonnée par construction, même si la description orale est excellente. Trois niveaux d’action, dans un ordre qui n’est pas négociable Une IA agricole vocale qui commence par proposer un achat est une machine à endetter des ménages. L’ordre des recommandations est donc imposé par le code, et non laissé à la rédaction du modèle. Sans dépense. Retirer et détruire les plants ou parties atteints loin de la parcelle, prélever les boutures uniquement sur des pieds sains, respecter les écartements, sarcler, isoler les animaux malades, nettoyer l’abreuvoir et la mangeoire à l’eau savonneuse, noter la date, la parcelle et le nombre de plants ou d’animaux touchés. Avec de petits moyens locaux. Ce qui se trouve au village ou au marché voisin : cendre de bois, sable sec, extrait de feuilles de neem, associations culturales qui favorisent les prédateurs naturels, paillage, boutures tolérantes obtenues auprès du service agricole ou d’un multiplicateur agréé. Si un achat s’avère nécessaire. Et seulement à ce stade, un produit homologué peut être nommé — jamais sans passer par l’agent agricole du secteur, qui doit avoir vu la parcelle ou les animaux. Cet ordre reflète l’état des connaissances agronomiques autant qu’une position politique. Les travaux de gestion intégrée diffusés par l’Organisation des Nations unies pour l’alimentation et l’agriculture et les programmes de sélection variétale conduits par l’Institut international d’agriculture tropicale convergent sur le même point : sur les systèmes de petite taille, les pratiques culturales et le matériel végétal sain déterminent l’essentiel du résultat, bien avant le recours chimique. À chaque niveau s’ajoute une liste de ce qu’il ne faut surtout pas faire. Elle est aussi importante que les actions elles-mêmes : ne pas replanter des boutures issues d’un champ malade, ne pas jeter les plants arrachés au bord de la parcelle, ne pas traiter un virus à l’insecticide, ne pas mélanger plusieurs produits, ne pas déplacer d’animaux hors de l’exploitation quand une maladie à déclaration obligatoire est suspectée. La règle du registre : aucun produit nommé sans homologation vérifiée C’est le garde-fou le plus strict du module. Toute phrase de conseil qui mentionne un pesticide, un herbicide, un fongicide, un engrais minéral, un antibiotique, un vermifuge, un antiparasitaire ou un vaccin est confrontée au registre officiel des intrants autorisés tenu par la plateforme. Le mot suffit à déclencher la vérification, et un nom de produit sans mot générique la déclenche aussi. Le conseil n’est conservé que si le registre classe le produit comme homologué. Dans ce cas, quatre informations sont ajoutées d’office à la réponse, parce qu’un nom de produit seul est un conseil dangereux : le mode d’emploi homologué, tel qu’il figure sur l’étiquette ; l’équipement de protection obligatoire ; le délai avant récolte ou avant consommation ; le délai avant de retourner dans la parcelle traitée. Dans tous les autres cas, la phrase est supprimée. Un produit interdit en République Démocratique du Congo est nommé uniquement pour être déconseillé. Un produit réservé au vétérinaire est signalé comme tel, avec la mention qu’il ne s’achète pas au marché. Quand une phrase pourrait correspondre à deux entrées du registre, c’est toujours la plus restrictive qui l’emporte : le blocage plutôt que l’autorisation. Le texte de repli qui remplace le conseil retiré est fixe, relu et traduit : n’achetez rien sur simple conseil, passez par l’agent agricole ou le vétérinaire de votre secteur, qui confirmera le diagnostic et, si un produit est nécessaire, indiquera un produit homologué et sa dose. Une conséquence assumée : le service est parfois moins « utile » qu’un vendeur de marché, qui, lui, nommera toujours quelque chose. C’est exactement l’effet recherché. Le détail de cette règle et la liste des refus explicites figurent sur la page publique des services du programme . Comment des signalements isolés deviennent-ils un foyer à vérifier ? La détection de foyers phytosanitaires repose sur ce qu’un producteur isolé ne peut pas voir : la répétition. La règle de regroupement est déterministe et publiée. Quand au moins cinq signalements décrivent le même problème sur la même culture, dans le même territoire — ou à défaut la même province — sur une fenêtre glissante de quatorze jours, un foyer est ouvert avec le statut « non vérifié », un événement est enregistré et le réseau des agents agricoles est alerté. Trois précautions encadrent ce mécanisme. La plateforme ne déclare jamais une épidémie : seul un agent qualifié fait passer un foyer de « non vérifié » à « confirmé » ou « rejeté ». Un foyer dont le nombre de signalements reste sous le seuil de confidentialité est publié sans son territoire, pour qu’une poignée d’exploitations ne puisse pas être reconnue. Enfin, les seuils — cinq signalements, quatorze jours — sont des paramètres de configuration modifiables par l’autorité agricole, sans changement de code. Certaines situations n’attendent pas le seuil. Une liste de maladies et de ravageurs à déclaration obligatoire — mosaïque africaine du manioc , striure brune, chenille légionnaire d’automne , bunchy top du bananier, invasion acridienne, maladie de Newcastle, peste des petits ruminants, peste porcine africaine — déclenche une alerte dès la première suspicion, même isolée, même si la gravité individuelle du cas est faible. Ce principe de notification est celui que promeut la Convention internationale pour la protection des végétaux : un foyer non signalé coûte infiniment plus cher qu’un signalement inutile. Ce que la voix change pour un producteur qui ne lit pas Le choix de la voix n’est pas une préférence d’interface. Une part importante des exploitations familiales est conduite par des personnes qui ne lisent pas couramment le français, et pour lesquelles une application écrite n’existe pas. Une IA agricole vocale accessible par appel, par message vocal ou par menu à touches change la population atteinte, pas seulement le confort d’usage. Trois contraintes de terrain en découlent. La bande passante impose un audio compressé et un envoi par morceaux, avec reprise après coupure ; c’est aussi pourquoi la photo est vérifiée sur le téléphone avant d’être transmise. L’électricité intermittente interdit les sessions longues : un échange interrompu doit pouvoir reprendre où il s’est arrêté. Le téléphone partagé interdit d’assimiler l’identité à un numéro. Les canaux disponibles et leurs limites sont décrits sur la page d’accès au service , et la couverture par langue sur la page des langues nationales . Les données factuelles ne sont jamais produites par le modèle. Les prix viennent de relevés de marché datés, cités avec le marché, la date et la source. La météo vient d’un service de prévision interrogé pour le centroïde de la province, avec repli sur une réponse saisonnière quand le réseau manque. Les calendriers de semis viennent d’une table province par culture. Le modèle explique ces chiffres ; il ne les invente pas. Ce que ce module ne fait pas, et ce qui n’est pas encore décidé La transparence sur les limites fait partie du dispositif, au même titre que les seuils. Le service n’affirme jamais un diagnostic à distance, n’invente ni prix, ni date de semis, ni prévision, et ne conseille aucun produit absent du registre. Le comité de contenu agricole n’est pas encore constitué . Les calendriers culturaux, le registre des intrants et la liste des maladies à déclaration portent aujourd’hui la mention d’un approbateur en attente, et non le nom d’une autorité désignée. C’est une condition de lancement, décrite avec les autres sur la page sécurité et gouvernance . La couverture du registre est partielle . Il contient les entrées nécessaires aux cas les plus fréquents, y compris des produits interdits inscrits pour être refusés ; il n’est pas encore le miroir complet de l’homologation nationale. Les prix de marché disponibles proviennent d’une série initiale de préparation, pas encore d’un flux quotidien consolidé à l’échelle du pays. La reconnaissance visuelle des maladies de l’élevage est nettement moins fiable que celle des maladies foliaires : sur un animal, le service demande presque toujours le passage d’un agent. Deux articles détaillent des cas concrets de cette mécanique : le diagnostic photo de la mosaïque du manioc et la conduite à tenir face à la chenille légionnaire d’automne sur le maïs . La logique commune — des règles déterministes autour d’un modèle qui explique sans décider — est exposée dans l’article consacré aux garde-fous d’une IA de service public .","date_published":"2026-09-02T00:00:00.000Z","date_modified":"2026-09-10T00:00:00.000Z","authors":[{"name":"Direction technique CONGO VOICE AI OS"}],"tags":["Agriculture","Agriculture","Élevage","Sécurité des intrants","Surveillance phytosanitaire","RDC"],"language":"fr-CD","_cvos":{"cluster":"agriculture-vocale","pillar":true,"entities":["manioc","mouche blanche","chenille légionnaire d’automne","registre des intrants","agent agricole","calendrier cultural","mosaïque africaine du manioc","striure brune du manioc","maladies à déclaration obligatoire","lutte intégrée"],"takeaways":["Aucun conseil n’est produit avant que la culture, le stade, la proportion atteinte et les intrants récents soient connus : sans contexte, une hypothèse n’est qu’une devinette.","Une correspondance visuelle reste formulée comme « possible » tant que la première hypothèse n’atteint pas soixante pour cent, et le cas part vers un humain sous quarante pour cent.","Les recommandations sont ordonnées en trois niveaux : sans dépense, petits moyens locaux, puis achat — et le troisième niveau passe toujours par l’agent agricole.","Aucun produit chimique ou vétérinaire n’est nommé s’il ne correspond pas à une entrée homologuée du registre, avec son étiquette, sa protection et son délai avant récolte."],"wordCount":2133}},{"id":"https://congovoicecd.com/blog/corpus-vocal-langues-nationales","url":"https://congovoicecd.com/blog/corpus-vocal-langues-nationales","title":"Corpus vocal en langues nationales : méthode et éthique","summary":"Constituer un corpus vocal en langues nationales sans abuser des locuteurs : consentement parlé, finalités, propriété, dé-identification, équilibrage et relecture.","content_text":"On ne construit pas un service vocal en langues peu dotées sans données, et on ne collecte pas des données de la voix des gens sans règles. Ce texte décrit comment le programme constitue un corpus vocal en langues nationales — lingala , kikongo , kiswahili , tshiluba — en partant du consentement plutôt que du volume : ce qui est demandé avant d'enregistrer, ce qui est retiré avant de stocker, qui relit, qui décide, et ce qui n'est pas encore décidé. Pourquoi deux cents heures par langue, et pas dix mille L'objectif de travail du programme est de deux cents heures transcrites par langue peu dotée, plus un jeu d'évaluation annoté d'environ deux mille énoncés par langue et par domaine. Ce n'est pas un seuil scientifique : c'est l'ordre de grandeur qui permet d'adapter un modèle existant à un usage borné — santé communautaire , agriculture, appui scolaire — plutôt que d'entraîner un modèle général à partir de rien. Deux cents heures bien réparties valent mieux que deux mille heures d'une seule province. La raison est simple : un modèle apprend la distribution qu'on lui donne. Un corpus recueilli auprès d'hommes adultes de la capitale, sur une bonne ligne, produira un service qui comprend les hommes adultes de la capitale sur une bonne ligne. Or les personnes que le service doit rejoindre en priorité sont exactement celles qui parlent depuis un village, sur un téléphone partagé, avec du vent, et souvent avec la voix d'une femme âgée ou d'un enfant. Le volume n'est donc pas la première variable. Les premières variables sont la finalité, le consentement et l'équilibre. Le consentement par la voix, avant le premier enregistrement Un formulaire écrit exclut d'emblée une partie des personnes que le programme dit vouloir servir. Le consentement est donc demandé à voix haute, dans la langue de la personne, avec quatre informations et rien de plus : ce qui est enregistré, à quoi cela sert, combien de temps c'est conservé, comment revenir en arrière. La formulation est fixe. Elle est écrite en français, traduite et relue dans les cinq langues, puis figée. Elle n'est jamais produite par un modèle, pour la même raison que les messages d'urgence : une phrase de consentement mal traduite invalide tout ce qui suit. La réponse est conservée avec l'échantillon. Horodatée, attachée à la session, consultable. Un consentement qu'on ne peut pas retrouver n'existe pas. Le retrait passe par le même canal. Dire « je retire mon accord » doit fonctionner aussi bien que répondre à un message. Le retrait sort l'échantillon des jeux de données exportables. Le refus ne coûte rien. Une personne qui refuse l'usage de son enregistrement pour l'amélioration du service reçoit exactement la même réponse, avec la même qualité. Conditionner le service au don de données serait une contrepartie déguisée. La limitation de finalité est la contrepartie de cette simplicité. Ce que le programme annonce, il doit s'y tenir : le corpus sert à améliorer l'écoute, la compréhension et la parole du service public, dans les langues concernées. Il ne sert pas à la publicité, pas au ciblage, pas à l'évaluation individuelle d'une personne, et il n'est pas cédé à un tiers pour entraîner un modèle commercial sans accord dédié et explicite. Ce que le service collecte et pour combien de temps est décrit sur la page consacrée à la protection des données personnelles . Cette exigence n'a rien d'exotique : la collecte communautaire sous consentement pratiquée par le projet Common Voice de Mozilla a montré qu'un corpus vocal peut se constituer sans opacité. La différence est qu'ici les personnes ne sont pas des contributrices volontaires venues d'un site web, mais des citoyennes et citoyens qui appellent un service public parce qu'un enfant est malade. L'asymétrie est plus forte, donc les règles doivent l'être aussi. À qui appartient le corpus vocal en langues nationales ? C'est la question la plus importante du sujet, et elle n'est pas tranchée . La dire ouverte est plus honnête que de la laisser se décider par défaut, ce qui arrive toujours au bénéfice de celui qui héberge les fichiers. Trois options sont sur la table, avec leurs conséquences. Option Ce qu'elle donne Ce qu'elle coûte Détention publique par l'État congolais Un bien commun national, réutilisable par l'école et la recherche du pays Dépend de la capacité d'archivage et de la stabilité institutionnelle Licence ouverte encadrée, avec restrictions d'usage Réutilisation par la recherche mondiale, effet d'entraînement pour les langues concernées Perte de contrôle sur les usages commerciaux en aval Garde partagée avec des institutions académiques congolaises Compétence locale, continuité scientifique, relecture experte Gouvernance plus lourde, décision plus lente Aucune de ces options n'est retenue à ce jour. Ce qui est décidé, en revanche, tient en trois points : le corpus n'est cédé à personne tant que la question n'est pas tranchée ; les locuteurs qui ont donné leur voix doivent être informés de l'issue ; et l'arbitrage relève de la gouvernance du programme, pas de l'équipe technique. Les principes du cadre continental de protection des données portés par l'Union africaine servent de référence minimale, sans que ce texte prétende décrire l'état des ratifications. Ce qu'on retire avant de stocker : la dé-identification Un enregistrement de voix est une donnée personnelle par nature : la voix identifie. La dé-identification ne peut donc pas être totale, et prétendre le contraire serait faux. Ce qui est possible, c'est de réduire méthodiquement ce qui rattache un échantillon à une personne nommée. Les identifiants directs sortent du texte. Numéros de téléphone, noms propres de personnes, adresses précises sont remplacés par des marqueurs dans la transcription, avant relecture. La localisation est ramenée à la province. Le village n'entre pas dans le corpus ; la province suffit à mesurer les écarts régionaux et à équilibrer la collecte. L'échantillon est détaché du dossier. Un enregistrement versé au corpus est relié à la session, pas au profil de santé de la personne, et aucune inférence de santé n'est rattachée au numéro appelant — d'autant qu'un téléphone est souvent partagé dans le ménage. La conservation est bornée et écrite. Une durée annoncée, une suppression effective, et une trace de la suppression. Ce qui n'est pas réductible est dit. L'audio reste identifiable pour qui connaît la personne. C'est pour cette raison que l'accès au corpus est nominatif, journalisé, et limité aux relecteurs et aux personnes chargées de l'évaluation. Il existe une limite technique qu'il faut énoncer avant la collecte et non après : un modèle déjà entraîné ne peut pas oublier proprement un exemple. Un retrait de consentement sort l'échantillon des exports et des jeux futurs ; il ne défait pas un entraînement passé. Cette limite est dite dans la formule de consentement. Équilibrer les voix : genre, âge, province, canal L'équilibrage n'est pas une préoccupation morale ajoutée après coup : c'est ce qui détermine pour qui le service fonctionne. Les quotas suivis par langue sont les suivants. Dimension Ce qui est suivi Pourquoi cela change la sortie du modèle Genre Part de voix de femmes et d'hommes Les corpus déséquilibrés dégradent la reconnaissance des voix sous-représentées Âge Enfants, adultes, personnes âgées La voix âgée et la voix d'enfant sont les plus mal servies par les modèles génériques Province Répartition sur les provinces couvertes Le lingala de Kinshasa n'est pas celui de l'Équateur ; le kikongo varie de même Canal Appel vocal , note vocale, guichet assisté Un appel en 8 kHz et une note vocale n'ont pas la même signature acoustique Domaine Santé, agriculture, éducation Le vocabulaire décisif diffère : signes de danger , ravageurs, notions scolaires Le suivi est publié par langue au fur et à mesure, avec le nombre d'heures relues et non pas seulement collectées. La distinction compte : une heure non relue n'est pas une donnée d'entraînement, c'est une intention. La file de relecture et le lexique de prononciation Tout échantillon entre dans une file, ordonnée par priorité : d'abord ce que le citoyen a signalé comme incompris, ensuite ce sur quoi le système s'est déclaré peu sûr, ensuite le reste par ancienneté. Des relecteurs qui parlent la langue traitent la file et prennent l'une de trois décisions : valider, corriger, rejeter. Une correction porte sur la transcription, sur le sens en français, ou sur la langue reconnue — trois erreurs différentes qu'il serait absurde de confondre dans un seul champ. Le lexique est le produit dérivé le plus utile de cette relecture. Chaque entrée porte le terme, son sens en français, son domaine, sa région et une indication de prononciation. Ce sont les noms de maladies, de plantes, d'outils, de gestes et de symptômes qu'aucun modèle générique ne connaît. Les entrées vérifiées sont retrouvées et fournies au traitement à chaque nouvelle demande, ce qui améliore la compréhension immédiatement, sans réentraîner quoi que ce soit. C'est le même mécanisme que celui décrit pour l'adaptation des modèles de parole au lingala . Deux points de méthode, souvent négligés : La relecture est un métier, et elle est rémunérée. Fonder la qualité d'une langue sur le bénévolat revient à la faire dépendre du temps libre des gens, ce qui reproduit exactement les inégalités qu'on prétend corriger. Le jeu d'évaluation est annoté à part. Par d'autres relecteurs, et jamais réinjecté dans l'entraînement. Sans cette séparation, les scores publiés mesurent la mémoire du modèle, pas sa compétence. Exporter un jeu de données pour l'affinage Les paires audio et transcription validées sont exportables sous une forme simple, ligne par ligne : identifiant, langue, référence de l'audio, texte, traduction française, province, intention, module. C'est le format attendu par les chaînes d'affinage des modèles de parole et des voix de synthèse ; les travaux publiés par Meta AI sur la reconnaissance vocale massivement multilingue décrivent bien ce que ce type de données permet, et à quelles conditions. L'export obéit aux mêmes règles que le reste : seuls les échantillons validés ou corrigés y entrent, les retraits de consentement en sortent, l'accès est nominatif et journalisé. À ce stade du programme, l'export est outillé et l'affinage reste à réaliser — le dire évite de laisser croire qu'un modèle congolais existe déjà. Ce qui n'est pas décidé, et qui doit l'être Un corpus vocal en langues nationales engage des personnes qui n'ont ni le temps ni les moyens de négocier. Les points ouverts sont donc annoncés : La propriété et la licence du corpus ne sont pas arrêtées. C'est la décision la plus structurante du sujet. La durée de conservation définitive des audios bruts, par opposition aux transcriptions, reste à fixer avec le comité de gouvernance. La contrepartie due aux relecteurs et aux communautés dont la langue progresse grâce à ce travail n'est pas formalisée au-delà de la rémunération de la relecture. L'ouverture à la recherche externe , sous quelles conditions et avec quelles restrictions d'usage, n'est pas décidée. Les textes d'interface dans les quatre langues nationales restent des versions de travail, en attente de validation par des linguistes. La couverture réelle de chaque langue, avec ses seuils de qualité et son état d'avancement, est publiée sur la page des langues nationales , et le cadre général dans lequel s'inscrit cette collecte est décrit dans la présentation du programme . Une règle demeure au-dessus des autres : personne ne doit découvrir après coup ce que sa voix est devenue.","date_published":"2026-08-31T00:00:00.000Z","date_modified":"2026-09-10T00:00:00.000Z","authors":[{"name":"Direction technique CONGO VOICE AI OS"}],"tags":["Langues et parole","Langues","Corpus","Protection des données","Gouvernance","RDC"],"language":"fr-CD","_cvos":{"cluster":"langues-peu-dotees","pillar":false,"entities":["corpus vocal","consentement éclairé","dé-identification","lexique local","file de relecture","jeu de données","lingala","kikongo","kiswahili","tshiluba","province"],"takeaways":["Un consentement qui suppose de savoir lire n'est pas un consentement : il doit être demandé à voix haute, dans la langue de la personne, et pouvoir être retiré de la même manière.","La finalité doit être bornée avant la collecte : améliorer l'écoute et la parole du service, et rien d'autre — pas de revente, pas d'entraînement tiers sans accord dédié.","La propriété du corpus est une décision de programme qui n'est pas prise à ce jour ; l'annoncer clairement vaut mieux que de la laisser se décider par défaut.","Deux cents heures par langue ne servent à rien si elles viennent d'une seule province, d'un seul genre et d'une seule tranche d'âge."],"wordCount":1826}},{"id":"https://congovoicecd.com/blog/signes-de-danger-detection-automatique","url":"https://congovoicecd.com/blog/signes-de-danger-detection-automatique","title":"Détection automatique des signes de danger en cinq langues","summary":"La détection automatique des signes de danger repose sur des règles de mots-clés en cinq langues, exécutées avant toute IA, et assumant ses faux positifs.","content_text":"Le moment le plus dangereux d'un service vocal de santé n'est pas celui où il se trompe de conseil. C'est celui où il ne comprend pas qu'il faut arrêter de conseiller. Une mère qui dit « azali kopema mbangu » à propos de son bébé décrit une détresse respiratoire ; si la phrase part vers un modèle de langage qui la résume en « toux légère », le reste de la chaîne travaille sur une fiction. C'est pour cela que la détection automatique des signes de danger est la première chose qui s'exécute, et la dernière qu'on accepterait de perdre. Les huit signes de danger, et pourquoi ils passent avant l'IA Le programme reprend les signes de danger généraux utilisés par la prise en charge intégrée des maladies de l'enfant : convulsions ou raideur du corps, inconscience ou somnolence anormale, impossibilité de boire ou de téter, vomissement de tout ce qui est avalé, respiration très difficile ou très rapide, nuque raide, saignement abondant, corps très froid ou brûlant. Un seul de ces signes suffit à imposer un départ immédiat. La liste destinée aux citoyens, avec la conduite à tenir , est publiée sur la page des signes de danger et de la conduite à tenir . Leur place dans la chaîne est le vrai sujet. Sept étapes séparent l'audio de la réponse parlée ; la reconnaissance de ces huit signes est branchée juste après la transcription, avant l'appel au modèle. Trois raisons à cela : La disponibilité. Un fournisseur d'IA peut être en panne, saturé, ou renvoyer une sortie non conforme au schéma attendu. La sécurité ne peut pas dépendre de cette disponibilité. La stabilité. Une liste de mots produit exactement le même résultat à chaque exécution. Un modèle, non. La preuve. Devant une commission, on peut montrer la ligne exacte qui a déclenché l'alerte. C'est ce que le programme appelle des garde-fous déterministes , décrits sur la page sécurité et gouvernance . Des règles de mots-clés dans cinq langues, exécutées avant tout appel au modèle Chaque signe de danger est associé à une liste de formulations réellement entendues, en français, lingala , kikongo , kiswahili et tshiluba , y compris les variantes orales que personne n'écrirait. La liste ne cherche pas l'élégance linguistique : elle cherche à attraper ce que les gens disent. Signe de danger Français Lingala Kiswahili Kikongo et tshiluba Convulsions convulsion, tremble, se raidit kobeta nzoto, nzoto ekangami degedege, kifafa kunikana, kutshinguluka Inconscience ne réagit pas, évanoui, somnolent abungisi mayele, alali makasi kuzimia, kupoteza fahamu kele ve na mayele, kujimija meji Ne peut pas boire refuse de boire, ne tète plus akoki komela te, aboyi komela hawezi kunywa, hanyonyi ke buya kunwa, udi ubenga kunua Vomit tout vomit tout, rejette tout azali kosanza nyonso anatapika kila kitu ke luka yonso, udi ulua bionso Détresse respiratoire respire mal, respire vite, étouffe akoki kopema te, kopema mpasi hapumui, shida ya kupumua ke pema mpasi, kavua upetesha lupepele Nuque raide nuque raide, cou raide nkingo ekangami shingo ngumu nsingu me kangama, nshingu mukole Saignement abondant saigne beaucoup, hémorragie makila mingi damu nyingi menga mingi, mashi a bungi Corps très froid ou brûlant corps glacé, peau brûlante nzoto ya malili makasi mwili baridi sana nitu ya madidi mingi, mubidi wa luya Ce que ces règles produisent exactement Elles ne produisent pas un verdict. Elles remplissent des réponses dans l'arbre de décision : la question « la personne présente-t-elle un de ces signes ? » reçoit une réponse déterministe, tirée de ce que la personne a effectivement dit. Le moteur de protocoles fait ensuite son travail normal, et un signe reconnu conduit au niveau 4. Cette architecture est décrite dans le guide sur l'IA et le triage en santé communautaire . Le point important est l'ordre de priorité : quand le modèle et la règle ne sont pas d'accord, c'est la règle qui gagne . Le modèle peut proposer des réponses aux questions du protocole ; les réponses déterministes sont fusionnées par-dessus. Le rappel des signes de danger est donc identique avec ou sans modèle. Pourquoi des règles de mots-clés multilingues plutôt qu'un classifieur Un classifieur entraîné ferait mieux sur le papier : il tolérerait les fautes de transcription, il généraliserait à des formulations absentes de la liste. Trois obstacles nous en ont détournés pour cette couche précise. Il faudrait d'abord un corpus annoté d'urgences vitales par langue, c'est-à-dire exactement ce qui manque le plus en lingala, en kikongo et en tshiluba. Il faudrait ensuite accepter qu'une mise à jour du modèle déplace silencieusement la frontière de décision, sans qu'aucun test ne le signale. Il faudrait enfin renoncer à expliquer une alerte par une ligne précise, ce qu'aucun comité clinique n'accepterait. Des règles de mots-clés multilingues ont l'avantage inverse : elles sont pauvres, mais entièrement inspectables. Un relais communautaire peut lire la liste de sa langue, dire « ce mot ne se dit pas comme ça chez nous » et faire ajouter la variante. Le jour où un corpus annoté d'urgences vitales existera pour chacune des cinq langues, un classifieur pourra venir s'ajouter à ces règles comme second filet — jamais les remplacer. Ce que ces listes ne savent pas faire Elles ne comprennent pas la négation. « Il ne convulse pas, mais j'ai peur » contient le mot déclencheur. Elles ne comprennent pas non plus l'ironie, ni le récit au passé — « la semaine dernière il a convulsé » déclenche la même alerte qu'un événement en cours. Nous connaissons ces limites, nous les avons chiffrées en interne, et nous avons décidé de ne pas les corriger par des règles de négation fragiles. Une orientation prudente de trop est préférable à une règle subtile qui échoue au mauvais moment. Pourquoi le rappel compte-t-il plus que la précision ? En reconnaissance de motifs, deux mesures s'opposent. Le rappel est la part des situations graves effectivement détectées. La précision est la part des alertes qui étaient justifiées. Améliorer l'une dégrade presque toujours l'autre. Pour un service public de santé communautaire , les deux erreurs n'ont pas le même prix. Type d'erreur Ce que vit le citoyen Ce que cela coûte au dispositif Faux négatif : un signe de danger manqué Reste à la maison alors qu'il fallait partir Perte de chance, potentiellement irréversible Faux positif : une alerte injustifiée Se déplace, ou reçoit un appel d'un relais Un déplacement, quelques minutes de travail humain Le seuil d'ouverture d'une langue reflète cette asymétrie : le rappel des situations d'urgence est fixé à 98 % minimum, très au-dessus des seuils exigés pour l'exactitude générale de la transcription. Une langue qui ne franchit pas ce seuil ne reste pas en mode conversationnel « un peu moins bon » : elle bascule en mode guidé , avec des messages enregistrés et une navigation par touches. Les seuils de qualité par langue sont publiés avec la conduite à tenir quand ils ne sont pas atteints. Ce raisonnement n'a rien d'original en santé publique : les dispositifs de dépistage communautaire recommandés par l'Organisation mondiale de la santé sont construits sur la même asymétrie, et les protocoles de premiers secours diffusés par la Fédération internationale des Sociétés de la Croix-Rouge et du Croissant-Rouge reposent sur des critères volontairement larges. Ce qui est nouveau, c'est de le faire tenir dans un logiciel qui parle cinq langues. Que se passe-t-il quand les fournisseurs d'IA sont indisponibles ? C'est le test que nous exécutons le plus souvent, parce que c'est celui qui arrive vraiment : coupure réseau, quota dépassé, panne d'un fournisseur, sortie non conforme au schéma attendu. Dans ce mode dégradé , la chaîne se réduit mais ne se rompt pas : La transcription bascule vers un moteur de secours, ou vers la saisie guidée par touches quand plus aucun moteur ne répond. La détection par mots-clés continue : elle ne dépend d'aucun service externe. L'arbre de décision tourne normalement, puisqu'il ne fait qu'évaluer des conditions sur des réponses. L'explication générée disparaît ; c'est le texte d'orientation approuvé du protocole qui est prononcé à sa place. Le message d'urgence, écrit et traduit à l'avance dans les cinq langues, est lu tel quel. Il ne passe par aucun modèle, jamais. Le cas est ouvert et l'alerte part vers un humain, comme en fonctionnement normal. La règle de conception est simple à énoncer : le service peut perdre la conversation, il ne doit jamais perdre la sécurité . C'est aussi pour cette raison qu'un fournisseur hors ligne, capable de faire tourner toute la plateforme sans aucune clé d'accès, est maintenu et testé en continu. Les faux positifs, un coût accepté et mesuré Accepter des fausses alertes n'est pas les ignorer. Trois disciplines encadrent ce choix. On les compte. Chaque escalade de niveau 4 produit une trace : mot déclencheur, langue, province, arbre utilisé, décision finale du relais ou du soignant. Une alerte close en « pas de signe de danger » est une donnée, pas un échec honteux. On les explique au citoyen. Le message d'urgence ne dit pas « votre enfant est en danger de mort ». Il dit d'aller maintenant au centre de santé le plus proche et de ne pas attendre. La différence compte pour la confiance : le service annonce une conduite à tenir, pas un pronostic. On surveille la charge qu'elles créent. Une file d'attente saturée de fausses alertes finit par masquer les vraies. C'est le risque principal de ce réglage, et il est suivi comme tel dans les indicateurs de file d'attente décrits dans l'article sur l'escalade vers les relais communautaires . Si le volume de fausses alertes devenait ingérable, la réponse ne serait pas d'abaisser le rappel. Elle serait de renforcer la première ligne humaine, ou de raffiner un mot précis dont la trace montre qu'il se déclenche à tort — par exemple un terme qui, dans une province donnée, désigne autre chose que ce que la liste suppose. Chaque escalade est relue par un humain Aucune alerte de niveau 4 ne se referme toute seule. Elle ouvre un cas, dans une file identifiée par le rôle, la province et le territoire, avec une horloge de quinze minutes pour l'accusé de réception. Une revue humaine est également imposée dès le niveau 3, lorsqu'aucune source approuvée n'a pu être citée, lorsqu'une phrase interdite a été filtrée, ou lorsque la confiance est très basse sur une situation déjà sérieuse. Cette revue produit deux choses. D'abord une décision : le relais confirme, corrige, ou requalifie le niveau — toujours avec un motif écrit . Ensuite une donnée d'apprentissage : chaque correction humaine alimente le rapport de performance de l'IA, arbre par arbre et langue par langue. C'est ainsi qu'une liste de mots cesse d'être une intuition d'ingénieur pour devenir un objet mesuré. Les limites que nous publions La couverture par langue est inégale : le français est le plus complet, le kikongo et le tshiluba les plus fragiles, et l'écart n'est pas comblé. Les variantes régionales manquent . Un mot courant au Kasaï peut être absent de la liste, un mot du Nord-Kivu peut y figurer sous une seule graphie. La négation n'est pas traitée , par choix assumé. Les protocoles ne sont pas cliniquement approuvés : ils portent tous la mention « en attente du comité de revue clinique », et le vocabulaire d'alerte suivra la même procédure de validation. Le service n'est pas un service d'urgence . Il ne remplace ni un agent de santé, ni un déplacement immédiat vers une structure de soins devant un signe de danger. La détection automatique des signes de danger n'est pas la partie brillante d'un service d'IA vocale. C'est une liste de mots, écrite à la main, relue par des locuteurs natifs , testée à chaque déploiement. C'est aussi, très probablement, la partie qui sauve. Le reste de l'offre publique est décrit sur la page des services du programme .","date_published":"2026-08-29T00:00:00.000Z","date_modified":"2026-09-10T00:00:00.000Z","authors":[{"name":"Direction technique CONGO VOICE AI OS"}],"tags":["Santé communautaire","Santé","Sécurité","Langues","Urgence","RDC"],"language":"fr-CD","_cvos":{"cluster":"sante-communautaire","pillar":false,"entities":["signes de danger","vocabulaire d'urgence","lingala","kiswahili","tshiluba","kikongo","rappel","escalade","mode hors ligne","script d'urgence"],"takeaways":["Les signes de danger sont reconnus par des listes de mots dans les cinq langues du programme, avant tout appel à un modèle de langage.","Sur ces règles, le rappel prime sur la précision : manquer une convulsion coûte infiniment plus cher qu'une alerte de trop.","Quand tous les fournisseurs d'IA sont indisponibles, la détection et le message d'urgence continuent de fonctionner à l'identique.","Chaque escalade de niveau 4 ouvre un cas relu par un humain, et les fausses alertes sont comptées plutôt que dissimulées."],"wordCount":1896}},{"id":"https://congovoicecd.com/blog/mosaique-manioc-diagnostic-photo","url":"https://congovoicecd.com/blog/mosaique-manioc-diagnostic-photo","title":"Mosaïque du manioc : réussir le diagnostic photo","summary":"Photographier une feuille, distinguer mosaïque du manioc, striure brune et carence, agir sans dépense : ce que le diagnostic photo peut et ne peut pas.","content_text":"Le manioc nourrit une grande partie du pays et supporte mal deux maladies virales que rien ne guérit une fois le plant infecté. Quand un producteur envoie une image de feuille marbrée, il attend une réponse en quelques minutes. Le service peut l’aider, à une condition : qu’il soit clair sur ce qu’une image permet réellement d’établir. Ce texte explique comment réussir une prise de vue, ce que la comparaison entre mosaïque, striure brune et carence donne vraiment, et pourquoi les premières actions recommandées ne coûtent rien. Pourquoi la photo compte, et pourquoi elle ne suffit jamais Une description orale porte déjà beaucoup d’information : la culture, le stade, la date d’apparition, la proportion de plants touchés, les boutures utilisées, l’origine du matériel végétal. L’image ajoute ce qu’une phrase transmet mal — la forme exacte des taches, leur répartition sur le limbe, la déformation du bord de la feuille, l’étage de la plante concerné. Elle ne remplace rien pour autant. Une infection virale ne se lit pas sur une feuille : elle se déduit d’un faisceau d’indices. Les programmes de santé des plantes conduits par l’Institut international d’agriculture tropicale et les réseaux de diagnostic soutenus par CABI reposent sur la même séquence — observation de terrain, comparaison à des cas de référence, confirmation en laboratoire pour les cas douteux. Une image analysée à distance intervient au début de cette chaîne, pas à la fin. Comment photographier une feuille de manioc pour qu’un modèle puisse aider ? La qualité de la prise de vue conditionne tout le reste. Le service vérifie automatiquement chaque fichier reçu — dimensions, densité d’information, intégrité du transfert — et refuse d’analyser une image inexploitable plutôt que de produire une hypothèse fabriquée sur du bruit. Six gestes qui changent le résultat Photographier de jour, à l’ombre portée près. Le plein soleil brûle les nuances de jaune ; le contre-jour transforme la feuille en silhouette. S’approcher à environ trente centimètres. Une feuille photographiée de loin, au milieu d’un champ, ne montre aucun détail utile. Viser les jeunes feuilles du sommet , puis, sur une seconde image, une feuille du milieu de la plante : les deux étages ne racontent pas la même histoire. Prendre une vue de la face inférieure. C’est là que se tiennent les mouches blanches et que se lisent les piqûres d’acariens. Tenir le téléphone immobile et attendre la mise au point avant de déclencher. Cadrer aussi la tige et le port du plant sur une troisième image : les stries brunes des tiges et la taille du plant sont des indices à part entière. Ce que le contrôle technique écarte avant toute analyse Une image dont le plus petit côté descend sous quatre cent quatre-vingts pixels, une image très sombre, floue ou trop compressée, un fichier interrompu pendant le transfert : dans ces cas, aucune analyse visuelle n’est lancée. Le service explique comment reprendre la photo et attend. Une vidéo est conservée comme pièce de preuve pour l’ agent agricole , mais elle n’est pas analysée image par image, et le service le dit au lieu de le laisser croire. Ce que peut vraiment dire une photo de mosaïque du manioc Diagnostic photo ne veut pas dire diagnostic confirmé. Le service classe au plus trois hypothèses, chacune assortie des indices qui plaident pour elle et de ceux qui la contredisent ou qui manquent. Tant que la première hypothèse n’atteint pas soixante pour cent, elle reste formulée comme une correspondance possible et une deuxième image est demandée sous un autre angle. En dessous de quarante pour cent, le cas part vers un agent agricole, parce qu’un avis trop incertain ne doit engager aucune dépense. Mosaïque du manioc Diagnostic photo : c’est le cas le plus favorable des trois, parce que les signes sont foliaires et précoces. Marbrures jaunes et vertes irrégulières, limbe déformé, recroquevillé et rétréci, symptômes plus nets sur les jeunes feuilles du sommet, plant globalement rabougri. La transmission emprunte deux voies seulement : les boutures prélevées sur un pied malade, et la mouche blanche , qui pique les feuilles et passe d’un plant à l’autre. Couper l’une de ces deux voies suffit à faire reculer la maladie dans la parcelle. Les racines sont peu nombreuses et fines. Striure brune du manioc Diagnostic photo : nettement plus difficile, et c’est précisément ce qui la rend dangereuse. Sur les feuilles, un jaunissement le long des nervures, souvent au milieu de la plante, sans forte déformation. Sur les tiges, des stries brunes allongées. Le vrai dégât est invisible en surface : des zones brunes, sèches et dures dans les racines, qui rendent la récolte impropre à la consommation et à la vente. Un plant peut paraître normal et avoir des racines nécrosées, ce qui impose un contrôle à la récolte, en coupant dix racines en travers. Carence en azote et autres confusions courantes Diagnostic photo : c’est ici que la confusion coûte le plus cher, parce qu’un producteur qui croit à une maladie virale arrache des plants sains. Une carence en azote jaunit les feuilles de façon uniforme , en commençant par les vieilles feuilles du bas, sans marbrure et sans déformation. Les dégâts d’acariens donnent de fines piqûres et un aspect poussiéreux sous la feuille. Une brûlure d’engrais mal enfoui, un excès d’eau en bas-fond ou un sol tassé produisent encore d’autres tableaux. Ce que l’on regarde Mosaïque du manioc Diagnostic photo de la striure brune Carence en azote Couleur des feuilles Marbrures jaunes et vertes irrégulières Jaunissement le long des nervures Jaunissement uniforme Étage atteint en premier Jeunes feuilles du sommet Feuilles du milieu Vieilles feuilles du bas Déformation du limbe Nette, feuille rétrécie et tordue Faible ou absente Absente Tiges Sans signe particulier Stries brunes allongées Sans signe particulier Racines Peu nombreuses et fines Zones brunes, sèches et dures Volume réduit, sans nécrose Ce que l’image ne montre pas L’origine des boutures L’état réel des racines L’analyse de sol La dernière ligne est la plus importante. Aucune de ces trois colonnes ne se tranche depuis une image seule ; le tableau sert à orienter l’observation du producteur, pas à conclure à sa place. Les actions gratuites, avant tout le reste Les deux maladies virales ne se soignent pas. Tout se joue sur l’assainissement de la parcelle et sur la qualité du matériel replanté. Ces gestes ne coûtent rien d’autre que du travail : Arracher les plants les plus atteints dès qu’ils sont repérés, puis les brûler ou les enfouir loin du champ. Laissés au bord de la parcelle, ils continuent de nourrir les mouches blanches. Ne jamais prélever de boutures sur un plant qui montre des symptômes , même légers, et ne jamais replanter des boutures issues d’un champ malade. Prélever les boutures sur des pieds sains et vigoureux , dans la partie ligneuse de la tige, avec six à huit nœuds. Respecter un écartement d’un mètre sur un mètre : un champ trop dense favorise la circulation de la mouche blanche. Sarcler régulièrement : les adventices hébergent les insectes vecteurs. Récolter plus tôt en cas de suspicion de striure brune , à neuf ou dix mois plutôt qu’à douze, les nécroses augmentant avec l’âge de la racine. Éliminer les repousses de l’ancienne parcelle avant de replanter. Le niveau suivant, celui des petits moyens, tient en deux points : se procurer des boutures de variétés tolérantes auprès du service agricole ou d’un multiplicateur agréé, et séparer clairement les parcelles de production des parcelles de multiplication de boutures. Le traitement chimique n’apparaît à aucun niveau : le service ne le propose pas, parce qu’aucun insecticide ne détruit un virus déjà installé. Cette règle des trois niveaux d’action est décrite en détail dans le guide de l’ IA agricole vocale pour les petits producteurs . Quand l’agent agricole doit être prévenu, et pourquoi tout de suite Deux seuils, tirés des fiches techniques approuvées, déclenchent l’alerte sans discussion possible : plus d’un plant sur cinq porteur de symptômes, ou la première observation dans un village jusque-là indemne. Pour la striure brune, le seuil est plus bas encore — la première suspicion suffit, parce qu’un foyer non signalé peut contaminer toute une zone de production en deux campagnes. Mosaïque africaine et striure brune figurent l’une et l’autre sur la liste des maladies et ravageurs à déclaration obligatoire tenue par la plateforme. Dès qu’un de ces noms apparaît dans le message, dans les hypothèses ou dans les symptômes décrits, trois choses se produisent en même temps : le service agricole du secteur est prévenu, le cas est marqué pour vérification de terrain et pour l’organisation de boutures saines, et il est demandé au producteur de ne déplacer ni plants, ni boutures, ni tiges hors de la parcelle avant le passage de l’agent. Ce dernier point est souvent celui qui protège le voisinage, et il ne dépend d’aucun modèle : c’est une règle écrite. Quand cinq signalements ou plus décrivent le même problème sur la même culture, dans le même territoire, sur quatorze jours glissants, un foyer est ouvert avec le statut « non vérifié ». La plateforme ne déclare jamais une épidémie ; seul un agent qualifié valide ou rejette. Le principe de notification précoce est celui que recommandent les dispositifs de surveillance appuyés par l’Organisation des Nations unies pour l’alimentation et l’agriculture . Les limites honnêtes du diagnostic à distance Il faut les énoncer, parce qu’elles décident de la confiance accordée au service : Une image ne distingue pas deux virus qui coexistent. Mosaïque et striure brune peuvent atteindre la même parcelle ; la photo ne le dira pas. Les symptômes précoces sont ambigus. Une jeune feuille légèrement marbrée peut relever d’une carence, d’un stress hydrique ou d’un début d’infection. La striure brune se juge surtout aux racines , donc hors du champ de l’image, ce qui interdit toute conclusion rassurante à partir d’un feuillage correct. Le service n’a pas de données de référence locales validées pour chaque variété cultivée en République Démocratique du Congo ; les variétés tolérantes disponibles varient d’une province à l’autre, et le programme n’a pas encore arrêté de liste consolidée. Aucun laboratoire n’est branché sur le service : la confirmation virologique reste hors ligne, à la main des services agricoles. Ce que le service enregistre, et ce qu’il en fait Chaque signalement conserve la description d’origine, la traduction française canonique, les images reçues avec leur verdict technique, les hypothèses classées avec leurs probabilités, les actions proposées par niveau, la province, le territoire quand il est connu, la saison calculée et les documents approuvés cités. Cet enregistrement sert trois usages : permettre à l’agent agricole de reprendre le cas sans faire répéter le producteur, alimenter la détection de foyers, et rendre chaque conseil relisible après coup. Le suivi demandé au producteur est simple et se fait sans matériel : compter les plants atteints sur une ligne de vingt plants, noter la date, refaire le comptage deux semaines plus tard. Si le nombre augmente, la source est le champ lui-même ou des boutures contaminées. Ce chiffre, transmis à l’agent, vaut plus que n’importe quelle image. Le fonctionnement des canaux — appel, message vocal, menu à touches — est décrit sur la page d’accès au service , et les règles générales qui encadrent l’usage du modèle sur la page sécurité et gouvernance . Le même raisonnement appliqué à un ravageur, avec des seuils de comptage et un refus de nommer un produit non homologué, est développé dans l’article consacré à la chenille légionnaire d’automne sur le maïs .","date_published":"2026-08-27T00:00:00.000Z","date_modified":"2026-09-10T00:00:00.000Z","authors":[{"name":"Direction technique CONGO VOICE AI OS"}],"tags":["Agriculture","Agriculture","Manioc","Diagnostic par image","Surveillance phytosanitaire","RDC"],"language":"fr-CD","_cvos":{"cluster":"agriculture-vocale","pillar":false,"entities":["mosaïque africaine du manioc","striure brune du manioc","mouche blanche","boutures saines","carence en azote","arrachage sanitaire","maladies à déclaration obligatoire","agent agricole","acariens du manioc"],"takeaways":["Une photo utile se prend à la lumière du jour, à environ trente centimètres, sur les jeunes feuilles du sommet, avec une deuxième prise de la face inférieure.","La mosaïque marbre et déforme les jeunes feuilles ; la striure brune jaunit le long des nervures et abîme surtout les racines ; une carence jaunit uniformément les vieilles feuilles, sans déformation.","Aucune de ces maladies virales ne se soigne : tout se joue sur l’arrachage des plants atteints et sur la qualité des boutures replantées.","Mosaïque et striure brune figurent sur la liste à déclaration obligatoire : la première suspicion suffit à prévenir l’agent agricole."],"wordCount":1862}},{"id":"https://congovoicecd.com/blog/ia-triage-sante-communautaire","url":"https://congovoicecd.com/blog/ia-triage-sante-communautaire","title":"IA et triage en santé communautaire : le cadre de décision","summary":"IA et triage en santé communautaire : pourquoi la gravité est décidée par des arbres versionnés et jamais par un modèle, et comment chaque décision reste auditable.","content_text":"Une femme appelle depuis un village du Kwilu. Son enfant a de la fièvre depuis deux jours, il a vomi ce matin, et elle voudrait savoir si cela peut attendre le marché de demain. À l'autre bout, un service public doit répondre en quelques secondes, dans sa langue, sans médecin en ligne. Ce texte décrit comment IA et triage en santé communautaire s'articulent dans CONGO VOICE AI OS : ce que la machine décide, ce qu'elle ne décide jamais, et comment chaque décision peut être rejouée un an plus tard. Pourquoi un modèle de langage ne doit jamais décider de la gravité Un modèle génératif est excellent pour comprendre une phrase mal articulée, mélangée de français et de kikongo , coupée par le vent. Il est mauvais pour être stable. Deux formulations proches de la même situation peuvent produire deux réponses différentes ; une mise à jour du fournisseur peut modifier son comportement sans que personne ne le demande ; et rien, dans son fonctionnement, ne permet d'expliquer après coup pourquoi il a dit ce qu'il a dit. Pour un service public de santé, cette instabilité est disqualifiante. Il faut pouvoir répondre à trois questions devant une commission d'enquête : quelle règle a produit ce niveau de gravité , quelle version de cette règle était en vigueur ce jour-là, et qui l'avait approuvée. Un modèle ne répond à aucune des trois. La séparation retenue est donc nette, et elle correspond à deux parties distinctes du logiciel : Le modèle comprend et explique. Il traduit la parole libre en réponses structurées aux questions d'un protocole, puis met en mots une décision déjà arrêtée. Le code décide. Un moteur déterministe parcourt l'arbre, applique les règles, calcule le niveau de gravité et choisit le texte d'orientation. Cette frontière n'est pas une intention affichée dans une charte : elle est vérifiable dans le dépôt, où le calcul de gravité vit dans un module qui n'appelle aucun fournisseur d'IA. Les règles de sécurité relèvent des garde-fous déterministes décrits dans la page gouvernance , pas de la bonne volonté d'un moteur commercial. Comment fonctionne un arbre de décision versionné ? Un protocole est un fichier de données, pas du code métier dispersé. Il déclare une entrée, un ensemble de questions, des embranchements, des règles de gravité, des signes d'alerte et cinq textes de sortie — un par niveau. Le tout est sérialisable, donc stockable, comparable d'une version à l'autre et rejouable à l'identique. Dix arbres couvrent aujourd'hui les motifs les plus fréquents d'un contact communautaire : Arbre de décision Ce qu'il couvre Documents de référence Fièvre de l'enfant de moins de 5 ans Fièvre, paludisme possible, rougeole, déshydratation Fièvre, prévention, triage Fièvre de l'adulte Fièvre prolongée, signes généraux Fièvre, triage Toux et difficulté respiratoire Respiration rapide, tirage, sifflement Respiratoire, triage Diarrhée et déshydratation Selles liquides, vomissements, signes de déshydratation Diarrhée, hygiène de l'eau Signes de danger de la grossesse Saignement, céphalées, œdèmes, mouvements du bébé Grossesse, urgence Signes de danger du nouveau-né Moins de deux mois, cordon, ictère, refus de téter Nouveau-né, urgence Blessure et saignement Plaies, brûlures, morsures, hémorragie Blessures, urgence Dépistage de la malnutrition Amaigrissement, œdèmes, périmètre brachial Nutrition Calendrier vaccinal Doses dues, doses en retard, rattrapage Vaccination Motif général Tout ce qui n'entre pas dans les précédents Triage Ce qu'une version apporte Chaque arbre porte un identifiant et un numéro de version, et cette paire est enregistrée avec la décision. Un cas ouvert en septembre reste explicable en mars, même si l'arbre a changé depuis : c'est la version d'origine qui est rejouée. Une version invalide — un embranchement qui pointe vers une question inexistante, un identifiant de règle en double, un signe d'alerte sans conséquence déclarée — est refusée au démarrage plutôt que découverte en production. Ce qui arrête l'arbre immédiatement Huit signes de danger généraux, repris du protocole PCIME communautaire — la prise en charge intégrée des maladies de l'enfant — interrompent le parcours dès qu'ils sont reconnus : convulsions, inconscience ou somnolence anormale, impossibilité de boire ou de téter, vomissement de tout ce qui est avalé, respiration très difficile, nuque raide, saignement abondant, corps très froid ou brûlant. Un seul suffit ; il n'y a pas de seuil à atteindre, pas de deuxième signe à attendre. L'arbre s'arrête, le niveau passe à 4 et plus aucune question n'est posée. La liste complète, avec la conduite à tenir , est publiée sur la page consacrée aux signes de danger . L'échelle de gravité de 0 à 4, du point de vue du citoyen Un niveau abstrait n'aide personne. Chaque niveau est donc traduit en trois éléments concrets : un délai, une destination et une date de rappel . Ces correspondances sont des tables fixes, pas des appréciations. Niveau Ce que cela veut dire Délai annoncé Destination Rappel de suivi 0 Soins possibles à la maison Aucun déplacement nécessaire Domicile, avec fiches de conseils 7 jours 1 Surveillance à domicile Sous 72 heures si rien ne change Relais communautaire 72 heures 2 Consultation nécessaire Dans les 24 heures Centre de santé 24 heures 3 Consultation le jour même Aujourd'hui Centre de santé 6 heures 4 Urgence Immédiatement, sans attendre Structure d'urgence la plus proche 2 heures Trois conséquences méritent d'être soulignées. D'abord, le service n'a pas de niveau « probablement rien » . En l'absence d'informations suffisantes, il ne redescend pas vers le bas de l'échelle : la situation est marquée comme information insuffisante et un humain est sollicité. Ensuite, les autres signaux ne peuvent que relever le niveau, jamais l'abaisser . Une grossesse, un nourrisson, une confiance de transcription basse, une divulgation de violence : chacun de ces éléments peut faire monter la gravité d'un cran. Aucun ne peut la faire descendre. Seule une personne habilitée peut corriger un niveau vers le bas, et seulement avec un motif écrit . Enfin, le niveau 4 déclenche autre chose qu'un texte . Un message d'urgence enregistré à l'avance dans les cinq langues du programme est prononcé, la structure de santé connue la plus proche est nommée quand l'annuaire en contient une, et un cas est ouvert avec une alerte vers un humain. Ce mécanisme est décrit en détail dans l'article sur l'escalade vers les relais communautaires . Deux questions de clarification, au maximum La tentation, quand un arbre a besoin de dix réponses, est de poser dix questions. Sur un appel vocal à deux dollars de crédit, depuis un téléphone partagé, c'est le meilleur moyen de faire raccrocher la personne avant la fin. La règle retenue est donc dure : deux questions de clarification par tour, pas une de plus . Quand l'arbre a besoin de davantage, il s'arrête, renvoie ce qu'il sait, et laisse le tour suivant continuer avec les réponses déjà collectées. Trois principes rendent cette limite tenable. Les réponses évidentes ne sont pas demandées. Une extraction déterministe lit d'abord la durée, l'âge, la grossesse, les symptômes et les signes de danger directement dans ce que la personne a dit, dans les cinq langues. Ce qui a déjà été entendu n'est pas redemandé. Les questions facultatives ne bloquent jamais. Seules les questions dont dépend un embranchement retiennent le parcours. Une urgence n'attend pas une clarification. Dès que le niveau 4 est atteint, la question en attente est abandonnée : la personne reçoit l'instruction de partir, pas un questionnaire. Cette économie de questions a un coût assumé : le service travaille souvent avec une information partielle. C'est précisément pourquoi il ne rassure pas par défaut. Ce que le citoyen reçoit vraiment À la fin d'un tour de triage, la personne reçoit un message parlé dans sa langue, court, et construit dans un ordre fixe : L'action d'abord : « allez au centre de santé aujourd'hui », « surveillez à la maison pendant deux jours », « partez maintenant, ne restez pas à la maison ». Le délai et la destination , tirés des tables ci-dessus, avec le nom de la structure la plus proche quand il est connu — et, quand il ne l'est pas, une phrase qui le dit franchement plutôt qu'une invention. Une explication brève , plafonnée à soixante mots, produite par le modèle à partir du texte d'orientation et des documents approuvés. Ce qui doit faire partir immédiatement , c'est-à-dire les signes de danger, rappelés à chaque niveau inférieur à 4. Un avertissement constant : ce service oriente et informe, il ne remplace pas un agent de santé. Trois filtres passent ensuite sur ce texte avant qu'il ne soit prononcé. Une recommandation qui ne s'appuie sur aucun document approuvé est remplacée par un texte de repli qui oriente vers le centre de santé — et l'incident est enregistré comme une violation de contrat. Toute phrase qui ressemble à une posologie chiffrée ou à un diagnostic est supprimée. Enfin, une situation de niveau 3 ou 4, une source manquante ou une confiance très basse sur un cas déjà sérieux imposent une revue humaine. Rendre le triage auditable : ce qui est enregistré Un service qui oriente des personnes vers des soins doit pouvoir montrer son travail. Pour chaque tour de triage, la plateforme conserve : l'identifiant et la version de l'arbre utilisé, ainsi que les identifiants des règles déclenchées ; les réponses collectées et le chemin réellement parcouru dans l'arbre ; le niveau retenu, la bande de risque, le délai et la destination ; les documents cités, vérifiés comme approuvés avant d'être retenus ; un vecteur de confiance à cinq dimensions — transcription, langue, intention, complétude des réponses, couverture documentaire — et non un score unique qui masquerait la dimension faible ; la langue, la province , l'heure, l'acteur, et si une revue humaine a été exigée. C'est cette trace qui permet de mesurer autre chose que la satisfaction : le taux de correction humaine par arbre, les règles qui se déclenchent le plus, les langues où la confiance de transcription s'effondre. Les organisations internationales qui documentent le triage communautaire, à commencer par l'Organisation mondiale de la santé , insistent sur ce point : ce qui n'est pas mesuré n'est pas amélioré. Les travaux publiés sur les agents de santé communautaires, notamment ceux recensés par l'UNICEF , montrent aussi que la qualité d'un dispositif tient moins à l'outil qu'à la boucle de supervision qui l'entoure. Ce que ce cadre ne fait pas Publier les limites fait partie du dispositif. Aujourd'hui : Aucun protocole n'est cliniquement approuvé. Tous portent la mention « en attente du comité de revue clinique », comme les documents de référence qui les soutiennent. Le service fonctionne, mais il fonctionne sous réserve. Ce n'est pas un service d'urgence. Devant un signe de danger, il faut partir vers la structure de santé la plus proche immédiatement, sans passer par le service. Cette phrase est répétée dans chaque réponse et sur la page des questions fréquentes . L'annuaire des structures est incomplet. Quand aucune structure n'est connue pour la zone, le service le dit au lieu d'en inventer une. Le triage ne soigne pas. Il oriente vers quelqu'un qui soigne. Sans relais communautaires en nombre suffisant et sans centres de santé approvisionnés, une bonne orientation reste une orientation sans effet. Les traductions des textes d'orientation sont des versions de travail , en attente de relecture par des locuteurs natifs , pour le kikongo et le tshiluba en particulier — un sujet traité dans le guide sur l'IA vocale en langues congolaises . Parler d'IA et triage en santé communautaire, c'est donc d'abord parler de discipline : écrire les règles avant d'écrire les prompts, versionner ce qui décide, enregistrer ce qui a été fait, et dire clairement où s'arrête la compétence de la machine. Le détail de l'offre est décrit sur la page des services de santé, d'agriculture et d'éducation .","date_published":"2026-08-26T00:00:00.000Z","date_modified":"2026-09-10T00:00:00.000Z","authors":[{"name":"Direction technique CONGO VOICE AI OS"}],"tags":["Santé communautaire","Santé","Triage","Sécurité","Gouvernance","RDC"],"language":"fr-CD","_cvos":{"cluster":"sante-communautaire","pillar":true,"entities":["triage","protocole de santé","échelle de gravité","signes de danger","PCIME","relais communautaire","moteur de protocoles","journal d'audit","orientation"],"takeaways":["La gravité d'une situation de santé n'est jamais décidée par un modèle de langage : elle sort d'un arbre de décision versionné, rejouable et relu.","L'échelle va de 0 à 4 et chaque niveau se traduit par une action datée pour le citoyen, du conseil à domicile au départ immédiat.","Un signe de danger arrête l'arbre sur-le-champ : niveau 4, message d'urgence enregistré, alerte d'un humain, sans question supplémentaire.","Le service pose au maximum deux questions de clarification par tour ; au-delà, il oriente plutôt que de continuer à interroger."],"wordCount":1877}},{"id":"https://congovoicecd.com/blog/reconnaissance-vocale-lingala","url":"https://congovoicecd.com/blog/reconnaissance-vocale-lingala","title":"Reconnaissance vocale en lingala : obstacles et méthode","summary":"La reconnaissance vocale en lingala bute sur le ton, l'agglutination et les emprunts : ce que couvrent les modèles ouverts, comment adapter et comment évaluer.","content_text":"Brancher un modèle multilingue sur une ligne téléphonique ne suffit pas à obtenir une reconnaissance vocale en lingala utilisable par un service public. Le lingala est une langue à tons, largement écrite sans marques tonales, agglutinante, saturée d'emprunts au français, et parlée très différemment selon qu'on se trouve à Kinshasa ou à Mbandaka. Chacun de ces traits a une conséquence mesurable sur la sortie d'un modèle de parole. Ce texte décrit ce qui casse, ce que couvrent réellement les modèles ouverts, comment adapter un système avec un corpus local, comment l'évaluer sur de l'audio de terrain, et ce que le programme fait aujourd'hui quand la confiance est basse. Ce qui rend la reconnaissance vocale en lingala difficile Les difficultés ne sont pas exotiques : elles sont structurelles, et elles se cumulent. Un modèle entraîné majoritairement sur des langues européennes écrites arrive avec des hypothèses implicites — un mot est court, la frontière entre deux mots est audible, l'orthographe note tout ce qui est distinctif — que le lingala ne valide pas. Le ton porte du sens, l'écriture courante ne le note pas Le lingala oppose des hauteurs mélodiques qui peuvent distinguer des mots et des formes verbales. L'orthographe employée au quotidien — dans les messages, les affiches, les manuels — n'écrit presque jamais ces tons. Un corpus transcrit selon l'usage courant donne donc au modèle une cible partiellement ambiguë : deux énoncés acoustiquement différents s'écrivent pareil, et le modèle n'est jamais pénalisé pour avoir choisi le mauvais. La conséquence pratique n'est pas dramatique pour un service d' orientation , parce que le contexte lève la plupart des ambiguïtés. Elle l'est davantage pour la synthèse vocale : une voix qui lit un texte sans ton produit une prosodie plate que des auditeurs natifs jugent sévèrement. C'est pourquoi le lexique du programme porte une indication de prononciation à côté du sens, séparément de la transcription : le ton est documenté là où il sert, sans alourdir la relecture de chaque échantillon. L'agglutination fait exploser le nombre de formes Dans un verbe lingala, le sujet, le temps et parfois l'objet sont soudés à la racine dans un seul mot. « Nazali » et « azali » ne diffèrent que par le préfixe de personne, et pourtant l'un parle de moi et l'autre de mon enfant. Deux effets suivent. D'abord, le vocabulaire apparent d'un corpus est immense : chaque racine engendre des dizaines de formes, dont beaucoup n'apparaissent qu'une ou deux fois. Un modèle qui travaille sur des mots entiers rencontre en permanence des formes inconnues ; il faut des unités sous-lexicales, apprises sur le corpus lui-même, pour que la couverture tienne. Ensuite, la métrique ment. Le taux d'erreur de mots compte un mot comme faux dès qu'un seul caractère diffère. En lingala, se tromper de préfixe de personne ou d'un marqueur de temps détruit statistiquement un mot entier alors que le sens reste souvent récupérable — et, inversement, une confusion de préfixe peut changer le patient d'une consultation. Nous mesurons donc systématiquement le taux d'erreur de caractères à côté du taux d'erreur de mots, et surtout le rappel des entités qui décident : durée en jours, âge en mois, personne concernée, présence d'un signe de danger . Les emprunts au français ne sont pas des fautes Le vocabulaire technique arrive en français à l'intérieur de la phrase : fièvre, tension, vaccin, engrais, division, examen. Un modèle qui traite l'énoncé comme monolingue a deux mauvaises options : forcer une graphie lingala approximative sur le mot français, ou basculer l'ensemble de l'hypothèse vers le français et détruire le reste. Les deux se voient en production. Le traitement correct passe par un étiquetage de langue au niveau de la portion d'énoncé, décrit dans notre article sur le mélange français-lingala dans une même phrase . Kinshasa n'est pas Mbandaka Le lingala de Kinshasa a simplifié une partie des accords de classe et absorbé massivement le français. Le lingala parlé plus haut sur le fleuve, du côté de Mbandaka et de l'Équateur, conserve des accords plus complets et un lexique différent. Ce n'est pas une nuance académique : un modèle nourri d'audio kinois est excellent à Kinshasa et médiocre en amont, exactement là où l'alternative au service vocal est la plus faible. Il n'existe pas de solution technique à cela. Il existe une méthode de collecte : des quotas par province , une évaluation découpée par région, et le refus d'ouvrir une langue dans un module sur la foi d'une moyenne nationale. Le détail des seuils appliqués par langue figure sur la page des langues nationales du programme . Que couvrent réellement les modèles multilingues ouverts ? Il faut distinguer trois familles, et surtout distinguer la couverture annoncée de l'exactitude constatée. Famille de modèles Ce qui est annoncé pour le lingala Ce que cela vaut sur un appel réel Usage retenu par le programme Reconnaissance multilingue supervisée à grande échelle Le lingala est absent ou marginal des langues bien servies Sortie souvent aspirée vers le français ou le swahili Base pour le français et pour l'identification de la langue Modèles massivement multilingues issus d'apprentissage auto-supervisé Couverture nominale très large, jusqu'à plus de mille langues Utilisable après adaptation, très variable selon le dialecte Point de départ pour l'adaptation par langue Corpus communautaires ouverts Quelques langues africaines bien dotées, les langues bantoues d'Afrique centrale peu Trop peu d'heures pour entraîner seul Modèle de gouvernance de la collecte, pas source de données Les travaux publiés par Meta AI sur la reconnaissance vocale de plus de mille langues et par OpenAI avec le modèle Whisper ont réellement déplacé la frontière : ils rendent crédible un point de départ pour une langue peu dotée, là où il fallait tout construire il y a cinq ans. Ils ne rendent pas un service public opérationnel. La couverture nominale d'une langue signifie qu'un jeton de langue existe et qu'un peu de données est passé par l'entraînement ; elle ne dit rien du comportement sur un appel de trente secondes, compressé, en présence de bruit, avec du code-switching et un vocabulaire médical. Nous ne publions volontairement aucun taux d'erreur comparatif entre ces modèles en lingala. Nous n'avons pas de jeu d'évaluation public, reproductible et suffisamment large pour qu'un tel chiffre veuille dire quelque chose, et un chiffre non reproductible ne vaut rien pour un programme financé sur fonds publics. Ce que nous publions, ce sont les seuils qu'une langue doit franchir avant d'être ouverte, et la conduite tenue quand elle ne les franchit pas. Adapter un modèle avec un corpus local L'adaptation ne commence pas par l'entraînement. Elle commence par des conventions écrites, avant la première heure collectée. Fixer les conventions de transcription. Comment écrit-on un mot français à l'intérieur d'une phrase lingala ? Écrit-on les nombres en chiffres ou en lettres ? Note-t-on les hésitations, les reprises, les rires ? Sans réponse écrite, le désaccord entre relecteurs devient du bruit d'entraînement indiscernable d'une erreur du modèle. Collecter par quotas. Province, genre, tranche d'âge, canal d'entrée, domaine — santé, agriculture, éducation. Un corpus déséquilibré produit un modèle déséquilibré, et le déséquilibre se voit d'abord sur les voix les moins représentées. Faire relire par des locuteurs natifs . Chaque échantillon est validé, corrigé ou rejeté, avec l'auteur de la décision et l'horodatage. Les échantillons dont la confiance du système est basse, et ceux que le citoyen a signalés, passent en tête de file. Enrichir un lexique local . Termes, sens en français, domaine, région, indication de prononciation. Ce lexique est la mémoire du service : noms de maladies, de plantes, d'outils, de gestes. Injecter avant de réentraîner. Les exemples vérifiés et les entrées de lexique proches d'un nouveau message sont retrouvés et fournis au traitement à chaque demande. L'effet est immédiat, sans réentraînement, et il porte surtout sur la compréhension et la restitution. Exporter pour l'affinage. Les paires audio et transcription vérifiées sont exportables comme jeu de données pour affiner un modèle de parole et une voix de synthèse. C'est le chemin vers une écoute de niveau natif ; à ce stade du programme, cet affinage est prévu et outillé, il n'a pas encore été réalisé. Une remarque sur l'ordre : les points 1 à 5 améliorent le service dès la première semaine, le point 6 demande des mois. Un programme qui commence par le point 6 passe un an sans rien livrer. Comment évaluer la reconnaissance vocale en lingala sur le terrain Un score obtenu sur des enregistrements de studio ne prédit pas le comportement sur un appel passé depuis un champ. L'évaluation se fait donc sur deux jeux distincts, et les résultats ne se moyennent jamais. Mesure Ce qu'elle capture Seuil d'ouverture retenu Taux d'erreur de mots, audio propre Qualité de base du modèle 20 % maximum, 12 % en français Taux d'erreur de mots, audio de terrain 8 kHz Comportement réel en appel 30 % maximum Taux d'erreur de caractères Marge récupérable sur une langue agglutinante Suivi, sans seuil bloquant Exactitude de l'intention Rattachement au bon protocole 90 % en santé, 85 % ailleurs Rappel des situations d'urgence Ce qui ne se négocie pas 98 % minimum Identification de la langue Conditionne toute la suite 95 % minimum Intelligibilité de la voix de synthèse Est-ce qu'on écoute jusqu'au bout 3,8 sur 5 en écoute native Trois règles encadrent ces mesures. La première : le jeu d'évaluation est annoté séparément du corpus d'entraînement, par d'autres relecteurs, et jamais réutilisé pour améliorer un modèle. La deuxième : les résultats sont découpés par province, par genre et par tranche d'âge, parce qu'une moyenne nationale masque exactement les publics que le service prétend rejoindre. La troisième : le rappel des situations d'urgence prime sur tout le reste. Un modèle qui gagne deux points de taux d'erreur de mots en perdant un point de rappel d'urgence est refusé. Ce que le programme fait quand la confiance est basse C'est la partie la plus importante, et la moins spectaculaire. Un service public n'a pas le droit de deviner. La confiance est calculée par segment , pas globalement. Un énoncé peut être sûr sur la durée des symptômes et incertain sur l'âge de l'enfant ; seul l'élément incertain est redemandé. La reformulation précède la question. Le service dit ce qu'il a compris, puis pose une question fermée sur le point critique. Une question fermée est beaucoup plus robuste qu'une question ouverte quand la transcription est mauvaise. Deux tentatives, puis un humain. Après deux échecs, la conversation est orientée vers un relais communautaire , un agent agricole ou un enseignant selon le module, avec l'audio d'origine et ce qui a été compris. Sous le seuil, la langue bascule en mode guidé. Messages enregistrés par des locuteurs natifs, navigation par touches, questions les plus fréquentes. Un menu simple qui fonctionne vaut mieux qu'une conversation qui comprend de travers. La détection des signes de danger ne dépend pas du modèle. Des listes de termes écrites dans les cinq langues — en lingala, des expressions comme « akoki kopema te » ou « makila » — sont appliquées sur la transcription avant tout appel à un modèle de langage. Si tous les fournisseurs sont indisponibles, la conduite à tenir en urgence reste diffusée. Chaque incompréhension nourrit le corpus. Un signalement du citoyen remet l'échantillon en tête de la file de relecture ; c'est le mécanisme décrit dans le guide sur la construction d'un corpus vocal en langues nationales . Reconnaissance vocale en lingala : ce qui reste ouvert La qualité de la reconnaissance vocale en lingala progresse par la relecture, pas par les annonces. À ce stade : Aucun affinage de modèle de parole sur le corpus congolais n'a encore été réalisé ; l'export du jeu de données existe, l'entraînement reste à faire. Le choix entre un modèle unique pour le lingala et des variantes régionales n'est pas tranché ; il dépendra des écarts mesurés entre Kinshasa et l'Équateur. Les textes d'interface en lingala sont des versions de travail, en attente de validation par des linguistes de la langue. Les protocoles de santé portent la mention « en attente du comité de revue clinique » tant que ce comité n'est pas constitué. Aucun volume national n'est publié : les chiffres visibles proviennent de l'environnement de préparation du pilote et sont étiquetés comme tels. Le fond de la méthode tient en une phrase : sur une langue peu dotée, la seule chose honnête à publier avant d'avoir des données est la règle qu'on s'impose quand on n'a pas compris. Le reste — les modèles, les seuils, les corpus — se mesure, se corrige et se remesure, ce que détaille le guide complet sur l'IA vocale en langues congolaises .","date_published":"2026-08-26T00:00:00.000Z","date_modified":"2026-09-10T00:00:00.000Z","authors":[{"name":"Direction technique CONGO VOICE AI OS"}],"tags":["Langues et parole","Langues","Reconnaissance vocale","Lingala","Corpus","RDC"],"language":"fr-CD","_cvos":{"cluster":"langues-peu-dotees","pillar":false,"entities":["lingala","Kinshasa","Mbandaka","agglutination","ton lexical","taux d'erreur de mots","identification de la langue","corpus vocal","mode guidé","audio de terrain"],"takeaways":["Le lingala n'est pas une langue « presque servie » par les modèles multilingues : la couverture nominale existe, l'exactitude sur de l'audio de terrain reste à construire.","Le taux d'erreur de mots pénalise durement une langue agglutinante : une seule syllabe fausse détruit un mot entier, d'où la mesure conjointe du taux d'erreur de caractères.","Un corpus collecté uniquement à Kinshasa produit un modèle qui marche à Kinshasa : les quotas par province font partie de la méthode, pas du confort.","Quand la confiance baisse, le service redemande sur le seul élément critique, puis passe la main à un humain — il ne devine pas."],"wordCount":2033}}]}