# Module 5 — L'économie réelle des échanges entre modèles ## Section 1 — Démarrer ### Comment utiliser ce cours Ce module représente environ **7 heures** de travail. Chemin conseillé : 1. **Lisez les chapitres 1 à 5** (la mécanique économique) — 100 minutes. 2. **Faites la démonstration commentée du chapitre 6** (estimer un coût avec Claude, comparer avec ChatGPT) — 30 minutes. 3. **Réalisez l'atelier du chapitre 7** (business case Connectia) — 90 minutes. 4. **Étudiez l'exemple travaillé du chapitre 8**, puis **produisez votre livrable** (chapitre 9) — 60 minutes. 5. **Faites les mini-exercices et le quiz** (chapitre 10), vérifiez avec les **corrigés en annexe D** — 30 minutes. 6. **Parcourez la FAQ (chapitre 11)** et gardez la **fiche mémo (annexe A)**. > **Conventions de lecture.** Les blocs à chasse fixe sont des **prompts à copier-coller**. Les encadrés « Piège », « Bonne pratique », « Le saviez-vous » et ⚠️ « Attention » signalent un point clé. ------------------------------------------------------------------------ ### Fiche du module | Rubrique | Valeur | |----|----| | Module | 5 — L'économie réelle des échanges entre modèles | | Palier | Avant-garde (Praticien) | | Durée | 7 heures | | Prérequis | Palier Débutant validé (Modules 1 à 4) | | Plateforme d'atelier | Claude (terrain principal) + ChatGPT (benchmark) | | Compétence clé visée | Estimer et arbitrer le coût d'une chaîne IA | | Promesse portée | Réduction des coûts 30–50 % (en priorité) | | Votre livrable | Mini business case chiffré | | Validation | Quiz ≥ 75 % + business case conforme à la grille (14/20) | ------------------------------------------------------------------------ ## Section 2 — Comprendre ### Ch.1 — Pourquoi l'économie transforme l'IA en argument ## 1.1 Du gadget au business case Une démonstration d'IA impressionne ; un **business case chiffré** convainc. La promesse de **réduction des coûts de 30 à 50 %** ne tient que si vous savez démontrer, chiffres en main, que le coût d'exploitation d'une chaîne IA est très inférieur au coût humain qu'elle remplace ou augmente. Ce module vous apprend à passer du « c'est génial » au « voici ce que cela coûte, voici ce que cela économise, voici le retour sur investissement ». ## 1.2 Protéger la marge des projets Un consultant qui ignore l'économie des tokens peut concevoir une solution techniquement brillante mais **ruineuse à l'usage**. Savoir arbitrer le coût, c'est savoir défendre un pricing (TJM 250 000–350 000 XAF) par la valeur, et c'est aussi protéger votre rentabilité sur chaque engagement. > **Idée force du module.** Le coût d'une chaîne IA n'est pas un détail technique : c'est un **levier d'arbitrage**. Le meilleur système n'est pas le plus puissant, c'est celui qui crée le plus de valeur au plus bas coût soutenable. > > **Le saviez-vous ?** Sur une tâche à fort volume, choisir un modèle léger plutôt qu'un grand modèle peut diviser la facture par 10 à 30 — sans perte de qualité perceptible, parce que la tâche n'avait pas besoin de la pleine puissance. Savoir router est la première source d'économie. ------------------------------------------------------------------------ ### Ch.2 — Objectifs et compétences visées À l'issue de ce cours, vous serez capable de : 1. **Estimer** le coût d'une requête et le volume mensuel d'un cas d'usage. 2. **Comparer** deux modèles sur une même tâche et calculer l'écart de coût. 3. **Arbitrer** le triangle coût / performance / latence. 4. **Identifier** les leviers d'économie (modèle léger, contexte court, caching, regroupement) et comparer au coût humain remplacé. ------------------------------------------------------------------------ ### Ch.3 — Pourquoi ça compte pour votre organisation | Promesse | Comment l'économie la sert | |----|----| | Réduction des coûts 30–50 % | **Promesse centrale** : démontrer chiffres en main l'économie d'une chaîne IA | | Productivité ×3 | Un coût maîtrisé permet de déployer l'IA à plus grande échelle | | Sécurité / conformité | Arbitrer le modèle inclut où vit la donnée (un modèle hébergé peut coûter plus mais sécuriser) | ------------------------------------------------------------------------ ### Ch.4 — Concepts et vocabulaire clés - **Coût par token** — prix unitaire facturé par le fournisseur, distinct en **entrée** (tokens envoyés) et en **sortie** (tokens générés, souvent plus chers). - **Coût par requête** — coût total d'un échange = (tokens d'entrée × tarif entrée) + (tokens de sortie × tarif sortie). - **Modèle « frontier » vs modèle léger** — un grand modèle est plus capable mais coûte 10 à 30 fois plus cher par token ; beaucoup de tâches simples n'en ont pas besoin. - **Arbitrage coût / performance / latence** — un modèle plus puissant coûte plus cher et répond souvent plus lentement ; il faut choisir le point d'équilibre selon l'enjeu. - **Coût marginal vs coût fixe** — l'IA a un coût marginal quasi nul à l'unité, mais une facture qui explose au volume si elle est mal gouvernée. - **Caching de contexte** — réutilisation d'un contexte déjà traité pour éviter de le repayer ; levier d'économie majeur sur les tâches répétitives. > **Piège classique.** Croire que « le meilleur modèle » est toujours le bon choix. Sur un tri de tickets simples, un grand modèle, c'est payer une Rolls pour aller chercher le pain : surcoût sans bénéfice. ------------------------------------------------------------------------ ### Ch.5 — Comprendre en profondeur ## 5.1 La formule de coût d'une requête Le coût d'une requête se calcule simplement : > **Coût = (tokens d'entrée × tarif d'entrée) + (tokens de sortie × tarif de sortie)** Deux conséquences pratiques : **doubler la longueur du document** mis en contexte **double le coût d'entrée** ; et comme les tokens de sortie sont souvent plus chers, **demander des réponses concises** réduit la facture. ## 5.2 Estimer un volume mensuel Pour un cas d'usage : **nombre de requêtes/jour × tokens moyens par requête × 22 jours ouvrés**. Cette estimation, même approximative, suffit à arbitrer — et à comparer au coût humain. ## 5.3 Le triangle coût / performance / latence Trois forces en tension : un modèle plus **puissant** coûte plus cher et répond plus lentement. On choisit le point d'équilibre selon l'enjeu : | Type de tâche | Modèle conseillé | Pourquoi | |----|----|----| | Tri, classification, extraction simple | Léger | Volume élevé, qualité suffisante, coût minimal | | Rédaction de qualité, raisonnement | Puissant | L'enjeu justifie le surcoût | | Réponse en temps réel (chat) | Léger ou intermédiaire | La latence prime | ## 5.4 Les leviers d'économie Quatre leviers, par ordre d'impact : (1) **router** les tâches simples vers un modèle léger ; (2) **raccourcir le contexte** (ne mettre que le nécessaire) ; (3) **activer le caching** sur les contextes répétés ; (4) **regrouper** les requêtes quand c'est possible. **Mini-exercice 5.A.** Une requête envoie 2 000 tokens d'entrée et génère 500 tokens de sortie. Le tarif d'entrée est 1 unité / 1 000 tokens, le tarif de sortie 3 unités / 1 000 tokens. Quel est le coût de la requête (en unités) ? *(Corrigé en annexe D.)* ------------------------------------------------------------------------ ## Section 3 — Pratiquer ### Ch.6 — Démonstration commentée : faire chiffrer et comparer Claude peut vous aider à structurer une estimation de coût, et ChatGPT sert à **benchmarker** votre raisonnement. ## 6.1 Structurer une estimation avec Claude Collez : `Aide-moi à estimer le coût mensuel d'un assistant qui rédige une première réponse pour 600 tickets de support par mois, dont 70 % sont répétitifs. Hypothèses à poser explicitement : tokens moyens par ticket (entrée + sortie), tarifs entrée/sortie (à laisser en variables), nombre de requêtes. Donne la formule, puis un ordre de grandeur, en précisant que tous les tarifs sont à revérifier.` **Sortie typique attendue :** une décomposition claire (volume × tokens × tarifs), une formule, un ordre de grandeur, et la mention « tarifs à revérifier ». C'est exactement la structure de votre futur business case. ## 6.2 Benchmarker avec ChatGPT Posez la **même** question à ChatGPT. Comparez : les deux estimations convergent-elles ? Les hypothèses sont-elles cohérentes ? Cette **validation croisée** est une bonne pratique du palier Avant-garde : on ne s'appuie jamais sur une seule source pour un chiffre qu'on présentera à un client. > **Bonne pratique.** Gardez toujours vos **hypothèses explicites et datées**. Un business case n'est pas faux parce qu'il repose sur des hypothèses ; il est faux quand les hypothèses sont cachées ou présentées comme des certitudes. ------------------------------------------------------------------------ ### Ch.7 — Mode opératoire détaillé (action par action) ## 7.0 Prérequis de l'atelier - un **compte Claude** actif (et idéalement un accès ChatGPT pour le benchmark) ; - les **prompts du module** (dossier `prompts/`) ; - une **calculatrice** ou un tableur ; - environ **90 minutes** + le gabarit du business case (chapitre 9). ## 7.1 Atelier — étape 1 : estimer le coût de la chaîne IA **Cas.** Le support de Connectia reçoit **600 tickets/mois** ; **70 % sont des questions répétitives**. On veut un assistant qui rédige une première réponse, validée par un humain. 1. Posez vos **hypothèses** : tokens moyens par ticket (ex. 800 entrée + 400 sortie), tarifs entrée/sortie (en variables, à revérifier), nombre de tickets traités par l'IA (les 70 % répétitifs ≈ 420/mois). 2. Calculez le **coût mensuel de la chaîne** : 420 tickets × (coût par requête). Utilisez le prompt `01_estimation_cout.txt` pour structurer et vérifier votre calcul. 3. Exprimez le résultat en **ordre de grandeur** et en devise, hypothèses affichées. **Checklist de vérification — étape 1.** Avant de passer à l'étape 2, assurez-vous que : - \[ \] vos hypothèses (tokens, tarifs, volume) sont explicites et marquées « à revérifier » ; - \[ \] le calcul applique la formule entrée + sortie ; - \[ \] le coût est exprimé en ordre de grandeur **et** en devise. ## 7.2 Atelier — étape 2 : comparer au coût humain et trouver les leviers 1. Estimez le **coût humain** équivalent : combien de temps un agent met-il à rédiger 420 premières réponses/mois ? Convertissez en coût (taux horaire interne, à valider). 2. Calculez l'**économie nette** : (coût humain − coût IA) / coût humain, en pourcentage et en devise. 3. Identifiez **deux leviers d'optimisation** concrets (ex. modèle léger pour le tri, modèle plus capable seulement pour les cas complexes ; caching des réponses types). Le prompt `02_leviers_optimisation.txt` peut vous aider. **Checklist de vérification — étape 2.** Avant de produire votre livrable, assurez-vous que : - \[ \] l'économie est exprimée en pourcentage **et** en devise ; - \[ \] au moins deux leviers d'optimisation sont proposés ; - \[ \] vous savez expliquer pourquoi router vers un petit modèle réduit la facture. > \[!WARN\] **Attention — ne présentez jamais un chiffre comme certain.** Les tarifs des modèles évoluent et vos hypothèses de volume sont approximatives. Présentez toujours une **fourchette** et la mention « à confirmer lors d'un audit ». Un chiffre faux présenté comme exact détruit votre crédibilité. ## 7.3 Transposition Microsoft Copilot Dans l'écosystème Microsoft, le coût se raisonne souvent par **licence** (Copilot par utilisateur) plutôt que par token. Le principe d'arbitrage reste : comparer le coût (licences) à la valeur (temps gagné). Savoir raisonner en tokens vous permet de comprendre ce qui se cache derrière une licence. ## 7.4 Bonnes pratiques et pièges - Hypothèses toujours explicites et datées. - Comparez systématiquement au coût humain remplacé. - Routez les tâches simples vers un modèle léger. - Présentez des fourchettes, jamais des certitudes. **Mini-exercice 7.A.** Citez deux leviers pour réduire le coût d'entrée d'une chaîne qui résume de longs documents. *(Corrigé en annexe D.)* ------------------------------------------------------------------------ ### Ch.8 — Exemple travaillé : un mini business case Connectia Voici le livrable attendu, **entièrement déroulé** (chiffres illustratifs, à revérifier). ## 8.1 Hypothèses | Hypothèse | Valeur (à valider) | |-------------------------------------|-----------------------| | Tickets/mois traités par l'IA | 420 (70 % de 600) | | Tokens par ticket (entrée + sortie) | 800 + 400 = 1 200 | | Tarif (variables) | entrée tE, sortie tS | | Temps humain par première réponse | 8 minutes | | Coût horaire interne | 8 000 XAF (à valider) | ## 8.2 Coût de la chaîne IA Coût par requête = 800 × tE + 400 × tS. Coût mensuel = 420 × (coût par requête). En ordre de grandeur, avec des tarifs courants de modèles **légers**, on obtient un coût mensuel de l'ordre de **quelques dizaines de milliers de XAF** — très inférieur au coût humain (à confirmer). ## 8.3 Coût humain comparé et économie Temps humain = 420 × 8 min ≈ 56 h/mois. Coût humain ≈ 56 × 8 000 = **448 000 XAF/mois** (à valider). Si la chaîne IA coûte de l'ordre de 40 000 à 80 000 XAF/mois, l'**économie nette** est de l'ordre de **80 %** sur cette tâche (fourchette, à confirmer par audit). À cela s'ajoute la productivité : les agents se concentrent sur les 30 % de cas complexes. ## 8.4 Deux leviers d'optimisation 1. **Router** : modèle léger pour rédiger les réponses aux 70 % de cas répétitifs ; modèle plus capable réservé aux cas complexes traités par l'humain. 2. **Caching** : mettre en cache les réponses types récurrentes pour ne pas les repayer à chaque fois. > **Pourquoi cet exemple est bon.** Hypothèses explicites et datées ; coût exprimé en fourchette ; comparaison au coût humain ; économie en % et en devise ; deux leviers concrets. Défendable devant un dirigeant. ------------------------------------------------------------------------ ## Section 4 — Livrable & évaluation ### Ch.9 — Votre livrable ## 9.1 Consigne Produisez un **mini business case chiffré** pour le cas Connectia : estimation du volume, coût mensuel de la chaîne IA (hypothèses explicites), coût humain comparé, économie nette en pourcentage et en devise, et deux leviers d'optimisation. Marquez les tarifs « à revérifier ». ## 9.2 Grille de notation (sur 20 — seuil : 14/20) | Critère | Points | |------------------------------------------------------|--------| | Hypothèses explicites et datées | 4 | | Calcul du coût IA cohérent (formule entrée + sortie) | 5 | | Comparaison au coût humain | 4 | | Économie en % ET en devise | 4 | | Deux leviers d'optimisation pertinents | 3 | ## 9.3 Checklist avant de déposer - \[ \] Toutes mes hypothèses sont visibles et marquées « à valider ». - \[ \] Mon coût IA applique la formule entrée + sortie. - \[ \] J'ai comparé au coût humain équivalent. - \[ \] L'économie est en pourcentage **et** en devise. - \[ \] J'ai proposé deux leviers concrets. - \[ \] J'ai présenté une fourchette, pas une certitude. Déposez votre business case sur le canal Teams (ou portfolio) avant J+2. ------------------------------------------------------------------------ ### Ch.10 — Auto-évaluation ## 10.1 Quiz (seuil : 4 bonnes réponses sur 5) 1. Qu'est-ce qui coûte généralement le plus cher, les tokens d'entrée ou de sortie ? Pourquoi varier la longueur compte-t-il ? 2. Citez trois leviers d'économie. 3. Pourquoi un grand modèle n'est-il pas toujours le bon choix ? 4. Comment le caching réduit-il le coût ? 5. Pourquoi toujours présenter une fourchette plutôt qu'un chiffre exact ? Répondez par vous-même, **puis** vérifiez avec l'**annexe D**. ## 10.2 Auto-positionnement Reportez votre niveau sur la grille d'auto-évaluation, ligne « Économie des échanges ». ------------------------------------------------------------------------ ### Ch.11 — Points de vigilance : les pièges fréquents de ce module Avant de continuer, prenez 2 minutes pour vérifier les 3 confusions les plus fréquentes sur ce module — même après un score correct au quiz, elles reviennent souvent dans la pratique. | Piège fréquent | Pourquoi c'est trompeur | Comment corriger | |----|----|----| | Présenter un **chiffre comme certain** | Une estimation non qualifiée se transforme en fausse certitude aux yeux du décideur | Donnez toujours une fourchette accompagnée d'un « à revérifier » | | Choisir **le grand modèle par défaut** | Le modèle le plus puissant n'est pas toujours le bon choix économique | Arbitrez toujours entre coût, performance et latence avant de choisir | | Oublier de **comparer au coût humain** | Sans point de comparaison, il n'y a pas de business case | Chiffrez systématiquement l'alternative humaine avant de conclure | Si l'une de ces confusions vous parle, revisitez **Ch.4 — Concepts et vocabulaire clés** ou **Ch.6 — Démonstration commentée** avant de passer au module suivant. ### Ch.12 — Questions fréquentes (FAQ) **« Je n'ai pas les vrais tarifs. Puis-je quand même chiffrer ? »** Oui : posez les tarifs en variables ou en fourchette, et marquez « à revérifier ». Un raisonnement clair vaut mieux qu'un faux chiffre. **« Le client raisonne en licences, pas en tokens. »** Traduisez : la licence est un forfait ; comprendre les tokens vous permet d'expliquer ce qu'elle couvre et d'arbitrer entre approches (licence vs usage à la requête). **« Un modèle léger est-il vraiment suffisant ? »** Pour beaucoup de tâches (tri, extraction, réponses types), oui — et il divise la facture. Réservez le grand modèle aux tâches qui l'exigent. **« L'IA coûte si peu, pourquoi gouverner les coûts ? »** Parce qu'au **volume**, des centimes par requête deviennent des millions par an. La gouvernance des coûts (Module 11) évite la dérive. ------------------------------------------------------------------------ ### Ch.13 — Pour aller plus loin - Refaites le calcul pour un cas de **votre** service ; comparez deux hypothèses de modèle. - Entraînez-vous à exprimer une économie en jours-personnes **et** en devise. - Tenez une **table de fourchettes** de tarifs que vous réactualisez régulièrement. **Et ensuite — Module 6 :** vous découvrez la **stratégie multi-modèles** — pourquoi et comment combiner plusieurs modèles (routing, spécialisation, repli) pour optimiser qualité, coût et risque. ------------------------------------------------------------------------ ## Annexes (ressources) ### Mémo · Prompts · Glossaire · Corrigés - **Coût requête = (tokens entrée × tarif entrée) + (tokens sortie × tarif sortie).** Sortie souvent plus chère. - **Volume mensuel ≈ requêtes/jour × tokens moyens × 22.** - **Leviers :** router vers un modèle léger · raccourcir le contexte · caching · regrouper. - **Triangle :** coût / performance / latence — choisir selon l'enjeu. - **Toujours :** hypothèses explicites, fourchettes, comparaison au coût humain, « à revérifier ». # Annexe B — Vos prompts du module Dans `prompts/` : `00_contexte_projet_claude.txt`, `01_estimation_cout.txt`, `02_leviers_optimisation.txt`. # Annexe C — Glossaire express | Terme | En une phrase | |-------------------------|------------------------------------------------| | Coût par token | Prix unitaire (entrée ≠ sortie) | | Coût par requête | Entrée × tarif + sortie × tarif | | Modèle frontier / léger | Très capable et cher / suffisant et économique | | Latence | Délai de réponse | | Caching | Réutiliser un contexte déjà payé | | Coût marginal | Quasi nul à l'unité, explose au volume | # Annexe D — Corrigés **Mini-exercice 5.A.** Coût = (2 000/1 000 × 1) + (500/1 000 × 3) = 2 + 1,5 = **3,5 unités**. **Mini-exercice 7.A (exemple).** (1) Résumer/segmenter les documents en amont pour n'envoyer que les passages pertinents (réduit les tokens d'entrée) ; (2) activer le caching du contexte commun si plusieurs requêtes portent sur le même document. **Quiz — corrigé.** 1. Les tokens de sortie coûtent souvent plus cher ; demander des réponses concises et limiter le contexte réduit la facture. 2. Router vers un modèle léger ; raccourcir le contexte ; activer le caching (ou regrouper les requêtes). 3. Parce que beaucoup de tâches simples n'ont pas besoin de sa puissance : on paie un surcoût de 10 à 30× sans bénéfice. 4. En évitant de repayer le traitement d'un contexte déjà vu (réutilisation), sur les tâches répétitives. 5. Parce que les tarifs évoluent et les volumes sont estimés : une fourchette honnête protège la crédibilité, un faux chiffre exact la détruit.