Écrit par

Créer une vidéo de formation avec l’IA prend quelques minutes sur les plateformes d’avatars : on colle un texte, on choisit un présentateur, on clique sur « Générer ». Le problème, c’est que ce type de vidéo n’apprend pas grand-chose. Une vidéo de formation efficace se prépare comme un module pédagogique : un objectif clair, des séquences courtes, un script écrit pour l’oral, de l’interaction, une relecture rigoureuse et un cadre juridique maîtrisé. Ce guide détaille le workflow que nous utilisons avec les équipes formation, de l’objectif à la mise à jour, avec des modèles prêts à l’emploi, un exemple complet et les points de vigilance propres à la France.
Cet article fait partie de notre guide des générateurs vidéo IA.
Réponse courte : comment créer une vidéo de formation avec un avatar IA ? En huit étapes : 1. fixer un objectif pédagogique ; 2. découper en séquences de moins de six minutes ; 3. écrire un script pour l’oral ; 4. choisir l’avatar et la voix, avec le consentement des personnes représentées ; 5. produire en alternant avatar et visuels ; 6. ajouter de l’interaction ; 7. relire, sous-titrer et signaler l’usage de l’IA ; 8. diffuser dans votre plateforme de formation, mesurer et mettre à jour.
En bref
Une vidéo avec avatar est pertinente dans certains cas précis, et contre-productive dans d’autres.
Elle fonctionne bien pour :
Elle fonctionne mal pour :
Règle pratique : si le message doit être identique pour tous, souvent mis à jour et compris dans plusieurs langues, l’avatar est un bon choix. S’il doit convaincre, émouvoir ou montrer un geste, privilégiez une personne filmée ou un autre format.
Tout commence par une phrase : « À la fin de cette vidéo, l’apprenant saura… ». Un verbe d’action observable (déclarer, choisir, repérer, appliquer), un contexte, un critère de réussite. Exemple : « À la fin de cette vidéo, le nouvel arrivant saura déclarer un incident de sécurité dans l’outil interne en moins de cinq minutes. »
Posez aussi trois questions : qui est le public (métier, niveau, langue), où la vidéo sera regardée (poste de travail, téléphone, salle de pause), et comment vous vérifierez que l’objectif est atteint (quiz, mise en situation, observation).
Une vidéo de vingt minutes est rarement regardée jusqu’au bout. L’étude de Guo, Kim et Rubin sur 6,9 millions de sessions montre que les vidéos courtes sont nettement plus engageantes, avec une chute marquée au-delà de six minutes. Visez trois à six minutes par séquence, une idée principale par séquence, et un enchaînement logique dans le parcours. Les services pédagogiques des universités font la même recommandation pour les capsules vidéo, en insistant sur la fonction de chaque capsule dans le parcours (La Rochelle Université).
Structure type d’une séquence :
Un avatar lit exactement ce que vous écrivez. Un texte rédigé pour être lu devient pesant quand il est dit. Quelques règles :
Modèle de script à dupliquer pour chaque séquence :
Séquence : [titre]
Objectif : À la fin, l’apprenant saura [verbe + contexte].
Durée visée : [3 à 6 minutes]
Scène 1 – Accroche : [situation ou question, 2 phrases]
Scène 2 – Point 1 : [explication, 3 à 5 phrases] | Visuel : [schéma, capture]
Scène 3 – Point 2 : [explication] | Visuel : [démonstration]
Scène 4 – Question : [question] | Réponses : [A / B / C] | Bonne réponse : [x] | Retour : [1 phrase]
Scène 5 – Point 3 : [explication] | Visuel : [exemple]
Scène 6 – À retenir : [3 points] | Suite : [séquence suivante]
Un assistant conversationnel peut transformer un support écrit en premier jet de script. Donnez-lui l’objectif, le public, la durée et la structure ci-dessus, puis relisez chaque phrase. Notre guide du prompt engineering détaille la méthode.
Trois options, selon votre contexte :
Pour la voix, choisissez une voix française naturelle ou clonez celle de la personne représentée, avec son accord. Testez-la sur un passage contenant vos termes métier.
Pour créer un double numérique en pratique, notre guide HeyGen détaille les étapes, vidéo à l’appui.
Choisissez la plateforme selon vos besoins. Nos guides détaillent les deux principales : HeyGen, orienté double numérique et traduction avec synchronisation labiale, et Synthesia, orienté formation d’entreprise et intégration aux plateformes de formation.
Dans les deux cas, n’enchaînez pas six minutes d’avatar plein écran. L’étude edX déjà citée montre que les vidéos qui alternent présentateur et diapositives sont plus engageantes que les diapositives seules. Alternez :
Astuce budget : sur HeyGen, faites vos essais avec le modèle d’avatar le plus économique, puis générez la version finale avec le modèle le plus réaliste. HeyGen affiche le coût en crédits avant chaque génération.
💡 À ne pas confondre avec un agent IA : générer une vidéo à partir de votre script reste une production à la demande. Les outils qui écrivent le script, choisissent les visuels et assemblent la vidéo à partir d’une simple consigne (comme Video Agent chez HeyGen) enchaînent plusieurs étapes en autonomie, ce qui relève des agents IA. Pour découvrir les agents IA autonomes (qui exécutent plusieurs étapes en chaîne), voir notre cocon Agents IA.
Une vidéo regardée passivement s’oublie vite. Prévoyez au moins une interaction toutes les deux à trois minutes :
Les deux plateformes citées proposent des quiz et des embranchements selon la formule : dès Creator chez Synthesia, sur la formule Business chez HeyGen. Sinon, placez les questions dans votre plateforme de formation, entre les vidéos.
La relecture en trois passes :
L’accessibilité :
Ces points rejoignent les règles d’accessibilité des contenus web (WCAG), dont le W3C publie une traduction française officielle (W3C, WCAG 2.2).
La mention de l’IA : annoncez clairement, en début de vidéo ou dans le parcours, que le présentateur est un avatar généré par IA (voir la section juridique).
Diffuser. Téléchargez la vidéo en MP4, intégrez-la par un lien qui se met à jour automatiquement, ou exportez-la au format SCORM pour suivre la progression des apprenants dans votre plateforme de formation. Selon les éditeurs, l’export SCORM est disponible sur la formule Business chez HeyGen et sur la formule Enterprise chez Synthesia.
Mesurer. Suivez quatre indicateurs : taux de visionnage complet, résultats aux questions, questions posées au formateur ou au support après la vidéo, et application sur le terrain (observation ou retour du manager).
Mettre à jour. C’est le grand avantage de l’avatar : quand une procédure change, vous corrigez le script et régénérez la séquence. Tenez un registre des versions (date, modification, validation) pour savoir quelle version chaque apprenant a suivie.
Contexte. Une entreprise industrielle de 300 salariés, trois sites dont un à l’étranger, veut former tous les nouveaux arrivants à la déclaration d’incidents.
Objectif. À la fin du module, le nouvel arrivant saura déclarer un incident de sécurité dans l’outil interne, en moins de cinq minutes, sans aide.
Découpage. Trois séquences de quatre minutes :
Avatar. Le double numérique du responsable sécurité, avec son accord écrit (usages, durée de deux ans, langues française et portugaise, retrait possible).
Extrait du script, séquence 1 :
Scène 1 : Bonjour, je suis Marc, responsable sécurité. Une chute évitée de justesse, un outil mal rangé : ces situations comptent.
Scène 2 : Chaque déclaration nous aide à éviter un accident. Même un incident sans blessure mérite d'être signalé.
Scène 3 (question) : Un collègue glisse sur une flaque mais ne se blesse pas. Faut-il déclarer ? [Oui / Non]
Scène 4 : Oui. C'est justement ce type d'incident qui permet d'agir avant qu'un accident se produise.
Scène 5 : Dans la prochaine vidéo, je vous montre comment déclarer en quelques clics.Production. Douze minutes de vidéo au total, en français puis traduites en portugais avec synchronisation labiale, sous-titres dans les deux langues, export SCORM dans la plateforme de formation.
Relecture. Validation par le responsable sécurité, test auprès de trois nouveaux arrivants, correction de deux termes mal prononcés.
Mesure. Taux de déclarations complètes sans aide suivi pendant trois mois.
Les coûts dépendent de la plateforme, du modèle d’avatar et du volume. Quelques repères à partir des grilles officielles consultées en septembre 2026 :
Pour l’exemple ci-dessus (12 minutes, deux langues, export SCORM), une formule d’équipe est nécessaire chez l’un comme chez l’autre.
Délais indicatifs pour un module de trois séquences, avec une équipe formée : une à deux journées de conception et d’écriture, une demi-journée de production, une journée de relecture et de tests. La première réalisation prend souvent deux fois plus de temps : c’est l’apprentissage du workflow.
Le consentement des personnes représentées. Les plateformes exigent le consentement de la personne dont le visage ou la voix sert à créer un avatar (Synthesia, HeyGen). En entreprise, le droit à l’image s’applique aussi : le consentement d’un salarié doit rester réellement libre. Rédigez un accord écrit qui précise les usages, les supports, les langues, la durée, la possibilité de retrait et ce qui se passe en cas de départ. Faites-le valider par votre service juridique.
Les données biométriques. La création d’un double numérique implique des données du visage et de la voix. Associez votre DPO, vérifiez l’accord de traitement des données de la plateforme et ses engagements sur l’entraînement des modèles.
La transparence. Depuis le 2 août 2026, l’article 50 de l’AI Act oblige ceux qui diffusent un hypertrucage (une image, un son ou une vidéo générés ou manipulés par IA, qui ressemblent à des personnes, objets, lieux, entités ou événements existants et pourraient être perçus à tort comme authentiques) à indiquer que le contenu a été généré ou manipulé par une IA (Commission européenne, AI Act). Un module présenté par le double numérique d’un collaborateur réel entre dans ce champ : annoncez-le clairement.
La maîtrise de l’IA par les équipes. L’article 4 de l’AI Act, réécrit par le règlement « Digital Omnibus » (UE) 2026/1744 en vigueur depuis le 27 juillet 2026, demande aux organisations qui utilisent l’IA de prendre des mesures pour soutenir le développement de la maîtrise de l’IA de leur personnel (lawandtechnology.eu). Former les équipes qui produisent ces vidéos en fait partie.
Les droits sur les contenus. Vérifiez vos droits sur les images, musiques, logos et documents intégrés, et relisez les conditions de la plateforme sur la propriété des vidéos générées.
Pour un organisme de formation certifié, une vidéo avec avatar est une ressource pédagogique comme une autre. Le référentiel national qualité demande au prestataire de mettre des ressources pédagogiques à disposition des bénéficiaires et de leur permettre de se les approprier (indicateur 19), et de mobiliser les expertises, outils et réseaux nécessaires pour accueillir et former les publics en situation de handicap (indicateur 26) (Centre Inffo). Concrètement :
Pour structurer ces pratiques, notre accompagnement des organismes de formation à la production de ressources vidéo par IA intègre les exigences du référentiel.
Commencer par l’outil. On choisit l’avatar avant d’avoir défini l’objectif ; le résultat est une vidéo élégante qui n’apprend rien.
Coller un support écrit tel quel. Le texte est trop dense pour l’oral ; l’apprenant décroche.
Produire des vidéos trop longues. Au-delà de six minutes, l’attention chute ; découpez.
Oublier l’interaction. Sans question ni choix, la vidéo reste passive.
Négliger la relecture. Un terme métier mal prononcé ou une information fausse décrédibilise tout le module.
Oublier le consentement ou la mention IA. C’est un risque juridique et un risque de confiance.
Ne pas prévoir la mise à jour. Sans registre des versions, on ne sait plus quelle version est en ligne.
La génération elle-même prend quelques minutes. Le vrai temps se trouve ailleurs : pour un module de trois séquences, comptez une à deux journées de conception et d’écriture, une demi-journée de production et une journée de relecture et de tests, avec une équipe déjà formée. La première réalisation prend souvent deux fois plus de temps. Les mises à jour, elles, se font en quelques heures.
Trois à six minutes par séquence. La plus grande étude publiée sur le sujet, menée sur 6,9 millions de sessions de visionnage sur edX, montre que les vidéos courtes sont nettement plus engageantes et que l’attention chute au-delà de six minutes. Pour un contenu plus long, découpez-le en plusieurs séquences reliées dans un parcours, avec des questions entre chaque vidéo.
Les deux plateformes les plus utilisées sont HeyGen et Synthesia. HeyGen se distingue par son double numérique réaliste, sa traduction avec synchronisation labiale et un export SCORM dès la formule Business. Synthesia est pensé pour la formation d’entreprise, avec des vidéos interactives dès la formule Creator et l’export SCORM sur Enterprise. Nos guides HeyGen et Synthesia détaillent les deux.
Oui, avec son consentement explicite, que les plateformes exigent et vérifient. En entreprise, rédigez un accord écrit qui précise les usages, les langues, la durée, la possibilité de retrait et le devenir de l’avatar en cas de départ, et faites-le valider par votre service juridique et votre DPO. Le consentement d’un salarié doit rester libre : ne rendez pas la participation obligatoire.
Oui dans la plupart des cas. Depuis le 2 août 2026, l’article 50 de l’AI Act oblige celui qui diffuse un contenu généré par IA qui ressemble à une personne réelle, et qui pourrait paraître authentique, à indiquer son origine artificielle. Pour un module de formation, une mention au début de la vidéo ou dans le descriptif du parcours suffit. C’est aussi une question de confiance avec les apprenants.
Oui, comme toute ressource pédagogique, à condition de l’inscrire dans un parcours documenté. Le référentiel demande de mettre des ressources à disposition des bénéficiaires et de leur permettre de se les approprier, et de prendre en compte les situations de handicap. Prévoyez des sous-titres et une transcription, gardez une trace des versions et des validations, et maintenez un accompagnement humain autour des vidéos.
Trois options : télécharger la vidéo en MP4 et la déposer dans la plateforme, l’intégrer par un lien qui se met à jour automatiquement, ou l’exporter au format SCORM pour suivre la progression et les résultats des apprenants. L’export SCORM dépend de la formule : Business chez HeyGen, Enterprise chez Synthesia. Vérifiez aussi que votre plateforme accepte le format et la version SCORM proposés.
Au final, une vidéo de formation avec avatar IA n’est efficace que si elle suit un vrai workflow pédagogique : objectif, découpage, script oral, avatar choisi et autorisé, production variée, interaction, relecture, diffusion et mise à jour. Bien menée, elle permet de produire et d’actualiser des modules multilingues en une fraction du temps d’un tournage. Mal menée, elle ajoute une vidéo de plus que personne ne regarde. Pour installer ce workflow dans votre équipe formation, du premier module au suivi des versions, notre parcours IA générative pour concevoir des modules vidéo efficaces et conformes, certifié Qualiopi et finançable par votre OPCO, s’appuie sur vos contenus réels.

23 septembre 2026
Intelligence Artificielle – IA


23 septembre 2026
Intelligence Artificielle – IA


23 septembre 2026
Intelligence Artificielle – IA

Laisser un commentaire