Comment remplacer un personnage vidéo avec MiniMax H3 sans dérive d’identité
Vincent13 min de lecture ·

Pour remplacer un personnage vidéo avec MiniMax H3 sans dérive d’identité, utilisez l’image de référence comme source d’identité et la vidéo source comme source d’interprétation. Une règle simple : image = identité, vidéo = interprétation, prompt = contraintes. Cela aide H3 à préserver le visage et l’apparence du nouveau personnage tout en conservant mouvements, timing, pose et caméra d’origine.
Le principal défi est la dérive d’identité. Un personnage peut sembler correct au début puis revenir vers l’interprète original ; mouvements rapides, occultations, clips longs ou références contradictoires peuvent aggraver les incohérences. Notre test de MiniMax H3 sur des processus documentés inclut une étude de six heures avec plus de 400 générations, ainsi que des essais à plusieurs personnages, à mouvements intenses, de cadrage et sous ComfyUI local. Dans ces cas, des rôles de référence clairs, des clips de test courts, des ancrages d’identité solides et des règles explicites de préservation ressortent constamment comme les principes les plus utiles.
Pour les équipes créatives gérant des processus IA riches en références comme celui-ci, Virse propose une manière plus structurée d’organiser le travail. Au lieu d’enfermer chaque décision dans une conversation, Virse utilise un canevas infini où références, résultats et relations créatives restent visibles, tandis que plusieurs Agents travaillent sur le même projet et partagent son contexte. Grâce à une mémoire à long terme des préférences d’équipe, des normes de marque et des connaissances du projet, Virse aide les designers professionnels à itérer et à développer la production assistée par IA sans abandonner le contrôle créatif. MiniMax H3, Seedance 2.5 et Seedance 2.0 sont désormais disponibles sur Virse, permettant d’explorer et de comparer plusieurs grands modèles vidéo dans un même processus créatif.

Comment fonctionne le remplacement de personnages avec MiniMax H3 ?
Le remplacement de personnages H3 va au-delà du changement de visage
Un échange de visage traditionnel modifie surtout l’apparence faciale. MiniMax H3 permet une génération et retouche d’images plus large, où visage, coiffure, vêtements, couleurs, silhouette et identité corporelle changent tout en conservant les mouvements et la cinématographie d’origine.
Le modèle le plus utile est simple :
Image = identité. Vidéo = interprétation. Prompt = répartition et contraintes.
L’image indique à quoi doit ressembler le nouveau personnage. La vidéo indique comment il doit bouger, jouer et interagir avec la scène.
Cette distinction explique plusieurs échecs fréquents. Dans des processus documentés, certains résultats changeaient cheveux ou vêtements tout en conservant trop du visage original. D’autres préservaient si fortement la vidéo source que le remplacement demandé avait à peine lieu.
Les références image, vidéo et audio ont besoin de rôles clairs
La qualité des références compte plus que leur nombre.
Entrée | Rôle idéal |
Image du personnage | Visage, cheveux, tenue, proportions, identité |
Vidéo source | Mouvement, pose, expression, position, timing |
Vidéo source | Caméra, cadrage, éclairage, scène, occultation |
Référence audio | Voix, ton ou contexte audio si nécessaire |
Prompt | Définit remplacement, héritage et préservation |
Le but n’est pas de remplir tous les emplacements disponibles, mais de rendre chaque référence responsable d’un type d’information clair.
Comment préparer la meilleure référence de personnage pour MiniMax H3
Commencer par un portrait solide avant d’ajouter des images
Pour les gros plans et plans moyens, un portrait clair est souvent le meilleur point de départ.
Notre examen a trouvé des processus où réduire le nombre d’images de référence améliorait la précision d’identité. Les images supplémentaires peuvent introduire de légères contradictions de coiffure, structure du visage, costume, éclairage ou proportions.
Une bonne première référence doit offrir :
- un visage bien visible
- une coiffure reconnaissable
- des vêtements cohérents
- peu d’obstructions
- assez de détails du visage pour ancrer l’identité
N’ajoutez une autre vue que si elle résout un manque d’information précis.
Utiliser une planche de personnage pour les mouvements du corps et les rotations
Un seul portrait devient moins utile lorsque l’interprète tourne, apparaît de profil ou se détourne de la caméra.
Pour ces clips, une planche réunissant vue de face, vue de dos et gros plan du visage peut mieux couvrir les besoins. C’est particulièrement utile pour les coiffures, vestes, chaussures ou costumes distinctifs qui doivent rester cohérents pendant le transfert de mouvement et les rotations.
Du point de vue du design, cela fonctionne comme une planche traditionnelle de vues de personnage : le modèle reçoit l’information visuelle avant que cette vue n’apparaisse en mouvement.
Adapter le cadrage de la référence au plan cible
Le cadrage est une variable souvent négligée.
Un processus documenté a amélioré la cohérence après adaptation de la référence à environ 864 × 480, plus proche de la composition cible. Dans un autre cas, un PNG plein pied de 848 × 1264 a été utilisé avec un clip source de 1280 × 720, 30 ips et 14,4 secondes, mais une dérive d’identité notable persistait.
Ce ne sont pas des benchmarks contrôlés, mais ils appuient une règle pratique : rendez les traits définissant l’identité assez grands et nets pour l’échelle du personnage dans le plan final.

Comment remplacer un personnage vidéo avec MiniMax H3 étape par étape
Étape 1 : faire de la vidéo source la référence d’interprétation
Laissez la vidéo source contrôler mouvement, pose, position, rotation du corps, jeu du visage, vitesse, timing et chorégraphie.
Ne réécrivez pas chaque mouvement si la vidéo source contient déjà l’interprétation voulue. Redécrire l’action peut ajouter une couche d’interprétation plutôt qu’améliorer la fidélité.
Étape 2 : attribuer l’identité à l’image de référence
Indiquez clairement que l’interprète original doit être remplacé par le personnage de la référence.
Définissez les attributs visuels à stabiliser : visage, coiffure, tenue, couleurs, proportions et détails distinctifs.
Dans une étude documentée de plus de 400 générations en environ six heures, des définitions faibles du sujet étaient associées à une perte d’identité dans environ la moitié de certaines séries d’essais. Cela ne signifie pas que tous les processus réagiront ainsi, mais que les désignations d’identité vagues sont risquées lorsque la cohérence compte.
Étape 3 : transférer l’interprétation originale
Le personnage de remplacement doit hériter des mouvements, pose, position, expression, rotation, vitesse et timing de l’interprète original.
Cette consigne est essentielle car elle dit à H3 que l’interprète source fournit l’interprétation, pas l’identité
Étape 4 : préserver caméra, éclairage et structure de scène
Protégez tout ce qui est extérieur à la modification prévue du personnage.
Préservez arrière-plan, accessoires, trajectoire de caméra, cadrage, mise au point, flou de mouvement, éclairage, ombres, composition et timing du montage.
Moins H3 doit redessiner d’éléments sans rapport, plus il est facile de concentrer sa capacité sur le remplacement lui-même.
Étape 5 : préserver les occultations
Les occultations comptent lorsque mains, cheveux, accessoires, armes, vêtements ou autres personnages passent devant le sujet.
Si une main passe devant le visage dans la source, elle doit passer devant le visage remplacé au même instant. Il en va de même pour les arcs, équipements, objets au premier plan et chevauchements de personnages.
C’est particulièrement important pour la danse, la course, la boxe, le tir à l’arc, les rotations rapides et les scènes d’action.
Quel est le meilleur prompt de remplacement de personnage pour MiniMax H3 ?
Utiliser Remplacer, Correspondre, Hériter, Préserver et Empêcher
Le meilleur cadre général de prompt est le suivant :
Remplacer : remplacez l’interprète original par le personnage de référence.
Correspondre : faites correspondre visage, cheveux, tenue, couleurs, proportions et détails d’identité reconnaissables du personnage.
Hériter : préservez mouvement, pose, expression, position, vitesse, rotation et timing de l’interprète original.
Préserver : gardez caméra, arrière-plan, éclairage, ombres, accessoires, cadrage, mise au point et montage d’origine.
Empêcher : n’introduisez pas de nouvelles actions, objets, coupes, mouvements de caméra, texte ou accessoires.
Un prompt de production concis peut donc être :
Dans la Vidéo 1, remplacez l’interprète original par le personnage de l’Image 1. Faites correspondre son visage, sa coiffure, sa tenue, ses couleurs, ses proportions corporelles et ses détails d’identité visibles pendant tout le clip. Préservez mouvement, pose, position, rotation, expression, vitesse et timing de l’interprète original. Gardez inchangés arrière-plan, accessoires, trajectoire de caméra, cadrage, mise au point, flou de mouvement, éclairage, ombres, composition et montage. Maintenez les relations d’occultation originales lorsque mains, cheveux, vêtements ou objets passent devant le personnage. N’ajoutez pas de nouvelles actions, objets, mouvements de caméra, coupes, texte ou accessoires.
Les prompts simples peuvent surpasser les prompts trop structurés
Des prompts plus longs ne sont pas automatiquement plus contrôlables.
Dans un processus documenté de remplacement de tête, une consigne simplifiée donnait de bons résultats dans environ 70 % des tentatives, alors qu’une version plus élaborée préservait parfois tellement la source que le remplacement était minime.
La structuration du prompt devient plus utile lorsqu’elle résout un problème précis, comme la correspondance de plusieurs personnages, une dérive d’identité persistante ou des références contradictoires.
Comment corriger la dérive d’identité dans MiniMax H3
Commencer par des clips courts avant d’allonger la durée
La dérive d’identité apparaît souvent progressivement. Le personnage peut commencer correctement, se rapprocher de l’interprète source, puis se rétablir partiellement.
Un test de 14,4 secondes, 1280 × 720 et 30 ips utilisant une référence plein pied de 848 × 1264 montrait encore une forte dérive dans un processus sur RTX 5070 Ti 16GB.
Un ordre de diagnostic plus efficace :
- Testez environ cinq secondes.
- Renforcez la référence du visage.
- Rapprochez davantage les cadrages.
- Retirez les références inutiles.
- Clarifiez les rôles d’identité et d’interprétation.
- Ajoutez une vue de dos pour les rotations.
- Testez une autre graine.
- Augmentez la qualité pour les mouvements difficiles.
Les mouvements intenses peuvent exiger des réglages plus prudents
Dans le processus de plus de 400 générations, des clips de cinq secondes étaient couramment utilisés pour tester, avec aussi des expériences de 15 secondes.
Turbo en quatre étapes était utile pour itérer, mais les mouvements difficiles perdaient parfois leur cohérence d’identité. Pour les séquences plus complexes, ce processus revenait à environ 20 étapes.

Ce n’est pas un préréglage universel. Cela illustre un compromis plus large : une génération plus rapide peut devenir moins fiable lorsque le modèle doit résoudre simultanément identité, pose, mouvement, occultation et continuité temporelle.

Garder l’identité du personnage H3 cohérente entre coupes et vidéos longues
Les séquences longues et les coupes franches multiplient les occasions de voir réapparaître l’identité source ou les références entrer en concurrence.
En production, validez le remplacement dans des segments courts examinés séparément avant d’allonger la séquence. Gardez la même description d’identité et les mêmes correspondances de références entre clips, et vérifiez la continuité à chaque coupe.
Ne supposez pas qu’un personnage correctement établi au premier plan restera automatiquement dominant ensuite. La cohérence entre clips doit être une tâche de production explicite, pas une décision de prompt prise une seule fois.
Comment remplacer plusieurs personnages avec MiniMax H3
Associer explicitement chaque personnage
Pour remplacer deux personnes, chaque identité nécessite une correspondance stable.
Une structure pratique :
- L’Image 1 définit le Personnage A
- L’Image 2 définit le Personnage B
- La Vidéo 1 fournit les deux interprétations
- Le Personnage A remplace l’interprète de gauche
- Le Personnage B remplace l’interprète de droite
Un processus documenté à deux personnages a atteint environ 90 % de réussite annoncée après amélioration de l’association et de la rétention des sujets, mais les résultats dépendaient encore de la graine.

Éviter le mélange d’identités lors des croisements
Les moments les plus difficiles surviennent lorsque les interprètes se croisent, se superposent ou se masquent.
Des attributions claires Personnage A et Personnage B sont plus sûres que des termes vagues comme première et deuxième personne.
Avec plusieurs personnages, la clarté du rôle des références vaut davantage que leur nombre maximal.
Que montrent les tests de performances de MiniMax H3 sous ComfyUI ?
12GB de VRAM peuvent suffire, avec de forts compromis
Un processus sur RTX 3060 12GB a rapporté environ :
- 5 secondes à environ 2MP
- 8 secondes à environ 1,34MP
- environ 25 minutes pour la génération à 1,34MP
Un autre test de 12GB utilisait neuf références PNG HD à 0,4MP. Une génération image-vers-vidéo classique de 30 secondes prenait environ 14 minutes, tandis que le processus Ref2V multiréférence prenait environ 20 minutes.
Ces résultats sont des exemples de processus, pas des benchmarks universels, mais ils montrent le compromis entre durée, résolution, nombre de références et coût de génération.

Plus de VRAM ne corrige pas automatiquement la dérive d’identité
Un processus de 16GB subissait encore une dérive sur un clip de remplacement plus long.
Un test sur RTX 3090 Ti 24GB avec 56 images à 0,5MP décrivait l’édition vidéo comme environ deux fois plus exigeante qu’une génération plus simple à référence image.
Un processus optimisé haut de gamme sur 5090 a annoncé plus de 10GB de VRAM économisés et environ 14GB de mémoire GPU partagée en moins après passage à des composants plus économes, avec une vitesse de génération à peu près similaire.
L’essentiel est que la capacité GPU influe sur les réglages utilisables, mais qualité des références, durée, complexité du mouvement et structure du prompt déterminent toujours la stabilité d’identité.

Quelles sont les erreurs courantes de remplacement de personnages avec MiniMax H3 ?
Ajouter des références avant de diagnostiquer l’échec
Davantage de références peuvent créer davantage de contradictions.
Commencez par une bonne source d’identité. Ajoutez une vue seulement lorsque le clip cible révèle une information absente de la première image.
Tester trop tôt des vidéos longues
L’échec d’un clip d’action de 15 secondes peut avoir de nombreuses causes.
Un test de cinq secondes aide à isoler les problèmes d’identité, de cadrage, de mouvement, de graine, de résolution ou d’occultation avant de dépenser plus de calcul.
Changer trop d’éléments à la fois
Si la tâche est le remplacement de personnage, évitez de changer simultanément arrière-plan, éclairage, caméra, animation et style de montage.
Les processus professionnels de vidéo IA deviennent plus contrôlables lorsque chaque génération a un périmètre de transformation restreint.
Questions fréquentes
Pourquoi H3 conserve-t-il le visage original ?
Les causes fréquentes sont références d’identité faibles, rôles ambigus, cadrage inadapté, trop de références ou consignes de préservation qui dominent la retouche. Commencez par un portrait clair, attribuez l’identité à l’image et l’interprétation à la vidéo, puis validez sur un clip court avant de complexifier.
H3 peut-il remplacer deux personnages en même temps ?
Oui. Le remplacement multiple peut fonctionner lorsque chaque référence est explicitement associée à un interprète. Le principal défi est le mélange d’identités lorsqu’ils se superposent, se croisent ou se masquent. Des associations A et B stables sont plus fiables que des descriptions de position vagues.
Combien d’images de référence utiliser avec H3 ?
Commencez par une bonne image. Ajoutez une autre vue seulement si la vidéo révèle une information absente de la première, comme la coiffure ou le costume de dos. Dans plusieurs processus documentés, moins de références amélioraient la cohérence car le modèle avait moins de signaux visuels contradictoires à concilier.
De combien de VRAM H3 a-t-il besoin ?
Il n’existe pas d’exigence fixe unique. Des processus locaux documentés fonctionnent sur des GPU de 12GB, 16GB et 24GB, mais résolution, durée, étapes, quantification, configuration du modèle et nombre de références influent sur la mémoire. Sur un matériel limité, réduisez d’abord durée et résolution.
Conclusion
Le meilleur processus de remplacement MiniMax H3 ne repose pas sur un « prompt ultime ». Il vient de la bonne responsabilité attribuée à chaque source : l’image définit l’identité, la vidéo source définit l’interprétation et la cinématographie, et le prompt définit ce qui doit changer, être transféré et rester intact. À travers des centaines de générations documentées, cas à plusieurs personnages, tests de mouvements intenses, expériences de cadrage et processus GPU locaux, le schéma le plus solide reste constant : commencer par un clip court, utiliser le minimum de bonnes références, séparer identité et interprétation, préserver explicitement caméra et occultations, et n’ajouter de complexité que pour répondre à un échec précis.
Plus d’articles du blog Virse
Flux de travail

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
9 octobre 2026 by Yifan Zhao
Flux de travail

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
9 octobre 2026 by Yifan Zhao
Flux de travail

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
9 octobre 2026 by Yifan Zhao