Écrire un prompt vidéo efficace

Mis à jour le

Les quatre ingrédients d'un prompt vidéo

Un prompt vidéo efficace n'est pas une description littéraire : c'est une instruction visuelle. Le modèle a besoin de savoir se passe la scène, qui ou quoi occupe le cadre, ce qui bouge et dans quelle atmosphère. Ces quatre axes forment la base de tout bon prompt.

Ingrédient Ce qu'il couvre Exemples concrets
Scène Décor et sujet principal « forêt de pins au crépuscule », « cuisine moderne, femme debout au plan de travail »
Action Ce qui se passe : une seule action claire « verse du café dans une tasse », « pédale sur un vélo de route »
Mouvement Déplacement du sujet et de la caméra « plan fixe », « travelling avant lent », « sujet avance vers la caméra »
Ambiance Lumière, ton, palette « lumière dorée de fin d'après-midi », « tons froids, atmosphère brumeuse »

Pour les mouvements de caméra en particulier, Modik propose un guide détaillé : consultez la page Mouvement de caméra pour découvrir les termes reconnus par les modèles.

Pourquoi se concentrer sur une seule action

Les clips générés par l'IA durent quelques secondes. Dans ce laps de temps, le modèle ne peut pas enchaîner plusieurs événements complexes sans perdre en cohérence. Une action par clip est donc la règle de base : non pas une contrainte, mais la condition pour obtenir un résultat propre.

Pour raconter une séquence plus longue, la bonne approche consiste à découper en plusieurs clips courts, chacun centré sur un moment distinct. Vous gardez ainsi le contrôle sur chaque étape.

Exemples avant / après

Voici comment un prompt flou peut être transformé en instruction exploitable.

Version floue Version améliorée
« Une femme dans une cuisine » « Femme vêtue d'un tablier blanc verse du café dans une tasse, cuisine lumineuse aux tons clairs, plan fixe en légère contre-plongée, lumière naturelle du matin »
« Un homme court vite dans la rue et regarde derrière lui puis tourne au coin » « Homme en veste noire court dans une ruelle pavée, plan en travelling latéral, lumière artificielle nocturne, rythme rapide »

Dans le premier exemple, on a ajouté l'action précise, l'ambiance lumineuse et le cadrage. Dans le second, on a supprimé deux des trois actions (regarder derrière, tourner) pour ne garder que la course — la plus visuelle des trois.

Méthode : itérer sur des versions courtes

La génération vidéo comporte une part d'aléatoire : deux lancements du même prompt ne produisent jamais exactement le même clip. C'est pourquoi il est conseillé de tester d'abord avec un prompt minimal, d'observer le résultat, puis d'ajouter ou d'affiner un élément à la fois. Cette méthode permet d'identifier rapidement ce qui fonctionne — ambiance, cadrage, action — avant d'investir des tokens dans une version finale.

Si un résultat vous convient, notez le prompt exact : vous pourrez vous en rapprocher lors d'une prochaine génération. Pensez également à explorer les différents modèles disponibles, car chacun a son propre style de rendu. La page Choisir son modèle vidéo vous aide à comparer leurs points forts.

Pour démarrer concrètement et lancer votre première génération, reportez-vous à Générer une vidéo. Et si vous souhaitez approfondir l'art du prompt en général, la page Écrire un bon prompt couvre les principes qui s'appliquent à tous les modules.

Le module Vidéos est disponible dans toutes les formules, dès M1.

Questions fréquentes

Pourquoi se limiter à une seule action par clip ?

Les clips vidéo génératifs sont courts, typiquement quelques secondes. Un modèle ne peut pas enchaîner plusieurs scènes complexes dans ce laps de temps sans produire des résultats incohérents. En ciblant une seule action, vous donnez au modèle une instruction claire et obtenez un rendu plus propre. Pour raconter une séquence plus longue, créez plusieurs clips distincts.

Faut-il décrire le mouvement de caméra dans le prompt ?

Oui, si vous avez une intention précise. Des indications comme « plan fixe », « travelling avant » ou « panoramique lent » influencent directement le rendu. Si vous n'indiquez rien, le modèle choisit lui-même, ce qui peut ne pas correspondre à votre attente. Modik propose une page dédiée aux mouvements de caméra pour vous aider à formuler cette partie du prompt.

Pourquoi le résultat varie-t-il d'une génération à l'autre avec le même prompt ?

La génération vidéo comporte une part d'aléatoire (appelée « seed ») : chaque lancement explore un résultat légèrement différent. C'est à la fois une force (variété) et une contrainte (reproductibilité limitée). Si un résultat vous convient, notez le prompt exact pour pouvoir vous en approcher à nouveau.

Comment éviter une scène incohérente ou des artefacts visuels ?

Réduisez la complexité : un sujet, un décor, une action. Évitez les foules, les textes affichés à l'écran, les mains en gros plan et les visages expressifs, qui restent des points faibles des modèles actuels. Préférez des plans larges ou des descriptions d'ambiance plutôt que des détails anatomiques fins.

Le module Vidéos est-il disponible sur toutes les formules ?

Oui. La génération vidéo est incluse dans toutes les formules, dès la formule M1. Ce qui distingue les formules, c'est le volume de tokens disponible.

Une question sur Modik ? Le plus simple est encore d'essayer.

Ouvrir Modik