Gemini Omni Flash 1.1 : guide complet, prompts et nouveautés

Gemini Omni Flash 1.1 : guide complet, prompts et nouveautés

Le guide complet de Gemini Omni Flash 1.1 : les cinq tâches, la formule de prompt, les balises de référence et d’image, les retouches écrites, les extensions à 40 s et la direction du son, exemples à l’appui.

Fonctionnalités et capacités de Gemini Omni Flash 1.1

Le modèle vidéo multimodal de Google DeepMind, mis à jour en août 2026. Il produit des plans de 3 à 10 secondes avec audio natif, puis continue de travailler dessus : une relance retouche la même prise, et les extensions la portent à 40 secondes.

FonctionnalitéCe qu’elle faitIdéal pour
Retouche par le dialogueUne relance modifie la prise ; ce qui n’est pas nommé reste en placeCorriger un plan sans le relancer
Extension vidéoPoursuit un plan par tranches de 10 s, jusqu’à 40 s au totalLes scènes plus longues qu’une génération
Entrées de référence10 images et 3 extraits orientent une génération, chacun avec son rôlePersonnages récurrents, produits, styles
Première et dernière imageInterpole entre deux photos ; la même photo deux fois donne une boucleTransitions, boucles, paires de storyboard
Audio natifParole synchronisée, bruitages, ambiance et musique avec l’imageScènes dialoguées, plans portés par le son
Échelle de résolutionDe 360p à 4K ; le 1080p et la 4K sont des upscalesÉbauches économiques, livraison pleine taille
Texte à l’écranRestitue le texte anglais que vous précisez, jusqu’aux panneaux du fondTitres, synthés, sous-titres

Cas d’usage de Gemini Omni Flash 1.1

Des chaînes de retouches sur une seule prise

Refaites la lumière de la pièce, changez la veste, réécrivez l’enseigne. Chaque consigne s’applique au même plan, et le reste du cadre tient.

Le même salon coupé en deux, lumière plate de midi à gauche et crépuscule doré à droite

Des scènes construites par extension

Ouvrez sur un temps de dix secondes, puis faites-le grandir. Le modèle relit vos dernières secondes et poursuit le mouvement, les personnages et la musique jusqu’à 40 secondes.

Quatre vignettes d’une montgolfière rayée dérivant au-dessus d’une vallée alpine à l’aube

Du croquis à l’image filmée

Précisez que le dessin sert de guide, rien de plus. Le modèle en reprend la silhouette et la trajectoire, puis reconstruit la matière, la lumière et la profondeur.

Un croquis au crayon d’un renard bondissant, à côté de la même pose rendue en renard photoréaliste dans une forêt

Des porte-parole à l’écran

Écrivez la réplique et le personnage la livre, lèvres synchronisées, avec une voix qui reste la sienne à chaque retouche ultérieure.

Un marchand parle chaleureusement au-dessus de cageots d’oranges dans la lumière de fin d’après-midi

Des séquences minutées

Un bloc de timecodes transforme un seul prompt en séquence découpée : des plans produit qui s’enchaînent, ou un temps toutes les deux secondes.

Trois vignettes de la même femme à l’écharpe rouge qui marche, se retourne, puis court

Des boucles parfaites

Passez la même image en première et en dernière image : le plan revient à son point de départ, prêt à tourner sur une fiche produit.

Un avion en papier décrivant une boucle tracée par une traînée de lumière fermée dans un atelier sombre

Étape 1 : choisir la tâche

Tout ce que fait le modèle se ramène à l’une de cinq tâches. Nommez-la quand l’intention peut être mal lue ; sinon, elle se déduit de votre prompt et de vos fichiers. Le tableau se lit comme une aide à la décision : la colonne de droite dit quand chaque tâche s’impose.

TâcheCe qu’elle faitÀ choisir quand
Text to videoGénère un plan à partir d’un brief écritVous partez de rien
Image to videoAnime une photo, ou interpole entre deux imagesVous avez le cadre, il vous manque le mouvement
Reference to videoConstruit un plan à partir d’images et d’extraits balisésUn personnage ou un style doit être repris
EditModifie une vidéo existanteLa prise est bonne, un élément ne l’est pas
ExtendAjoute une suiteLa prise est bonne mais trop courte

Étape 2 : écrire le prompt

Un prompt est un brief de plan court, dans cet ordre. Le format, la résolution et la durée sont des réglages, pas du texte de prompt.

ÉlémentCe qu’il couvreObligatoire
Sujet et actionQui est dans le cadre, et ce qu’il faitOui
DécorLieu, moment de la journée, météo, arrière-planFacultatif
Caméra et lumièreTaille de plan, mouvement, objectif, source de lumièreFacultatif
SonDialogue, ambiance, bruitages, musique ou silenceVivement conseillé
Structure du planPrise unique, ou coupes et leur minutageFacultatif

Voici ce même brief tel qu’il part au modèle. Les exemples de cette page restent en anglais, la langue sur laquelle Google a évalué Omni Flash.

Continuous, unbroken handheld shot of a fluffy tabby cat on a sunny windowsill,
looking out into a leafy garden. Its tail twitches slowly; its ears rotate toward
ambient noises. Sound design: gentle breeze, distant bird chirps. No dialogue.

Les cinq leviers du prompt

LevierÀ écrirePourquoi ça compte
Structure du planSingle continuous shot, no scene cuts. Or: every 2s cut to a new locationSans consigne, le modèle raconte une histoire sur plusieurs plans
SonNo music, just room tone. Or a spoken line: she says, third one todayLe silence se demande, faute de quoi une musique s’invente
MinutageAfter 3 seconds, a woman enters. Or a timecode blockLes intervalles sont des budgets, pas des points de montage à l’image près
Texte à l’écranA street sign that says MARKET LANEUn texte non défini est inventé. L’anglais se rend bien, les autres écritures non
DéclencheursWhen the person touches the mirror, it ripples like liquidUne consigne liée à un événement tombe plus juste qu’un minutage abstrait

Pour un découpage à la seconde, un bloc de timecodes remplace les phrases.

[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running

Les négations se placent dans le prompt lui-même, du type no dialogue ou do not add captions. Il n’existe pas de champ de prompt négatif.

Étape 3 : ajouter les références et les images

Dix images de référence et trois vidéos de référence par génération. Les balises attribuent à chaque fichier son rôle, numérotées à partir de zéro dans l’ordre d’import.

BaliseRôleExemple
FIRST_FRAMEImage de départ<FIRST_FRAME> a woman is walking
LAST_FRAMEImage de fin, associée à une image de départ<FIRST_FRAME> <LAST_FRAME> a woman is walking
IMAGE_REF_0Référence : sujet, produit ou stylein the style of <IMAGE_REF_0>, a woman is walking
VIDEO_REF_0Référence de personnage ou d’objetthe person in <VIDEO_REF_0> is playing the violin
  • Joignez tout dès le départ. Une référence ajoutée en cours de conversation déstabilise une scène qui tenait.
  • Un seul rôle par référence. Le style sur la première image, le sujet sur la deuxième : mieux vaut cela que de laisser deviner.
  • Des vidéos de référence courtes. Trois secondes chacune, les ressemblances marchent le mieux, leur audio est ignoré.
  • La même image en première et en dernière image renvoie une boucle sans raccord.

Étape 4 : retoucher et prolonger le résultat

Une prise générée reste vivante dans la conversation, et des rushes importés de 10 secondes ou moins peuvent la rejoindre. Tout ce que vous décrivez peut être régénéré : ne décrivez donc que le changement.

À éviterÉcrivez plutôt
In the video of the man on the sofa, add a small black cat that runs in from the right, jumps onto his lap, and he strokes its headAdd a cat that jumps onto his lap, he begins to pet it. Keep everything else the same.
Make the whole scene feel more dramatic and cinematic with moodier colors and stronger shadowsChange the lighting to be more dramatic. Keep everything else the same.
RègleDétail
Un changement par tourLes consignes composées cassent la constance environ deux fois plus souvent
Quatre retouches par chaîneAu-delà, la dérive s’installe. Réancrez avec : keep all character details exactly as they are, only change X
L’extension ajoute à la fin10 s à la fois, jusqu’à 40 s au total. Elle ne sait ni précéder l’existant ni étirer le milieu
Le compteur repart à zéroDans une extension, after 2s désigne deux secondes après le début du nouveau segment
Les références peuvent suivreUn nouveau personnage entre dans la scène prolongée depuis une image que vous joignez

Une consigne d’extension ressemble à ceci.

Extend this video. The scene continues: she sets the cup down, and the camera
pulls back through the window into the rain. The music fades to street noise.

Limites de Gemini Omni Flash 1.1

Quatre limites à connaître avant de vous engager sur une production. Le tableau se lit comme une aide à la décision : ce qui coince, ce que cela donne à l’écran, et le contournement.

LimiteCe qui se passeComment faire
Écritures non latinesLes glyphes japonais et chinois sortent en inventions convaincantesGardez le texte à l’écran en anglais, ou vérifiez chaque image
Scènes chargéesÀ partir de quatre sujets suivis, ils fusionnent ou dériventTenez-vous-en à trois
Pas de retouche de voixAucun import de référence audio, aucune reprise de la voixDirigez la voix par le texte ; la constance fait le reste
Limites de la politique d’usageMarques réelles et personnes reconnaissables sont bloquées, selon la régionGardez les éléments de marque génériques

Tarifs simples

Commencez gratuitement dès aujourd'hui, avec la possibilité de mettre à niveau ou d'annuler à tout moment.

Basic

$9/ mois
facturé comme $0 par an

1100 mensuel crédits

1 utilisateur uniquement

Tous les modèles

Workflows

Standard

$24/ mois
facturé comme $0 par an

3625 mensuel crédits

1 utilisateur uniquement

Tous les modèles

Workflows

Pro

$45/ mois
facturé comme $0 par an

6350 partagé mensuel crédits

1 utilisateur

+ jusqu'à 4 plus à un coût supplémentaire

Tous les modèles

Workflows

Pro Max

$170/ mois
facturé comme $0 par an

24650 partagé mensuel crédits

1 utilisateur

+ jusqu'à 9 plus à un coût supplémentaire

Tous les modèles

Workflows

Enterprise

Pour des limites plus élevées

Personnalisé

conditions de tarification et de facturation

Crédits à haut volume
Limites de sièges personnalisées
Tous les modèles
Workflows
Pricing Gradient

Free

Pour expérimenter

$0

gratuit pour toujours

Jusqu'à 20 crédits
1 utilisateur uniquement
Modèles limités
Workflows

Questions fréquentes

Comment écrire un bon prompt Gemini Omni Flash 1.1 ?
Rédigez un brief de plan court : sujet et action, décor, caméra, lumière, et le son voulu, en phrases simples. Par défaut, Omni Flash construit un mini-récit en plusieurs plans ; ajoutez « single continuous shot, no scene cuts » quand vous voulez une prise unique. Décrivez toujours le son, car un prompt qui n’en dit rien repart avec une bande-son inventée par le modèle.
Comment fonctionnent les prompts de retouche dans Gemini Omni Flash 1.1 ?
Courts et ciblés : « make the phone invisible, keep everything else the same ». Un prompt de retouche trop descriptif provoque des changements non voulus, puisque tout ce que vous décrivez peut être régénéré. Nommez le seul changement, ajoutez « keep everything else the same », et tenez-vous à un changement par tour plutôt que d’en empiler trois dans une phrase.
Comment prolonger une vidéo avec Gemini Omni Flash 1.1 ?
Demandez la suite : « extend this video » fonctionne, et « the scene continues: the camera pans across the mountains » donne une direction. Chaque extension ajoute jusqu’à dix secondes, pour un total de 40, en s’appuyant sur les dix dernières secondes comme contexte et en fondant les images de fin pour que la jonction passe pour une seule prise. L’extension ne s’ajoute qu’à la fin : elle ne sait ni précéder l’existant ni étirer le milieu.
Que signifient les balises d’un prompt Gemini Omni Flash 1.1 ?
Les balises attribuent un rôle à chaque fichier importé. FIRST_FRAME et LAST_FRAME, entre chevrons, fixent l’image de départ et l’image de fin ; IMAGE_REF_0 et VIDEO_REF_0 désignent les références, numérotées à partir de zéro dans l’ordre d’import. Passer la même image en première et en dernière image donne un plan qui boucle. Sans balises, le modèle déduit le rôle de chaque fichier à partir du prompt : cela tient pour les cas simples et devient ambigu au-delà de deux ou trois entrées.
Dans quelle langue faut-il écrire un prompt Gemini Omni Flash 1.1 ?
En anglais. C’est la langue sur laquelle Google a évalué le modèle, et c’est pour cela que tous les exemples de cette page restent en anglais : un prompt traduit serait un conseil moins performant. Le texte destiné à apparaître à l’écran suit la même règle, l’anglais étant là où le rendu est le plus sûr. Écrivez donc le brief en anglais, gardez le français pour vos notes de production, et relisez chaque image dès qu’un panneau ou un synthé porte des accents.
Comment diriger le son et les dialogues dans Gemini Omni Flash 1.1 ?
Décrivez la bande-son dans le même prompt que l’image : « no music, just room tone », « a high energy techno beat », ou la réplique écrite telle que le personnage doit la dire. Le dialogue revient synchronisé sur les lèvres, avec une voix qui persiste à travers les retouches et les extensions. Le silence aussi se demande : sans précision, le modèle renvoie en général une musique d’ambiance générique.
Gemini Omni Flash 1.1 sait-il afficher du texte dans la vidéo ?
Oui, et c’est l’un de ses points forts en anglais : panneaux, synthés et animations lettre par lettre reviennent lisibles quand vous écrivez exactement ce que porte chaque surface. Définissez même le texte d’arrière-plan, sinon le modèle en invente un. Les écritures non latines sont le point faible : vérifiez chaque image si vous avez besoin de japonais ou de chinois.
Comment garder des personnages constants au fil des retouches dans Gemini Omni Flash 1.1 ?
Un seul changement par tour, et laissez faire la mémoire de scène du modèle : visages, costumes et voix persistent d’une relance à l’autre. Sur les chaînes longues, réancrez avec « keep all character details and motion exactly as they are, only change the lighting » avant le changement voulu. Une chaîne d’environ quatre retouches reste stable ; au-delà, prévoyez une nouvelle génération avec vos références rattachées.