Fonctionnalités et capacités de Gemini Omni Flash 1.1
Le modèle vidéo multimodal de Google DeepMind, mis à jour en août 2026. Il produit des plans de 3 à 10 secondes avec audio natif, puis continue de travailler dessus : une relance retouche la même prise, et les extensions la portent à 40 secondes.
| Fonctionnalité | Ce qu’elle fait | Idéal pour |
|---|---|---|
| Retouche par le dialogue | Une relance modifie la prise ; ce qui n’est pas nommé reste en place | Corriger un plan sans le relancer |
| Extension vidéo | Poursuit un plan par tranches de 10 s, jusqu’à 40 s au total | Les scènes plus longues qu’une génération |
| Entrées de référence | 10 images et 3 extraits orientent une génération, chacun avec son rôle | Personnages récurrents, produits, styles |
| Première et dernière image | Interpole entre deux photos ; la même photo deux fois donne une boucle | Transitions, boucles, paires de storyboard |
| Audio natif | Parole synchronisée, bruitages, ambiance et musique avec l’image | Scènes dialoguées, plans portés par le son |
| Échelle de résolution | De 360p à 4K ; le 1080p et la 4K sont des upscales | Ébauches économiques, livraison pleine taille |
| Texte à l’écran | Restitue le texte anglais que vous précisez, jusqu’aux panneaux du fond | Titres, synthés, sous-titres |
Cas d’usage de Gemini Omni Flash 1.1
Des chaînes de retouches sur une seule prise
Refaites la lumière de la pièce, changez la veste, réécrivez l’enseigne. Chaque consigne s’applique au même plan, et le reste du cadre tient.

Des scènes construites par extension
Ouvrez sur un temps de dix secondes, puis faites-le grandir. Le modèle relit vos dernières secondes et poursuit le mouvement, les personnages et la musique jusqu’à 40 secondes.

Du croquis à l’image filmée
Précisez que le dessin sert de guide, rien de plus. Le modèle en reprend la silhouette et la trajectoire, puis reconstruit la matière, la lumière et la profondeur.

Des porte-parole à l’écran
Écrivez la réplique et le personnage la livre, lèvres synchronisées, avec une voix qui reste la sienne à chaque retouche ultérieure.

Des séquences minutées
Un bloc de timecodes transforme un seul prompt en séquence découpée : des plans produit qui s’enchaînent, ou un temps toutes les deux secondes.

Des boucles parfaites
Passez la même image en première et en dernière image : le plan revient à son point de départ, prêt à tourner sur une fiche produit.

Étape 1 : choisir la tâche
Tout ce que fait le modèle se ramène à l’une de cinq tâches. Nommez-la quand l’intention peut être mal lue ; sinon, elle se déduit de votre prompt et de vos fichiers. Le tableau se lit comme une aide à la décision : la colonne de droite dit quand chaque tâche s’impose.
| Tâche | Ce qu’elle fait | À choisir quand |
|---|---|---|
| Text to video | Génère un plan à partir d’un brief écrit | Vous partez de rien |
| Image to video | Anime une photo, ou interpole entre deux images | Vous avez le cadre, il vous manque le mouvement |
| Reference to video | Construit un plan à partir d’images et d’extraits balisés | Un personnage ou un style doit être repris |
| Edit | Modifie une vidéo existante | La prise est bonne, un élément ne l’est pas |
| Extend | Ajoute une suite | La prise est bonne mais trop courte |
Étape 2 : écrire le prompt
Un prompt est un brief de plan court, dans cet ordre. Le format, la résolution et la durée sont des réglages, pas du texte de prompt.
| Élément | Ce qu’il couvre | Obligatoire |
|---|---|---|
| Sujet et action | Qui est dans le cadre, et ce qu’il fait | Oui |
| Décor | Lieu, moment de la journée, météo, arrière-plan | Facultatif |
| Caméra et lumière | Taille de plan, mouvement, objectif, source de lumière | Facultatif |
| Son | Dialogue, ambiance, bruitages, musique ou silence | Vivement conseillé |
| Structure du plan | Prise unique, ou coupes et leur minutage | Facultatif |
Voici ce même brief tel qu’il part au modèle. Les exemples de cette page restent en anglais, la langue sur laquelle Google a évalué Omni Flash.
Continuous, unbroken handheld shot of a fluffy tabby cat on a sunny windowsill,
looking out into a leafy garden. Its tail twitches slowly; its ears rotate toward
ambient noises. Sound design: gentle breeze, distant bird chirps. No dialogue.
Les cinq leviers du prompt
| Levier | À écrire | Pourquoi ça compte |
|---|---|---|
| Structure du plan | Single continuous shot, no scene cuts. Or: every 2s cut to a new location | Sans consigne, le modèle raconte une histoire sur plusieurs plans |
| Son | No music, just room tone. Or a spoken line: she says, third one today | Le silence se demande, faute de quoi une musique s’invente |
| Minutage | After 3 seconds, a woman enters. Or a timecode block | Les intervalles sont des budgets, pas des points de montage à l’image près |
| Texte à l’écran | A street sign that says MARKET LANE | Un texte non défini est inventé. L’anglais se rend bien, les autres écritures non |
| Déclencheurs | When the person touches the mirror, it ripples like liquid | Une consigne liée à un événement tombe plus juste qu’un minutage abstrait |
Pour un découpage à la seconde, un bloc de timecodes remplace les phrases.
[0-3s] A person is walking
[3-6s] They stop and turn around
[6-10s] They start running
Les négations se placent dans le prompt lui-même, du type no dialogue ou do not add captions. Il n’existe pas de champ de prompt négatif.
Étape 3 : ajouter les références et les images
Dix images de référence et trois vidéos de référence par génération. Les balises attribuent à chaque fichier son rôle, numérotées à partir de zéro dans l’ordre d’import.
| Balise | Rôle | Exemple |
|---|---|---|
| FIRST_FRAME | Image de départ | <FIRST_FRAME> a woman is walking |
| LAST_FRAME | Image de fin, associée à une image de départ | <FIRST_FRAME> <LAST_FRAME> a woman is walking |
| IMAGE_REF_0 | Référence : sujet, produit ou style | in the style of <IMAGE_REF_0>, a woman is walking |
| VIDEO_REF_0 | Référence de personnage ou d’objet | the person in <VIDEO_REF_0> is playing the violin |
- Joignez tout dès le départ. Une référence ajoutée en cours de conversation déstabilise une scène qui tenait.
- Un seul rôle par référence. Le style sur la première image, le sujet sur la deuxième : mieux vaut cela que de laisser deviner.
- Des vidéos de référence courtes. Trois secondes chacune, les ressemblances marchent le mieux, leur audio est ignoré.
- La même image en première et en dernière image renvoie une boucle sans raccord.
Étape 4 : retoucher et prolonger le résultat
Une prise générée reste vivante dans la conversation, et des rushes importés de 10 secondes ou moins peuvent la rejoindre. Tout ce que vous décrivez peut être régénéré : ne décrivez donc que le changement.
| À éviter | Écrivez plutôt |
|---|---|
| In the video of the man on the sofa, add a small black cat that runs in from the right, jumps onto his lap, and he strokes its head | Add a cat that jumps onto his lap, he begins to pet it. Keep everything else the same. |
| Make the whole scene feel more dramatic and cinematic with moodier colors and stronger shadows | Change the lighting to be more dramatic. Keep everything else the same. |
| Règle | Détail |
|---|---|
| Un changement par tour | Les consignes composées cassent la constance environ deux fois plus souvent |
| Quatre retouches par chaîne | Au-delà, la dérive s’installe. Réancrez avec : keep all character details exactly as they are, only change X |
| L’extension ajoute à la fin | 10 s à la fois, jusqu’à 40 s au total. Elle ne sait ni précéder l’existant ni étirer le milieu |
| Le compteur repart à zéro | Dans une extension, after 2s désigne deux secondes après le début du nouveau segment |
| Les références peuvent suivre | Un nouveau personnage entre dans la scène prolongée depuis une image que vous joignez |
Une consigne d’extension ressemble à ceci.
Extend this video. The scene continues: she sets the cup down, and the camera
pulls back through the window into the rain. The music fades to street noise.
Limites de Gemini Omni Flash 1.1
Quatre limites à connaître avant de vous engager sur une production. Le tableau se lit comme une aide à la décision : ce qui coince, ce que cela donne à l’écran, et le contournement.
| Limite | Ce qui se passe | Comment faire |
|---|---|---|
| Écritures non latines | Les glyphes japonais et chinois sortent en inventions convaincantes | Gardez le texte à l’écran en anglais, ou vérifiez chaque image |
| Scènes chargées | À partir de quatre sujets suivis, ils fusionnent ou dérivent | Tenez-vous-en à trois |
| Pas de retouche de voix | Aucun import de référence audio, aucune reprise de la voix | Dirigez la voix par le texte ; la constance fait le reste |
| Limites de la politique d’usage | Marques réelles et personnes reconnaissables sont bloquées, selon la région | Gardez les éléments de marque génériques |

