Multimodal

Gemini Omni Flash 1.1

par Google DeepMind

Le modèle vidéo de Google où la retouche s’écrit.
Désormais en 4K et jusqu’à 40 secondes.

Gemini Omni Flash 1.1

Fonctionnalités clés

Spécifications techniques

Gemini Omni

Deuxième version d’Omni Flash dans la famille Omni de Google

5 tâches

Texte, image, référence, retouche et extension

3 à 10 s

Par génération ; les extensions montent à 40 secondes au total

Jusqu’en 4K

360p et 720p en natif, 1080p et 4K en upscale

10 + 3

Dix images et trois extraits vidéo de 3 s maximum chacun

Natif

Dialogues, bruitages et musique dans la même passe

16:9, 9:16

Paysage et vertical, à toutes les résolutions

SynthID

Marque de provenance invisible sur chaque plan généré

Cas d'utilisation

Le même café de rue en deux moitiés, photoréaliste à gauche et en anime à droite

Les retouches s’écrivent

Donnez un plan, puis le changement : une autre météo, un rendu anime, une enseigne réécrite. Le reste du cadre ne bouge pas.

Une femme s’adresse à la caméra en pleine phrase, dans la lumière douce d’une fenêtre

Personnages qui parlent

Écrivez la réplique : le personnage la dit, lèvres synchronisées, avec une voix qui traverse les coupes et les retouches.

Les références d’un flacon, d’un mannequin et d’un lieu épinglées à côté de l’image finale de la publicité

Spots fidèles aux références

Un packshot, la photo d’un présentateur et trois secondes du mouvement voulu donnent un spot où le produit reste juste.

Quatre vignettes du même cycliste traversant une rue de boulangerie, un port, un phare et une route côtière

Scènes portées à 40 secondes

Générez le premier temps, puis prolongez-le dix secondes à la fois jusqu’à 40, sans changer de personnages ni de musique.

Une sculpture cinétique où des dominos lâchent une bille d’acier sur un rail de bois courbe

Pédagogie, physique juste

Gravité, fluides et collisions suivent les lois du réel, et l’ancrage de Gemini en sciences et en histoire tient le détail.

Un pêcheur en interview devant un port brumeux, avec un synthé titrant THE COAST ROAD

Du texte lisible à l’image

Le texte incrusté revient lisible, du synthé au fronton de boutique, et une retouche suivante peut en changer le libellé.

Exemples de prompts

Marché de nuit

Un marché de nuit sous la pluie, vendeurs qui hèlent, woks qui grésillent

Edit prompt

Temps minutés

Toutes les deux secondes, coupe vers un nouveau toit à l’heure dorée

Edit prompt

Texte à l’image

L’enseigne d’un diner s’allume lettre par lettre : OPEN ALL NIGHT

Edit prompt

Plan-séquence

Un circuit de billes dans un atelier ensoleillé, plan unique sans coupe

Edit prompt

Réplique parlée

Un alpiniste murmure sa phrase au sommet, face au vent

Edit prompt

Gros plan sonore

Gros plan sur un café filtre, chaque goutte et chaque sifflement audibles

Edit prompt

Aperçu

Gemini Omni Flash 1.1 est la deuxième version du modèle vidéo multimodal de Google DeepMind. C’est aussi la première où un plan peut grandir. Une génération dure toujours de 3 à 10 secondes, audio natif compris. Ce que 1.1 ajoute, ce sont les commandes qui manquaient : une échelle de résolution qui va de l’ébauche en 360p à la livraison en 4K, des vidéos de référence qui orientent vraiment le résultat, une image de fin qui transforme deux photos en un mouvement, et une extension qui porte le plan à 40 secondes sans perdre ni les personnages ni la musique.

Les nouveautés de Gemini Omni Flash 1.1

Le premier Omni Flash rendait tous ses plans en 720p et s’arrêtait à dix secondes. La 1.1 garde ce cœur rapide et conversationnel, puis retire les plafonds autour. La résolution se choisit maintenant à chaque génération : 360p pour itérer sans compter, 1080p ou 4K en upscale quand la prise est bonne. Les entrées de référence passent à dix images plus trois courts extraits, chacun affecté à un rôle dans le prompt. Et un plan terminé n’est plus une fin de ligne : l’extension relit les dernières secondes et poursuit la scène, dix secondes à la fois, jusqu’à quatre fois la durée d’origine.

Retoucher la vidéo par le dialogue, sans tout relancer

La plupart des modèles vidéo traitent un prompt comme un tirage de machine à sous. Omni Flash le traite comme la première mesure d’une séance. La scène reste en mémoire d’un tour à l’autre, et l’anglais reste la langue de référence du modèle. « make the jacket red », « now extend the shot as she turns away », « change the sign to say CLOSED » : les trois s’appliquent à la même prise, visages, costumes et voix intacts. Les instructions courtes, à un seul changement, donnent les meilleurs résultats. Et ce que vous ne mentionnez jamais est précisément ce qui ne bouge pas.

Gemini Omni Flash 1.1 sur Morphic

Sur Morphic, Gemini Omni figure dans le sélecteur de modèles vidéo, aux côtés de Veo 3.1, Seedance 2.5, Kling et du reste du catalogue. Rédigez le plan comme un brief, son compris. Joignez des images de référence pour tout ce qui doit rester identique, puis générez. La prise arrive sur le Canvas, où le même brief peut passer par un autre modèle pour une lecture côte à côte. Continuez en relances, un changement précis à la fois : la scène garde son contexte d’un tour au suivant.

Tarifs simples

Commencez gratuitement dès aujourd'hui, avec la possibilité de mettre à niveau ou d'annuler à tout moment.

Basic

$9/ mois
facturé comme $0 par an

1100 mensuel crédits

1 utilisateur uniquement

Tous les modèles

Workflows

Standard

$24/ mois
facturé comme $0 par an

3625 mensuel crédits

1 utilisateur uniquement

Tous les modèles

Workflows

Pro

$45/ mois
facturé comme $0 par an

6350 partagé mensuel crédits

1 utilisateur

+ jusqu'à 4 plus à un coût supplémentaire

Tous les modèles

Workflows

Pro Max

$170/ mois
facturé comme $0 par an

24650 partagé mensuel crédits

1 utilisateur

+ jusqu'à 9 plus à un coût supplémentaire

Tous les modèles

Workflows

Enterprise

Pour des limites plus élevées

Personnalisé

conditions de tarification et de facturation

Crédits à haut volume
Limites de sièges personnalisées
Tous les modèles
Workflows
Pricing Gradient

Free

Pour expérimenter

$0

gratuit pour toujours

Jusqu'à 20 crédits
1 utilisateur uniquement
Modèles limités
Workflows

Questions fréquentes

Qu’est-ce que Gemini Omni Flash 1.1 ?
Gemini Omni Flash 1.1 est la deuxième version du modèle vidéo multimodal de Google, sortie fin août 2026. Il génère de la vidéo avec un audio natif synchronisé à partir de texte, d’images et de vidéos de référence, puis retouche et prolonge les plans sur simple consigne écrite. La version 1.1 ajoute une échelle de résolution qui monte jusqu’en 4K, des vidéos de référence qui orientent enfin le résultat, l’interpolation entre première et dernière image, et des extensions qui portent un plan à 40 secondes.
Qu’apporte Gemini Omni Flash 1.1 par rapport à la première version ?
Quatre choses. La résolution se choisit désormais de 360p à 4K, là où la première version restait figée en 720p. L’extension vidéo est active : elle rallonge un plan par tranches de dix secondes jusqu’à 40, quand l’originale s’arrêtait à une seule génération de dix secondes. Les vidéos de référence orientent vraiment le résultat, jusqu’à trois extraits de trois secondes chacun. Et l’image vers vidéo accepte une image de fin, ce qui permet au modèle d’interpoler entre deux photos que vous fournissez.
Quelle résolution Gemini Omni Flash 1.1 produit-il ?
Quatre options : 360p, 720p, 1080p et 4K, en 16:9 ou en 9:16. Le modèle rend nativement en 360p et en 720p, puis produit le 1080p et la 4K en upscale de cette même génération. En pratique, on ébauche à bas coût en 360p, on fige la prise en 720p, puis on demande la résolution de livraison une fois le plan juste.
Quelle durée peut atteindre une vidéo Gemini Omni Flash 1.1 ?
Une génération dure de 3 à 10 secondes, 8 secondes par défaut. L’extension prend ensuite le relais et rallonge le plan par tranches de dix secondes, jusqu’à 40 secondes au total, en gardant les personnages, le mouvement et le son continus à chaque jonction. Un point à connaître : l’extension ne s’ajoute qu’à la fin du plan. Elle ne sait ni précéder l’existant ni allonger le milieu.
Comment fonctionne l’extension vidéo dans Gemini Omni Flash 1.1 ?
Vous demandez la suite en langage courant : « extend this video » suffit, et « the scene continues: the camera pans across the mountains » donne une direction. Le modèle lit les dix dernières secondes du plan comme contexte, génère le temps suivant et ajuste légèrement les dernières images pour que la jonction ne se voie pas. Cela vaut pour les plans qu’il a générés comme pour vos propres rushes, à condition qu’un fichier importé ne dépasse pas dix secondes.
Quelles références Gemini Omni Flash 1.1 accepte-t-il ?
Jusqu’à dix images de référence et trois vidéos de référence de trois secondes chacune, en plus du prompt. Une image fixe un personnage, un produit, un décor ou un style, et des balises dans le prompt attribuent son rôle à chacune. Les vidéos de référence transmettent une ressemblance ou un mouvement ; l’audio qu’elles contiennent est ignoré. Demander au modèle de raisonner sur plusieurs vidéos entières à la fois n’est pas prévu.
Le texte à l’écran fonctionne-t-il en français ?
En partie, et cela se vérifie image par image. L’anglais est la langue sur laquelle Google a évalué le modèle, et c’est là que le rendu du texte est le plus sûr. Le français s’écrit dans le même alphabet latin, celui sur lequel le rendu tient le mieux ; ce sont les écritures non latines qui décrochent. La méthode qui tient : écrivez le libellé exact dans le prompt, ponctuation comprise, gardez les paragraphes longs pour le montage, et relisez chaque image avant l’export.
Gemini Omni Flash 1.1 génère-t-il le son et les dialogues ?
Oui, le son est produit dans la même passe que l’image : dialogues synchronisés sur les lèvres, bruitages, ambiance et musique calés sur l’action. Écrivez dans le prompt le son que vous voulez, car un prompt muet sur ce point laisse le modèle inventer sa propre bande-son. Une réplique parlée, elle, s’obtient en écrivant simplement ce que dit le personnage.
Peut-on utiliser Gemini Omni Flash 1.1 sur Morphic ?
Oui. Choisissez Gemini Omni dans le sélecteur de modèles vidéo, décrivez le plan avec le son voulu, puis générez : la prise arrive sur le Canvas, à côté des résultats de Veo, Seedance et Kling, pour une lecture côte à côte. Les relances retouchent la même scène, et des images de référence peuvent accompagner le brief.
Gemini Omni Flash 1.1 et Veo 4, est-ce le même modèle ?
Non, et la confusion se comprend : les deux viennent de Google DeepMind, et Omni est souvent présenté comme le successeur de la lignée Veo. Ce sont deux modèles distincts. Veo est la famille vidéo cinématographique, aujourd’hui en Veo 3.1 ; Gemini Omni est la famille multimodale, dont le premier modèle vidéo est Omni Flash, désormais en version 1.1. Google n’a sorti aucun modèle appelé Veo 4 : toute mention de « Veo 4 » relève donc de la spéculation ou du surnom officieux donné à Omni.
En quoi Gemini Omni Flash 1.1 diffère-t-il de Veo 3.1 ?
Veo 3.1 vise la fidélité cinématographique en un plan ; Omni Flash 1.1 vise l’itération. Omni est celui que l’on dirige : il retouche sa propre sortie tour après tour, accepte un mélange de références image et vidéo, pousse une prise à 40 secondes et tient un personnage et sa voix tout du long. Pour un plan d’ouverture unique, Veo garde l’avantage sur le fini ; pour une scène que l’on affine et que l’on fait grandir, Omni Flash est le bon outil.