Bernini
von ByteDance
ByteDances offenes Modell für anweisungsbasierte Video‑Edits, mit stabiler Identität.

Hauptfunktionen
Technische Spezifikationen
Planner + DiT
Qwen2.5-VL-Planer, 14B-Wan2.2-Renderer
Edit, Generate, R2V
Bearbeitung, Erzeugung, Subject-to-Video
480p / 16fps
Standard-Render-Einstellung
Apache 2.0
Offene Gewichte, selbst hostbar
Anwendungsfälle
Reales Filmmaterial erweitern
Requisiten hinzufügen oder entfernen, ein Detail korrigieren oder ein Element in einem Clip umstylen, ganz ohne neuen Dreh. Die Konsistenzsperre hält den Rest der Aufnahme identisch, Edits wirken dadurch nativ.
Wiederkehrende Charaktere und Avatare
Das gleiche Gesicht über Episoden, Anzeigen oder eine Avatar-Serie hinweg beibehalten. Subject-to-Video hält die Identität einer Person aus wenigen Referenzbildern, während sie sich durch neue Szenen bewegt.
Virtuelle Anprobe und Produktplatzierung
Kleidung an einem sich bewegenden Model per Referenz tauschen, oder ein Produkt beziehungsweise einen Bildschirminhalt in eine Aufnahme einsetzen, für Fashion- und Werbeproduktionen, bei denen der Ursprungsclip erhalten bleiben muss.
Handlung neu blocken
Ändern, was jemand in einer Aufnahme tut, aus einem Stand wird ein Kauern, ganz ohne erneuten Dreh. Die Bewegungsbearbeitung verändert die Handlung, während Identität, Bildausschnitt und Licht fixiert bleiben.
Prompt-Beispiele
Konsistenz-Edit
Fügen Sie einen Schneemann neben dem Hund auf dem verschneiten Weg hinzu, und lassen Sie den Hund, die Straße und die Bäume unverändert
Edit promptIdentitätsgesperrtes Subjekt
Setzen Sie diese Person nachts auf ein neonbeleuchtetes Großstadtdach, sie dreht sich sanft zur Kamera, Gesicht und Jacke bleiben erhalten
Edit promptReferenz-Swap
Ersetzen Sie das Oberhemd durch das aus dem Referenzbild, und behalten Sie Pose, Licht und Bewegung exakt bei
Edit promptÜberblick
Bernini ist ByteDances offenes Framework für KI-Videoerzeugung und -bearbeitung, veröffentlicht unter Apache 2.0 im Juni 2026. Der Aufbau teilt die Aufgabe in zwei Schritte: Ein MLLM-basierter Planer (Qwen2.5-VL) entscheidet über die Semantik des Ergebnisses, dann malt ein DiT-basierter Renderer auf Basis von Wan2.2 die Pixel. Weil Planung und Rendering getrennte Stufen sind, ist Bernini ungewöhnlich gut in dem, woran die meisten Videomodelle scheitern: einen echten Clip bearbeiten und dabei alles unberührt lassen, was nicht verändert werden soll. Es deckt Text-to-Image, Bildbearbeitung, Text-to-Video, anweisungsbasierte Videobearbeitung, referenzbasierte Edits wie Kleidungs-Swaps und Video-Einfügung sowie Subject-to-Video ab, wobei das Spitzenergebnis die Identitätswahrung einer Person ist, während sie sich durch eine neue Szene bewegt.
Einfache Preise
Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.
Basic
2400 monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Standard
3625 monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Pro
6350 gemeinsame monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Max
24650 gemeinsame monatliche Credits
1 Nutzer
Alle Modelle
Workflows
Enterprise
Für höhere Limits
Individuell
Preis- und Abrechnungsbedingungen

Free
Zum Ausprobieren
$0
dauerhaft kostenlos
Häufig gestellte Fragen
Mehr über Bernini
Anleitungen, Prompts und Vergleiche zu Bernini.
Weitere Modelle
Entdecken Sie den Rest des Morphic-Modellkatalogs.
ChatGPT Images 2.5
OpenAI
OpenAIs Bildmodell, erschienen im September 2026. Schärfere Details, präzise Edits, kürzere Wartezeit.
Lyria 3.5
Google DeepMind
Googles bestklingendes Musikmodell. Ganze Songs mit Aufbau und Gesang.
MiniMax H3 Max Turbo
fal.ai
Das Tempo-Modell von fal, aus H3 Max. Doppelt so schnell, fast gleiche Optik.
Inworld TTS 2
Inworld
Eine Stimme, über 100 Sprachen. 95 Stimmen, erster Ton in Echtzeit.