Video-Generierung

Bernini

von ByteDance

ByteDances offenes Modell für anweisungsbasierte Video‑Edits, mit stabiler Identität.

Bernini

Hauptfunktionen

Technische Spezifikationen

Planner + DiT

Qwen2.5-VL-Planer, 14B-Wan2.2-Renderer

Edit, Generate, R2V

Bearbeitung, Erzeugung, Subject-to-Video

480p / 16fps

Standard-Render-Einstellung

Apache 2.0

Offene Gewichte, selbst hostbar

Anwendungsfälle

Reales Filmmaterial erweitern

Requisiten hinzufügen oder entfernen, ein Detail korrigieren oder ein Element in einem Clip umstylen, ganz ohne neuen Dreh. Die Konsistenzsperre hält den Rest der Aufnahme identisch, Edits wirken dadurch nativ.

Wiederkehrende Charaktere und Avatare

Das gleiche Gesicht über Episoden, Anzeigen oder eine Avatar-Serie hinweg beibehalten. Subject-to-Video hält die Identität einer Person aus wenigen Referenzbildern, während sie sich durch neue Szenen bewegt.

Virtuelle Anprobe und Produktplatzierung

Kleidung an einem sich bewegenden Model per Referenz tauschen, oder ein Produkt beziehungsweise einen Bildschirminhalt in eine Aufnahme einsetzen, für Fashion- und Werbeproduktionen, bei denen der Ursprungsclip erhalten bleiben muss.

Handlung neu blocken

Ändern, was jemand in einer Aufnahme tut, aus einem Stand wird ein Kauern, ganz ohne erneuten Dreh. Die Bewegungsbearbeitung verändert die Handlung, während Identität, Bildausschnitt und Licht fixiert bleiben.

Prompt-Beispiele

Konsistenz-Edit

Fügen Sie einen Schneemann neben dem Hund auf dem verschneiten Weg hinzu, und lassen Sie den Hund, die Straße und die Bäume unverändert

Edit prompt

Identitätsgesperrtes Subjekt

Setzen Sie diese Person nachts auf ein neonbeleuchtetes Großstadtdach, sie dreht sich sanft zur Kamera, Gesicht und Jacke bleiben erhalten

Edit prompt

Referenz-Swap

Ersetzen Sie das Oberhemd durch das aus dem Referenzbild, und behalten Sie Pose, Licht und Bewegung exakt bei

Edit prompt

Einfache Preise

Starten Sie noch heute kostenlos, mit der Option, jederzeit zu upgraden oder zu kündigen.

Basic

$9/ Monat
abgerechnet als $0 pro Jahr

900 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Standard

$24/ Monat
abgerechnet als $0 pro Jahr

3200 monatliche Credits

1 Nutzer

Alle Modelle

Workflows

Pro

$45/ Monat
abgerechnet als $0 pro Jahr

6200 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 4 weitere gegen Aufpreis

Alle Modelle

Workflows

Pro Max

$170/ Monat
abgerechnet als $0 pro Jahr

24000 gemeinsame monatliche Credits

1 Nutzer

+ bis zu 9 weitere gegen Aufpreis

Alle Modelle

Workflows

Enterprise

Für höhere Limits

Individuell

Preis- und Abrechnungsbedingungen

High-Volume-Credits
Individuelle Platzlimits
Alle Modelle
Workflows
Pricing Gradient

Free

Zum Ausprobieren

$0

dauerhaft kostenlos

Bis zu 20 Credits
Nur 1 Nutzer
Eingeschränkte Modelle
Workflows

Häufig gestellte Fragen

Was ist Bernini?
Bernini ist ByteDances offenes, einheitliches Framework für Videoerzeugung und -bearbeitung. Es kombiniert einen MLLM-basierten semantischen Planer mit einem DiT-basierten Renderer auf Basis von Wan2.2 und wurde im Juni 2026 unter Apache 2.0 veröffentlicht.
Ist Bernini kostenlos und Open Source nutzbar?
Ja. Der Inferenzcode und die Renderer-Gewichte sind auf GitHub und Hugging Face öffentlich unter Apache 2.0 verfügbar. Sie können das Modell auf eigener Hardware betreiben, empfohlen wird eine GPU der Hopper-Klasse, für Video mehrere GPUs.
Was kann Bernini?
Es beherrscht Text-to-Image, Bildbearbeitung, Text-to-Video, anweisungsbasierte Videobearbeitung, referenzbasierte Edits wie Kleidungs-Swaps und Video-Einfügung sowie Subject-to-Video, das eine Person oder Figur in eine neue Szene setzt.
Wie unterscheidet sich Bernini von einem klassischen Videomodell?
Die meisten Videomodelle erzeugen von Grund auf neu. Bernini teilt die Arbeit auf: Ein MLLM-Planer entscheidet über die Semantik, dann malt der Renderer die Pixel. Dieser Aufbau sorgt für starke Konsistenz bei Edits, unberührte Teile eines Clips bleiben unverändert, und für starke Identitätswahrung bei Subject-to-Video.
Wie gut erhält Bernini die Identität eines Subjekts?
Die Identitätswahrung ist das Spitzenergebnis des Modells. In ByteDances Subject-to-Video-Auswertungen liegt es bei der Gesichtsähnlichkeit vor vergleichbaren Systemen und hält ein erkennbares Gesicht, während sich die Person bewegt, geeignet für Avatare, Charakterarbeit und Serieninhalte, in denen dasselbe Gesicht wiederkehren muss.
Welche Auflösung gibt Bernini aus?
Die Standard-Render-Einstellung liegt bei 480p und 16fps. Die Veröffentlichung priorisiert Bearbeitungstreue und Konsistenz vor maximaler Auflösung, höhere Einstellungen sind mit mehr Rechenaufwand möglich.