ByteDance Bernini: panduan lengkap edit video AI dan prompt

ByteDance Bernini: panduan lengkap edit video AI dan prompt

Panduan lengkap ByteDance Bernini, model video AI open-source: yang bisa dilakukannya, spesifikasinya, cara membaca prompt, penguncian konsistensi di balik hasil edit yang bersih, dan struktur prompt per tugas.

Apa yang bisa dilakukan Bernini? Editing, subject-to-video, dan generasi

KemampuanYang dilakukanPaling cocok untuk
Editing dengan penguncian konsistensiMenambah, menghapus, atau mengubah elemen dalam klip sementara area yang tidak disentuh tetap diamTambah/hapus objek, retouch bersih
Editing berpandu referensiMenerapkan gambar referensi atau klip kedua ke video sumberGanti pakaian, penyisipan produk atau layar
Subject-to-videoMenempatkan orang atau karakter dari gambar referensi ke adegan baruAvatar, pekerjaan karakter, konten berseri
Editing gerakanMengubah apa yang dilakukan subjek di dalam klipRe-posing aksi tanpa syuting ulang
Gambar + video terpaduSatu model mencakup text-to-image, editing gambar, text-to-video, dan editing videoGambar diam dan gerak dari satu bahasa prompt yang sama

Editing dengan penguncian konsistensi

Karena planner-nya menetapkan makna sebelum renderer melukis, Bernini menjaga bagian klip yang tidak Anda minta untuk diubah. Sebutkan editnya, lalu sebutkan apa yang harus tetap, dan area yang tidak disentuh akan diam sepanjang video tanpa flicker atau drift. Ini sifat editing terkuat model ini.

Editing berpandu referensi

Masukkan gambar referensi atau klip kedua, dan Bernini menerapkannya ke video sumber. Ganti pakaian pada subjek yang bergerak hanya dari satu gambar diam, atau sisipkan produk atau video layar sehingga mengikuti footage aslinya. Sisa klip sumber tetap utuh di sekitar perubahan itu.

Subject-to-video

Masukkan gambar referensi dan rujuk masing-masing dengan indeksnya di dalam prompt (image0, image1), sebutkan subjek atau atribut mana yang berasal dari gambar mana. Bernini membawa subjek itu ke adegan baru dengan wajah yang tetap dikenali saat bergerak, hasil paling menonjolnya dalam evaluasi subject-to-video milik ByteDance.

Editing gerakan

Ubah apa yang sedang dilakukan subjek di dalam klip yang sudah ada, seseorang berjongkok alih-alih membungkuk, sementara identitas, framing, pencahayaan, dan latarnya tetap sama. Ini me-re-block sebuah aksi tanpa perlu syuting ulang.

Gambar + video terpadu

Satu model mencakup text-to-image, editing gambar, text-to-video, dan editing video, jadi gambar diam dan hasil edit bergerak datang dari bahasa prompt yang sama. Anda cukup mempelajari satu cara memberi instruksi dan menerapkannya di kedua format.

Contoh penggunaan Bernini

Bersihkan footage yang sudah Anda rekam

Hapus gangguan, tambahkan elemen yang hilang, atau ubah gaya sebuah detail di klip nyata, tanpa syuting ulang. Penguncian konsistensi menjaga sisa bidikan tetap sama.

Before and after: a distraction removed from a lakeside clip while the rest of the scene stays unchanged

Bangun karakter yang muncul berulang

Pertahankan wajah yang sama di berbagai episode, iklan, atau serial avatar. Subject-to-video membawa identitas seseorang dari beberapa gambar referensi ke adegan-adegan baru.

The same character with a consistent face shown across three different scenes and outfits

Try-on dan penempatan produk

Ganti pakaian pada subjek yang bergerak hanya dari satu gambar referensi, atau masukkan produk atau video layar ke dalam sebuah shot, dengan klip sumber tetap utuh.

Before and after: a model's tee swapped for a tailored blazer while the pose, lighting, and background stay the same

Ubah sebuah performa

Re-block sebuah aksi atau sesuaikan gerakan subjek dalam satu take, alih-alih memfilmkannya lagi, sementara identitas, framing, dan pencahayaan tetap tidak berubah.

Before and after: a subject's pose changed from bending to crouching while the scene, framing, and lighting stay the same

Cara membuat prompt Bernini

Dua kebiasaan ini membawa sebagian besar kualitas hasil Bernini.

  • Tulis sebuah instruksi, bukan sekadar deskripsi. Untuk editing, Anda sedang mengubah klip yang sudah ada, jadi prompt-nya adalah perintah: apa yang ditambah, dihapus, atau diubah, dan di mana. Untuk generasi (text-to-video, text-to-image) Anda mendeskripsikan seluruh adegan seperti biasa.
  • Sebutkan apa yang berubah, lalu sebutkan apa yang tetap. Renderer bisa menyentuh area mana pun, jadi edit yang paling andal menyatakan perubahannya lalu mengunci semua yang tidak boleh bergerak. Kebiasaan kedua ini adalah penguncian konsistensi, dibahas berikutnya.

Instruksi yang detail dan terstruktur mengalahkan yang singkat. Planner Bernini bekerja lebih baik saat Anda menjabarkan ukuran, penempatan, material, dan bagaimana pencahayaan elemen baru itu cocok dengan adegannya, ketimbang mengandalkan satu baris kalimat pendek.

Penguncian konsistensi: edit satu hal, pertahankan sisanya

Renderer menjaga area yang tidak disentuh dengan baik, tapi hanya jika prompt memberitahunya apa saja area itu. Polanya adalah menyatakan edit secara presisi, lalu mendaftar semua yang harus tetap tidak berubah, diakhiri dengan kata "tidak berubah". Penghapusan bekerja dengan cara yang sama, deskripsikan pengisinya, lalu kunci sekelilingnya.

EditLemahKuat
Tambah objekTaruh boneka salju di videonyaTambahkan boneka salju tiga bola salju di tanah tengah-kanan di samping anjing, hidung wortel dan kancing arang, cocok dengan cahaya mendung dan bayangan lembut. Pertahankan anjing, jalan, dan pohon tidak berubah.
Ganti pakaianUbah kemejanyaGanti kemeja luarnya dengan yang ada di gambar referensi, dikenakan dengan drape yang realistis. Pertahankan pose, kamera, pencahayaan, latar, dan gerakan persis seperti aslinya.
Subject-to-videoPakai referensi ini di video pantaiPatung dari image0, memakai celana pendek dari image3, di bangku dari image4 saat matahari terbenam, bergoyang lembut mengikuti musik. Pertahankan tubuh batu patung dari image0 dan adegan pantai dari image4 tidak berubah.

Lewatkan penguncian ini dan model bebas menggambar ulang latarnya. Luangkan satu kalimat untuknya dan hasil editnya terbaca seperti bagian asli dari shot aslinya.

Kesalahan umum prompt Bernini (dan cara memperbaikinya)

  • Tanpa penguncian: sebutkan apa yang tetap tidak berubah, atau editnya akan merembes ke sisa frame.
  • Instruksi yang singkat: deskripsikan elemen baru secara penuh, ukuran, penempatan, material, dan pencahayaannya, bukan perintah tiga kata.
  • Referensi yang samar: untuk subject-to-video, rujuk tiap gambar dengan indeksnya (image0, image1) dan sebutkan atribut mana berasal dari gambar mana, alih-alih "pakai referensi ini".
  • Editing gerakan yang menggeser identitas: saat mengubah gerakan, kunci orang, pakaian, posisi, dan kameranya sehingga hanya aksinya yang berubah.
  • Berharap 4K: render bawaannya adalah 480p pada 16fps, disetel untuk fidelitas editing di atas resolusi. Nilai dari seberapa bersih ia menjaga area yang tidak disentuh.

Spesifikasi dan arsitektur Bernini

SpesifikasiBernini
ProviderByteDance
ArsitekturMLLM planner (Qwen2.5-VL) + renderer DiT 14B (Wan2.2)
ModeText-to-image, editing gambar, text-to-video, editing video, editing gerakan, editing referensi, subject-to-video
Resolusi480p (bawaan)
Frame rate16 fps
LisensiApache 2.0, open weights

FAQ

Bagaimana cara mendapat hasil terbaik dari Bernini?

Sebutkan perubahannya secara presisi, lalu kunci secara eksplisit semua yang harus tetap tidak berubah, subjek, kamera, pencahayaan, latar, dan bayangan. Tulis dengan detail, bukan satu baris kalimat, dan buat satu edit per pass.

Apa itu penguncian konsistensi di Bernini?

Ini kebiasaan penulisan prompt yang membuat kemampuan editing Bernini bersinar. Setelah Anda mendeskripsikan editnya, Anda mengunci area yang tidak disentuh sebagai tidak berubah. Bernini menjaga area itu dengan baik, tapi hanya jika prompt memberitahunya apa saja area itu.

Bagaimana cara mereferensikan gambar untuk subject-to-video?

Masukkan beberapa gambar referensi dan rujuk masing-masing dengan indeksnya di dalam prompt (image0, image1, image2). Sebutkan subjek atau atribut mana yang berasal dari gambar mana, lalu deskripsikan adegan baru dan gerakannya.

Input apa saja yang bisa diterima Bernini?

Teks saja untuk generasi, video plus teks untuk editing dan editing gerakan, video plus gambar atau klip referensi untuk edit berpandu referensi, dan sekumpulan gambar referensi plus teks untuk subject-to-video.

Berapa resolusi dan frame rate output Bernini?

Pengaturan render bawaannya adalah 480p pada 16fps. Rilisnya memprioritaskan fidelitas editing dan konsistensi di atas resolusi maksimal, dan pengaturan lebih tinggi memungkinkan dengan biaya komputasi yang lebih besar.