Apa yang bisa dilakukan Bernini? Editing, subject-to-video, dan generasi
| Kemampuan | Yang dilakukan | Paling cocok untuk |
|---|---|---|
| Editing dengan penguncian konsistensi | Menambah, menghapus, atau mengubah elemen dalam klip sementara area yang tidak disentuh tetap diam | Tambah/hapus objek, retouch bersih |
| Editing berpandu referensi | Menerapkan gambar referensi atau klip kedua ke video sumber | Ganti pakaian, penyisipan produk atau layar |
| Subject-to-video | Menempatkan orang atau karakter dari gambar referensi ke adegan baru | Avatar, pekerjaan karakter, konten berseri |
| Editing gerakan | Mengubah apa yang dilakukan subjek di dalam klip | Re-posing aksi tanpa syuting ulang |
| Gambar + video terpadu | Satu model mencakup text-to-image, editing gambar, text-to-video, dan editing video | Gambar diam dan gerak dari satu bahasa prompt yang sama |
Editing dengan penguncian konsistensi
Karena planner-nya menetapkan makna sebelum renderer melukis, Bernini menjaga bagian klip yang tidak Anda minta untuk diubah. Sebutkan editnya, lalu sebutkan apa yang harus tetap, dan area yang tidak disentuh akan diam sepanjang video tanpa flicker atau drift. Ini sifat editing terkuat model ini.
Editing berpandu referensi
Masukkan gambar referensi atau klip kedua, dan Bernini menerapkannya ke video sumber. Ganti pakaian pada subjek yang bergerak hanya dari satu gambar diam, atau sisipkan produk atau video layar sehingga mengikuti footage aslinya. Sisa klip sumber tetap utuh di sekitar perubahan itu.
Subject-to-video
Masukkan gambar referensi dan rujuk masing-masing dengan indeksnya di dalam prompt (image0, image1), sebutkan subjek atau atribut mana yang berasal dari gambar mana. Bernini membawa subjek itu ke adegan baru dengan wajah yang tetap dikenali saat bergerak, hasil paling menonjolnya dalam evaluasi subject-to-video milik ByteDance.
Editing gerakan
Ubah apa yang sedang dilakukan subjek di dalam klip yang sudah ada, seseorang berjongkok alih-alih membungkuk, sementara identitas, framing, pencahayaan, dan latarnya tetap sama. Ini me-re-block sebuah aksi tanpa perlu syuting ulang.
Gambar + video terpadu
Satu model mencakup text-to-image, editing gambar, text-to-video, dan editing video, jadi gambar diam dan hasil edit bergerak datang dari bahasa prompt yang sama. Anda cukup mempelajari satu cara memberi instruksi dan menerapkannya di kedua format.
Contoh penggunaan Bernini
Bersihkan footage yang sudah Anda rekam
Hapus gangguan, tambahkan elemen yang hilang, atau ubah gaya sebuah detail di klip nyata, tanpa syuting ulang. Penguncian konsistensi menjaga sisa bidikan tetap sama.

Bangun karakter yang muncul berulang
Pertahankan wajah yang sama di berbagai episode, iklan, atau serial avatar. Subject-to-video membawa identitas seseorang dari beberapa gambar referensi ke adegan-adegan baru.

Try-on dan penempatan produk
Ganti pakaian pada subjek yang bergerak hanya dari satu gambar referensi, atau masukkan produk atau video layar ke dalam sebuah shot, dengan klip sumber tetap utuh.

Ubah sebuah performa
Re-block sebuah aksi atau sesuaikan gerakan subjek dalam satu take, alih-alih memfilmkannya lagi, sementara identitas, framing, dan pencahayaan tetap tidak berubah.

Cara membuat prompt Bernini
Dua kebiasaan ini membawa sebagian besar kualitas hasil Bernini.
- Tulis sebuah instruksi, bukan sekadar deskripsi. Untuk editing, Anda sedang mengubah klip yang sudah ada, jadi prompt-nya adalah perintah: apa yang ditambah, dihapus, atau diubah, dan di mana. Untuk generasi (text-to-video, text-to-image) Anda mendeskripsikan seluruh adegan seperti biasa.
- Sebutkan apa yang berubah, lalu sebutkan apa yang tetap. Renderer bisa menyentuh area mana pun, jadi edit yang paling andal menyatakan perubahannya lalu mengunci semua yang tidak boleh bergerak. Kebiasaan kedua ini adalah penguncian konsistensi, dibahas berikutnya.
Instruksi yang detail dan terstruktur mengalahkan yang singkat. Planner Bernini bekerja lebih baik saat Anda menjabarkan ukuran, penempatan, material, dan bagaimana pencahayaan elemen baru itu cocok dengan adegannya, ketimbang mengandalkan satu baris kalimat pendek.
Penguncian konsistensi: edit satu hal, pertahankan sisanya
Renderer menjaga area yang tidak disentuh dengan baik, tapi hanya jika prompt memberitahunya apa saja area itu. Polanya adalah menyatakan edit secara presisi, lalu mendaftar semua yang harus tetap tidak berubah, diakhiri dengan kata "tidak berubah". Penghapusan bekerja dengan cara yang sama, deskripsikan pengisinya, lalu kunci sekelilingnya.
| Edit | Lemah | Kuat |
|---|---|---|
| Tambah objek | Taruh boneka salju di videonya | Tambahkan boneka salju tiga bola salju di tanah tengah-kanan di samping anjing, hidung wortel dan kancing arang, cocok dengan cahaya mendung dan bayangan lembut. Pertahankan anjing, jalan, dan pohon tidak berubah. |
| Ganti pakaian | Ubah kemejanya | Ganti kemeja luarnya dengan yang ada di gambar referensi, dikenakan dengan drape yang realistis. Pertahankan pose, kamera, pencahayaan, latar, dan gerakan persis seperti aslinya. |
| Subject-to-video | Pakai referensi ini di video pantai | Patung dari image0, memakai celana pendek dari image3, di bangku dari image4 saat matahari terbenam, bergoyang lembut mengikuti musik. Pertahankan tubuh batu patung dari image0 dan adegan pantai dari image4 tidak berubah. |
Lewatkan penguncian ini dan model bebas menggambar ulang latarnya. Luangkan satu kalimat untuknya dan hasil editnya terbaca seperti bagian asli dari shot aslinya.
Kesalahan umum prompt Bernini (dan cara memperbaikinya)
- Tanpa penguncian: sebutkan apa yang tetap tidak berubah, atau editnya akan merembes ke sisa frame.
- Instruksi yang singkat: deskripsikan elemen baru secara penuh, ukuran, penempatan, material, dan pencahayaannya, bukan perintah tiga kata.
- Referensi yang samar: untuk subject-to-video, rujuk tiap gambar dengan indeksnya (image0, image1) dan sebutkan atribut mana berasal dari gambar mana, alih-alih "pakai referensi ini".
- Editing gerakan yang menggeser identitas: saat mengubah gerakan, kunci orang, pakaian, posisi, dan kameranya sehingga hanya aksinya yang berubah.
- Berharap 4K: render bawaannya adalah 480p pada 16fps, disetel untuk fidelitas editing di atas resolusi. Nilai dari seberapa bersih ia menjaga area yang tidak disentuh.
Spesifikasi dan arsitektur Bernini
| Spesifikasi | Bernini |
|---|---|
| Provider | ByteDance |
| Arsitektur | MLLM planner (Qwen2.5-VL) + renderer DiT 14B (Wan2.2) |
| Mode | Text-to-image, editing gambar, text-to-video, editing video, editing gerakan, editing referensi, subject-to-video |
| Resolusi | 480p (bawaan) |
| Frame rate | 16 fps |
| Lisensi | Apache 2.0, open weights |
FAQ
Sebutkan perubahannya secara presisi, lalu kunci secara eksplisit semua yang harus tetap tidak berubah, subjek, kamera, pencahayaan, latar, dan bayangan. Tulis dengan detail, bukan satu baris kalimat, dan buat satu edit per pass.
Ini kebiasaan penulisan prompt yang membuat kemampuan editing Bernini bersinar. Setelah Anda mendeskripsikan editnya, Anda mengunci area yang tidak disentuh sebagai tidak berubah. Bernini menjaga area itu dengan baik, tapi hanya jika prompt memberitahunya apa saja area itu.
Masukkan beberapa gambar referensi dan rujuk masing-masing dengan indeksnya di dalam prompt (image0, image1, image2). Sebutkan subjek atau atribut mana yang berasal dari gambar mana, lalu deskripsikan adegan baru dan gerakannya.
Teks saja untuk generasi, video plus teks untuk editing dan editing gerakan, video plus gambar atau klip referensi untuk edit berpandu referensi, dan sekumpulan gambar referensi plus teks untuk subject-to-video.
Pengaturan render bawaannya adalah 480p pada 16fps. Rilisnya memprioritaskan fidelitas editing dan konsistensi di atas resolusi maksimal, dan pengaturan lebih tinggi memungkinkan dengan biaya komputasi yang lebih besar.
