¿Qué puede hacer Bernini? Edición, sujeto a video y generación
| Capacidad | Qué hace | Ideal para |
|---|---|---|
| Edición con bloqueo de consistencia | Agrega, quita o modifica elementos en un clip mientras las zonas intactas se mantienen fijas | Agregar o quitar objetos, retoques limpios |
| Edición guiada por referencia | Aplica una imagen de referencia o un segundo clip al video de origen | Cambios de prenda, inserción de producto o pantalla |
| Sujeto a video | Coloca a una persona o personaje de imágenes de referencia en una nueva escena | Avatares, trabajo de personajes, contenido serializado |
| Edición de movimiento | Cambia lo que un sujeto está haciendo dentro de un clip | Recrear una acción sin volver a grabar |
| Imagen y video unificados | Un solo modelo abarca texto a imagen, edición de imagen, texto a video y edición de video | Imágenes fijas y movimiento con un mismo lenguaje de prompt |
Edición con bloqueo de consistencia
Como el planificador resuelve la semántica antes de que el renderizador pinte, Bernini conserva las partes de un clip que no pediste cambiar. Nombra el cambio y luego nombra lo que se mantiene fijo, y las zonas intactas permanecen quietas en todo el video, sin parpadeos ni desvíos. Es la característica de edición más fuerte del modelo.
Edición guiada por referencia
Aporta una imagen de referencia o un segundo clip y Bernini la aplica al video de origen. Cambia una prenda sobre un sujeto en movimiento a partir de una sola imagen fija, o inserta un producto o un video en pantalla para que siga el metraje original. El resto del clip de origen se mantiene intacto alrededor del cambio.
Sujeto a video
Pasa imágenes de referencia y menciona cada una por su índice en el prompt (image0, image1), indicando qué sujeto o atributo viene de cuál. Bernini lleva al sujeto a una nueva escena con el rostro reconocible mientras se mueve, su resultado más destacado en las evaluaciones de sujeto a video de ByteDance.
Edición de movimiento
Cambia lo que un sujeto está haciendo dentro de un clip existente, por ejemplo, una persona se agacha en vez de inclinarse, mientras su identidad, el encuadre, la iluminación y el fondo se mantienen igual. Vuelve a plantear una acción sin tener que grabar de nuevo la toma.
Imagen y video unificados
Un solo modelo abarca texto a imagen, edición de imagen, texto a video y edición de video, así que una imagen fija y una edición en movimiento salen del mismo lenguaje de prompt. Aprendes una sola forma de instruirlo y la aplicas en ambos formatos.
Casos de uso de Bernini
Limpia un metraje que ya grabaste
Quita una distracción, agrega un elemento faltante o cambia el estilo de un detalle en un clip real, sin volver a grabarlo. El bloqueo de consistencia mantiene el resto de la toma igual.

Construye un personaje que se repite
Mantén el mismo rostro a través de episodios, anuncios o una serie de avatares. Sujeto a video lleva la identidad de una persona desde algunas imágenes de referencia a nuevas escenas.

Prueba de ropa y colocación de producto
Cambia una prenda sobre un sujeto en movimiento a partir de una imagen de referencia, o coloca un producto o un video en pantalla en una toma, manteniendo intacto el clip de origen.

Cambia una actuación
Vuelve a plantear una acción o ajusta el movimiento de un sujeto en una toma, en lugar de filmarla de nuevo, mientras la identidad, el encuadre y la iluminación se mantienen fijos.

Cómo escribir prompts para Bernini
Dos hábitos hacen la mayor parte de la diferencia en la calidad con Bernini.
- Escribe una instrucción, no solo una descripción. Para las ediciones estás cambiando un clip existente, así que el prompt es una directiva: qué agregar, quitar o modificar, y dónde. Para la generación (texto a video, texto a imagen) describes toda la escena como de costumbre.
- Nombra lo que cambia y luego nombra lo que se mantiene. El renderizador puede tocar cualquier zona, así que las ediciones más confiables plantean el cambio y luego fijan todo lo que no debe moverse. Ese segundo hábito es el bloqueo de consistencia, que se cubre a continuación.
Una instrucción detallada y estructurada funciona mejor que una breve. El planificador de Bernini rinde mejor cuando detallas el tamaño, la ubicación, los materiales y cómo la iluminación del nuevo elemento combina con la escena, en lugar de apoyarte en una sola línea.
El bloqueo de consistencia: edita una cosa, mantén el resto
El renderizador conserva bien las zonas intactas, pero solo si el prompt le dice cuáles son. El patrón es plantear la edición con precisión y luego enumerar todo lo que debe quedar sin cambios, terminando en “sin cambios”. Quitar algo funciona igual, describe el relleno y luego fija los alrededores.
| Edición | Débil | Fuerte |
|---|---|---|
| Agregar un objeto | Pon un muñeco de nieve en el video | Agrega un muñeco de nieve de tres bolas en el suelo a media derecha junto al perro, con nariz de zanahoria y botones de carbón, combinando con la luz nublada y las sombras suaves. Mantén al perro, el camino y los árboles sin cambios. |
| Cambio de prenda | Cambia la camisa | Reemplaza la camisa exterior por la de la imagen de referencia, con un caído realista. Mantén la pose, la cámara, la iluminación, el fondo y el movimiento exactamente igual. |
| Sujeto a video | Usa estas referencias en un video de playa | La estatua de image0, con el short de image3, en la banca de image4 al atardecer, meciéndose suavemente con la música. Mantén el cuerpo de piedra de la estatua de image0 y la escena de playa de image4 sin cambios. |
Sáltate el bloqueo y el modelo queda libre para redibujar el fondo. Dedícale una frase y la edición se ve nativa a la toma original.
Errores comunes al escribir prompts para Bernini (y cómo corregirlos)
- Sin bloqueo: nombra lo que se mantiene sin cambios, o la edición se filtra al resto del cuadro.
- Una instrucción breve: describe el nuevo elemento por completo, su tamaño, ubicación, materiales e iluminación, en lugar de un comando de tres palabras.
- Referencias vagas: para sujeto a video, referencia cada imagen por su índice (image0, image1) e indica qué atributo viene de cuál, en vez de “usa estas referencias”.
- Ediciones de movimiento que mueven la identidad: al cambiar el movimiento, fija a la persona, el vestuario, la posición y la cámara para que solo cambie la acción.
- Esperar 4K: el render por defecto es 480p a 16fps, ajustado para la fidelidad de edición más que para la resolución. Júzgalo por qué tan limpio mantiene las zonas intactas.
Especificaciones y arquitectura de Bernini
| Especificación | Bernini |
|---|---|
| Proveedor | ByteDance |
| Arquitectura | Planificador MLLM (Qwen2.5-VL) + renderizador DiT de 14B (Wan2.2) |
| Modos | Texto a imagen, edición de imagen, texto a video, edición de video, edición de movimiento, edición por referencia, sujeto a video |
| Resolución | 480p (por defecto) |
| Cuadros por segundo | 16 fps |
| Licencia | Apache 2.0, pesos abiertos |
Preguntas frecuentes
Plantea el cambio con precisión y luego bloquea explícitamente todo lo que debe mantenerse igual: el sujeto, la cámara, la iluminación, el fondo y las sombras. Escribe con detalle en vez de una sola línea, y haz un solo cambio por pasada.
Es el hábito de redacción que hace brillar la edición de Bernini. Después de describir el cambio, fijas las zonas intactas como sin cambios. Bernini mantiene bien esas zonas, pero solo si el prompt le dice cuáles son.
Pasa varias imágenes de referencia y menciona cada una por su índice en el prompt (image0, image1, image2). Indica qué sujeto o atributo viene de cuál imagen, y luego describe la nueva escena y el movimiento.
Solo texto para la generación, un video más texto para la edición y la edición de movimiento, un video más una imagen o clip de referencia para las ediciones guiadas por referencia, y un conjunto de imágenes de referencia más texto para sujeto a video.
Sí. Bernini es un modelo de código abierto con licencia Apache 2.0, así que puedes ejecutarlo tú mismo sin costo si tienes la infraestructura para hacerlo. Morphic también te da acceso a Bernini sin que tengas que configurar nada, dentro de tu plan.
