ByteDance Bernini: guía completa de edición de video con IA y prompts

ByteDance Bernini: guía completa de edición de video con IA y prompts

La guía completa de ByteDance Bernini, el modelo de video con IA de código abierto: qué hace, sus especificaciones, cómo lee un prompt, el bloqueo de consistencia detrás de ediciones limpias y la estructura de prompt por tarea.

¿Qué puede hacer Bernini? Edición, sujeto a video y generación

CapacidadQué haceIdeal para
Edición con bloqueo de consistenciaAgrega, quita o modifica elementos en un clip mientras las zonas intactas se mantienen fijasAgregar o quitar objetos, retoques limpios
Edición guiada por referenciaAplica una imagen de referencia o un segundo clip al video de origenCambios de prenda, inserción de producto o pantalla
Sujeto a videoColoca a una persona o personaje de imágenes de referencia en una nueva escenaAvatares, trabajo de personajes, contenido serializado
Edición de movimientoCambia lo que un sujeto está haciendo dentro de un clipRecrear una acción sin volver a grabar
Imagen y video unificadosUn solo modelo abarca texto a imagen, edición de imagen, texto a video y edición de videoImágenes fijas y movimiento con un mismo lenguaje de prompt

Edición con bloqueo de consistencia

Como el planificador resuelve la semántica antes de que el renderizador pinte, Bernini conserva las partes de un clip que no pediste cambiar. Nombra el cambio y luego nombra lo que se mantiene fijo, y las zonas intactas permanecen quietas en todo el video, sin parpadeos ni desvíos. Es la característica de edición más fuerte del modelo.

Edición guiada por referencia

Aporta una imagen de referencia o un segundo clip y Bernini la aplica al video de origen. Cambia una prenda sobre un sujeto en movimiento a partir de una sola imagen fija, o inserta un producto o un video en pantalla para que siga el metraje original. El resto del clip de origen se mantiene intacto alrededor del cambio.

Sujeto a video

Pasa imágenes de referencia y menciona cada una por su índice en el prompt (image0, image1), indicando qué sujeto o atributo viene de cuál. Bernini lleva al sujeto a una nueva escena con el rostro reconocible mientras se mueve, su resultado más destacado en las evaluaciones de sujeto a video de ByteDance.

Edición de movimiento

Cambia lo que un sujeto está haciendo dentro de un clip existente, por ejemplo, una persona se agacha en vez de inclinarse, mientras su identidad, el encuadre, la iluminación y el fondo se mantienen igual. Vuelve a plantear una acción sin tener que grabar de nuevo la toma.

Imagen y video unificados

Un solo modelo abarca texto a imagen, edición de imagen, texto a video y edición de video, así que una imagen fija y una edición en movimiento salen del mismo lenguaje de prompt. Aprendes una sola forma de instruirlo y la aplicas en ambos formatos.

Casos de uso de Bernini

Limpia un metraje que ya grabaste

Quita una distracción, agrega un elemento faltante o cambia el estilo de un detalle en un clip real, sin volver a grabarlo. El bloqueo de consistencia mantiene el resto de la toma igual.

Antes y después: una distracción eliminada de un clip junto al lago mientras el resto de la escena se mantiene sin cambios

Construye un personaje que se repite

Mantén el mismo rostro a través de episodios, anuncios o una serie de avatares. Sujeto a video lleva la identidad de una persona desde algunas imágenes de referencia a nuevas escenas.

El mismo personaje con un rostro consistente mostrado en tres escenas y vestuarios diferentes

Prueba de ropa y colocación de producto

Cambia una prenda sobre un sujeto en movimiento a partir de una imagen de referencia, o coloca un producto o un video en pantalla en una toma, manteniendo intacto el clip de origen.

Antes y después: la camiseta de una modelo cambiada por un blazer entallado mientras la pose, la iluminación y el fondo se mantienen iguales

Cambia una actuación

Vuelve a plantear una acción o ajusta el movimiento de un sujeto en una toma, en lugar de filmarla de nuevo, mientras la identidad, el encuadre y la iluminación se mantienen fijos.

Antes y después: la pose de un sujeto cambiada de inclinada a agachada mientras la escena, el encuadre y la iluminación se mantienen iguales

Cómo escribir prompts para Bernini

Dos hábitos hacen la mayor parte de la diferencia en la calidad con Bernini.

  • Escribe una instrucción, no solo una descripción. Para las ediciones estás cambiando un clip existente, así que el prompt es una directiva: qué agregar, quitar o modificar, y dónde. Para la generación (texto a video, texto a imagen) describes toda la escena como de costumbre.
  • Nombra lo que cambia y luego nombra lo que se mantiene. El renderizador puede tocar cualquier zona, así que las ediciones más confiables plantean el cambio y luego fijan todo lo que no debe moverse. Ese segundo hábito es el bloqueo de consistencia, que se cubre a continuación.

Una instrucción detallada y estructurada funciona mejor que una breve. El planificador de Bernini rinde mejor cuando detallas el tamaño, la ubicación, los materiales y cómo la iluminación del nuevo elemento combina con la escena, en lugar de apoyarte en una sola línea.

El bloqueo de consistencia: edita una cosa, mantén el resto

El renderizador conserva bien las zonas intactas, pero solo si el prompt le dice cuáles son. El patrón es plantear la edición con precisión y luego enumerar todo lo que debe quedar sin cambios, terminando en “sin cambios”. Quitar algo funciona igual, describe el relleno y luego fija los alrededores.

EdiciónDébilFuerte
Agregar un objetoPon un muñeco de nieve en el videoAgrega un muñeco de nieve de tres bolas en el suelo a media derecha junto al perro, con nariz de zanahoria y botones de carbón, combinando con la luz nublada y las sombras suaves. Mantén al perro, el camino y los árboles sin cambios.
Cambio de prendaCambia la camisaReemplaza la camisa exterior por la de la imagen de referencia, con un caído realista. Mantén la pose, la cámara, la iluminación, el fondo y el movimiento exactamente igual.
Sujeto a videoUsa estas referencias en un video de playaLa estatua de image0, con el short de image3, en la banca de image4 al atardecer, meciéndose suavemente con la música. Mantén el cuerpo de piedra de la estatua de image0 y la escena de playa de image4 sin cambios.

Sáltate el bloqueo y el modelo queda libre para redibujar el fondo. Dedícale una frase y la edición se ve nativa a la toma original.

Errores comunes al escribir prompts para Bernini (y cómo corregirlos)

  • Sin bloqueo: nombra lo que se mantiene sin cambios, o la edición se filtra al resto del cuadro.
  • Una instrucción breve: describe el nuevo elemento por completo, su tamaño, ubicación, materiales e iluminación, en lugar de un comando de tres palabras.
  • Referencias vagas: para sujeto a video, referencia cada imagen por su índice (image0, image1) e indica qué atributo viene de cuál, en vez de “usa estas referencias”.
  • Ediciones de movimiento que mueven la identidad: al cambiar el movimiento, fija a la persona, el vestuario, la posición y la cámara para que solo cambie la acción.
  • Esperar 4K: el render por defecto es 480p a 16fps, ajustado para la fidelidad de edición más que para la resolución. Júzgalo por qué tan limpio mantiene las zonas intactas.

Especificaciones y arquitectura de Bernini

EspecificaciónBernini
ProveedorByteDance
ArquitecturaPlanificador MLLM (Qwen2.5-VL) + renderizador DiT de 14B (Wan2.2)
ModosTexto a imagen, edición de imagen, texto a video, edición de video, edición de movimiento, edición por referencia, sujeto a video
Resolución480p (por defecto)
Cuadros por segundo16 fps
LicenciaApache 2.0, pesos abiertos

Preguntas frecuentes

¿Cómo consigo los mejores resultados con Bernini?

Plantea el cambio con precisión y luego bloquea explícitamente todo lo que debe mantenerse igual: el sujeto, la cámara, la iluminación, el fondo y las sombras. Escribe con detalle en vez de una sola línea, y haz un solo cambio por pasada.

¿Qué es el bloqueo de consistencia?

Es el hábito de redacción que hace brillar la edición de Bernini. Después de describir el cambio, fijas las zonas intactas como sin cambios. Bernini mantiene bien esas zonas, pero solo si el prompt le dice cuáles son.

¿Cómo referencio imágenes para sujeto a video?

Pasa varias imágenes de referencia y menciona cada una por su índice en el prompt (image0, image1, image2). Indica qué sujeto o atributo viene de cuál imagen, y luego describe la nueva escena y el movimiento.

¿Qué tipos de entrada acepta Bernini?

Solo texto para la generación, un video más texto para la edición y la edición de movimiento, un video más una imagen o clip de referencia para las ediciones guiadas por referencia, y un conjunto de imágenes de referencia más texto para sujeto a video.

¿Es gratis usar Bernini?

Sí. Bernini es un modelo de código abierto con licencia Apache 2.0, así que puedes ejecutarlo tú mismo sin costo si tienes la infraestructura para hacerlo. Morphic también te da acceso a Bernini sin que tengas que configurar nada, dentro de tu plan.