Cómo usar Kling 3.0 en Morphic
1. Elige el modo Video
Desde la barra de prompt, cambia al modo Video. Esto pone la interfaz en generación de video, donde puedes configurar ajustes como la resolución, la duración y si quieres incluir audio nativo.
2. Elige Kling 3.0 como tu modelo
Abre el menú desplegable de modelos y elige Kling 3.0 entre los modelos de video disponibles. Morphic ofrece varios modelos de video, así que puedes comparar resultados entre distintos generadores sin cambiar de plataforma.
3. Escribe tu prompt
Describe la escena que quieres. Incluye detalles sobre el sujeto, el entorno, el movimiento de cámara, la iluminación y cualquier diálogo. Piensa como director, no como fotógrafo: describe lo que pasa a lo largo del tiempo, no solo un cuadro estático. Si quieres varios planos, activa el interruptor de multitoma o etiqueta cada plano dentro de tu prompt.
4. Genera
Ejecuta el prompt. Kling 3.0 produce clips de video de entre 3 y 15 segundos de duración, con audio nativo incluido cuando está activado. Revisa el resultado, ajusta tu prompt si lo necesitas y regenera hasta obtener el clip que buscas.
¿Qué es Kling 3.0?
Kling 3.0 es el modelo de generación de video con IA más reciente de Kuaishou, lanzado en febrero de 2026. Se construye sobre Kling Video 2.6 y Kling O1 al fusionarlos en una arquitectura multimodal unificada que maneja video, audio y texto en una sola pasada de generación.
Donde los modelos de video con IA anteriores producían clips aislados de un solo plano y sin audio, Kling 3.0 genera secuencias multitoma con diálogo sincronizado y audio nativo. El modelo entiende el lenguaje cinematográfico (planos de seguimiento, primeros planos, plano-contraplano) y puede planear las transiciones de escena por su cuenta cuando describes una narrativa en tu prompt.
Kling 3.0 está disponible en Morphic como parte de la suite de generación de video multi-modelo de la plataforma, lo que significa que puedes usarlo junto con las herramientas de imagen, música y audio de Morphic en el mismo espacio de trabajo.
Funciones y capacidades de Kling 3.0
Generación de storyboard multitoma con dos modos de control
Esta es la función que distingue a Kling 3.0 de cualquier otro modelo de video con IA disponible ahora mismo. Genera hasta seis cortes de cámara en una sola generación, y te da dos formas de controlarlos:
- Multitoma automático: activa el interruptor de multitoma y el modelo planea las transiciones de plano por su cuenta según tu prompt. Lee la descripción de tu escena y decide dónde cortar, qué ángulo usar y cómo ritmar la secuencia.
- Multitoma personalizado: defines cada plano de forma manual. Estableces el número de planos, la duración de cada uno, el ángulo de cámara y qué pasa en el cuadro. El modelo sigue tu storyboard al pie de la letra.
El modo automático funciona bien cuando quieres resultados rápidos a partir de un prompt narrativo. El modo personalizado es mejor cuando necesitas control preciso, por ejemplo al construir un anuncio de producto con un ritmo de plano por plano específico.
Referencias de elementos con vinculación de voz
La mayoría de los modelos de video con IA te dejan subir una imagen de referencia para anclar la apariencia de un personaje. Kling 3.0 va más allá. Puedes subir un clip de video corto como referencia, y el modelo extrae tanto la apariencia visual del personaje como el tono natural de su voz. Esa voz queda vinculada al elemento del personaje, así que cada vez que ese personaje habla en tu video, la voz se mantiene consistente sin que tengas que volver a especificarla en el prompt.
También puedes crear elementos a partir de 2 a 4 imágenes de referencia y asignar por separado un tono de voz al subir audio o elegir entre las voces disponibles. Esto es especialmente útil para personajes recurrentes en varias generaciones de video.
Dialecto, acento y cambio de idioma dentro del mismo clip
El audio nativo de Kling 3.0 admite cinco idiomas: inglés, chino, japonés, coreano y español. Pero va más allá del soporte básico de idioma. El modelo puede replicar dialectos y acentos específicos, incluyendo cantonés, chino del noreste, sichuanés y dialecto de Pekín para el chino, y acentos estadounidense, británico e indio para el inglés.
También maneja el cambio de idioma dentro de la misma conversación, es decir, los personajes pueden alternar entre idiomas a mitad de la conversación dentro del mismo video. Una reunión de negocios bilingüe, un turista que pide direcciones en español entrecortado o una escena familiar que mezcla dialectos, todo se genera con movimientos labiales naturales y expresiones faciales coherentes.
Salida de video en 4K nativo
El modelo admite hasta resolución 4K de forma nativa, no escalada a partir de una resolución más baja. Esto significa que las texturas, el detalle de la piel y elementos finos como la trama de la tela y los hilos de cabello llevan detalle auténtico en vez del aspecto suave y difuminado que produce el escalado. También hay resoluciones más bajas disponibles (1080p y 720p), y el modelo admite relaciones de aspecto 16:9, 9:16 y 1:1.
Conservación de texto y logotipos durante el movimiento de cámara
Kling 3.0 puede leer texto de imágenes subidas, como letreros, etiquetas de producto o logotipos, y mantener ese texto legible durante todo el video incluso cuando la cámara se mueve. También puede generar contenido de texto nuevo dentro del propio video. Para trabajos comerciales donde el texto de marca necesita mantenerse nítido durante una órbita de producto o un plano de seguimiento, esto elimina la necesidad de superposiciones de texto en posproducción.
Consistencia de personajes en secuencias multitoma
Sube imágenes de referencia o un video de referencia corto, y el modelo fija la apariencia de un personaje durante todo el clip. Rostros, atuendos, proporciones y detalles distintivos se mantienen estables a través de movimientos de cámara como zooms, paneos e inclinaciones. El modelo admite tres o más personajes distintos en la misma escena sin mezclar sus rasgos, algo que importa en escenas de diálogo y en cualquier video con varias personas.
Duración flexible de 3 a 15 segundos
Genera entre 3 y 15 segundos de video continuo en una sola pasada. La duración extra va más allá de clips más largos: le da al modelo espacio para desarrollar acción más compleja, construir transiciones de escena y dejar que un arco narrativo se desarrolle en lugar de cortarse en el segundo cinco.
Preguntas frecuentes
Kling 3.0 está disponible en Morphic como parte de la suite de generación de video. Para empezar a generar, regístrate en un plan de Morphic, elige el modo Video desde la barra de prompt y selecciona Kling 3.0 en el menú desplegable de modelos. Morphic te da acceso a Kling 3.0 junto con herramientas de imagen, música y audio, así que todo tu flujo creativo se mantiene en un solo lugar.
Kling 3.0 es el modelo de generación de video base que cubre texto a video e imagen a video con storyboard multitoma y audio nativo. Kling 3.0 Omni se construye sobre eso con controles de consistencia de personajes más fuertes y la capacidad de vincular tonos de voz a personajes específicos usando referencias de video. Para la mayoría de las necesidades de generación de video, Kling 3.0 es el punto de partida correcto. Omni vale la pena elegirlo cuando la consistencia de personajes en varias generaciones es prioridad.
Sí. Kling 3.0 genera diálogo con sincronización labial en cinco idiomas: inglés, chino, japonés, coreano y español. Más allá del soporte básico de idioma, el modelo puede replicar acentos y dialectos específicos, incluyendo acentos estadounidense, británico e indio para el inglés, y dialectos cantonés, del noreste, de Pekín, sichuanés y taiwanés para el chino. Los personajes también pueden alternar entre idiomas a mitad de la conversación dentro del mismo clip.
La salida llega hasta resolución 4K nativa, con 1080p y 720p también disponibles. Cada generación dura entre 3 y 15 segundos. Las relaciones de aspecto incluyen 16:9 para formato panorámico, 9:16 para contenido vertical en redes sociales y 1:1 para formatos cuadrados.
El cambio más importante al pasar de prompting de imagen a prompting de video es describir el movimiento, no solo la apariencia. Algunas cosas que mejoran la calidad del resultado:
- Empieza con lenguaje de cámara. Iniciar tu prompt con "plano de seguimiento en cámara en mano" o "paneo orbital lento" fija el tono visual de toda la generación.
- Etiqueta a los hablantes de forma explícita en escenas con varios personajes. Empareja cada personaje directamente con su diálogo en el prompt para que el modelo asigne las voces a los rostros correctos.
- Usa el modo de multitoma personalizado cuando necesites control preciso sobre la duración, el encuadre y el ángulo de cámara de cada plano.
- Sube imágenes o video de referencia para la consistencia de personajes. Crear un elemento con rasgos visuales y de voz vinculados le da al modelo un ancla concreta para personajes recurrentes.
En Morphic, puedes iterar rápido ajustando tu prompt y regenerando sin salir del espacio de trabajo. Para un desglose más profundo con ejemplos de prompts, consulta la guía completa de Kling 3.0.
