Convertir imagen a video no se trata de diseñar una imagen nueva — se trata de darle a una imagen en la que ya confías tiempo y movimiento. Sube una foto de producto, un retrato o un fotograma conceptual, describe qué debe moverse y cómo debe comportarse la cámara, y la herramienta de imagen a video generará un clip en movimiento que mantiene tu sujeto intacto.
Eso la convierte en la herramienta adecuada cuando la apariencia no es negociable. En comparación con el text-to-video puro, la imagen inicial fija a la persona, el producto, el atuendo, la escena y la composición; el trabajo del prompt es indicar qué puede moverse, cómo se mueve la cámara y qué detalles no deben cambiar.
Paso 1: Elige una imagen inicial que aguante la animación
En el Generador de Video de IA, cambia a Imagen a Video y sube tu imagen como el fotograma inicial. Prioriza imágenes con un sujeto completo, iluminación limpia y una composición ya cercana a la relación de aspecto final. Una foto de producto debe mostrar la forma completa y las partes clave; un retrato debe evitar manos, cabello o ropa recortados; una escena debe dejar espacio para que la cámara se mueva.
Este tutorial usa una toma 16:9 de un estuche de auriculares negro mate. El prompt pide que la tapa se abra ligeramente, que una luz morada recorra la superficie y un acercamiento lento — manteniendo estable la geometría del producto, sin objetos nuevos y sin texto.
El estuche de auriculares permanece idéntico mientras la tapa se abre ligeramente y una suave luz morada recorre la superficie. Acercamiento cinematográfico lento de cámara, reflejos realistas, geometría del producto estable, sin objetos nuevos, sin texto.

Paso 2: Decide un fotograma final y luego configura los parámetros
Si la imagen solo necesita movimiento natural, omite el fotograma final. Sube una segunda imagen solo cuando el video deba ir de una imagen exacta a otra — y mantén ambos fotogramas con el mismo sujeto, punto de vista y escena, o el modelo puede dar saltos o deformarse entre medias.
Luego elige el modelo, la duración, la relación de aspecto y la resolución de destino. Las tomas de detalle de producto suelen verse mejor con movimiento más lento; un gancho para redes puede moverse más rápido siempre que el producto se mantenga legible. Confirma que la relación de aspecto coincida con la imagen de entrada para que el sistema no recorte tu sujeto para llenar el encuadre.

Paso 3: Genera y revisa primero la miniatura
Haz clic en generar. El clip terminado aparece en la parte superior de la lista de Videos con su duración, resolución, título y hora de creación. Antes de reproducir nada, hazle una pregunta a la miniatura: ¿sigue siendo el mismo producto o la misma persona?
Si el primer fotograma ya está mal — color, cantidad de piezas, identidad o encuadre — cambia a una imagen de entrada más limpia. Si el primer fotograma está bien pero la toma se degrada a mitad, reduce el movimiento, acorta la duración o refuerza las restricciones de apariencia en el prompt.

Paso 4: Reproduce el clip completo y audita la consistencia del sujeto
Reproduce el resultado de principio a fin en el Visor de Video. En productos, fíjate en la forma, materiales, botones, puertos y cantidad de piezas. En personas, fíjate en el rostro, las manos, el cabello, la ropa y cómo se integran con el fondo. En escenas, fíjate en la estructura, la perspectiva y la continuidad de la iluminación.
Detalles de Generación conserva el prompt original, el modelo y la resolución. Descarga el clip cuando lo apruebe, y úsalo en anuncios de producto, videos de afiliados, clips para redes, B-roll del canal o una edición más larga. Si falla, corrige el prompt o la imagen de entrada — no intentes ocultar un error evidente del sujeto en la edición.

Paso 5: Integra la toma que funciona en un flujo de trabajo de video completo
Un clip de imagen a video suele ser una toma dentro de una pieza más grande. Los vendedores de productos lo combinan con un avatar presentador o un explicador de UGC de IA; los creadores de YouTube lo usan como B-roll; los equipos de marca y formación lo utilizan para mostrar productos, procesos o escenas conceptuales.
Cuando generes varias tomas sobre un mismo tema, mantén fija la imagen de entrada, la versión del producto, la identidad del personaje y el estilo visual, y cambia exactamente una variable de movimiento en cada ejecución. Comparar aperturas, transiciones y revelados se vuelve mucho más fácil — y la deriva de apariencia entre generaciones se vuelve menos frecuente.
Problemas comunes y cómo solucionarlos
- El producto se convierte en otro producto a mitad del movimiento. Usa una imagen de producto más nítida y completa, reduce la cantidad de acciones y especifica los materiales, colores, estructura y piezas que no deben cambiar.
- Las caras o las manos tiemblan. Elige una entrada con un sujeto frontal claro y manos sin obstrucciones, evita giros grandes y gestos complejos, y empieza con clips más cortos.
- El resultado es solo un zoom lento. Describe una acción visible del sujeto o un cambio del entorno y un movimiento de cámara específico — no solo hacer que la imagen se mueva.
- La imagen de entrada se recorta. Igualar la relación de aspecto de la imagen fuente con la de destino y mantén el sujeto en el área segura; no confíes en el generador para convertir paisaje en vertical.
- La toma da saltos entre el fotograma inicial y el final. Mantén ambos fotogramas con el mismo sujeto, punto de vista y escena, cambiando solo el estado que quieres que ocurra.
El estándar en imagen a video no es más movimiento — es un sujeto que siga siendo creíble mientras gana movimiento que sirva al contenido. Bloquea primero la apariencia y luego dirige el movimiento. Si lo que realmente quieres es un retrato que hable, ese es otro flujo de trabajo: hacer que una foto hable. Y cuando no hay ninguna imagen utilizable, empieza desde palabras con text to video.
