Cómo hacer videos de producto con IA: una foto y una frase
Para hacer videos de producto con IA solo necesitas dos entradas: la foto del producto y una frase que describa el movimiento. Aquí está el flujo completo, desde el encuadre de la foto hasta el clip revisado.
Mauricio Valdivia
·11 min

Tu foto de producto ya trae la mitad del video
Para hacer un video de producto con IA necesitas dos cosas: la foto que ya está en tu ficha de producto y una frase que describa el movimiento. Nada más. A fecha de agosto de 2026, el esquema OpenAPI del endpoint de imagen a video de Seedance 2.5 publicado por fal declara exactamente dos entradas obligatorias, prompt e image_url, y deja todo lo demás con un valor por defecto. Esta guía recorre el flujo completo: cómo encuadrar la foto, qué escribir en esa frase, qué ajustes sí eliges y cómo revisar el clip antes de ponerle presupuesto encima.
El cuello de botella nunca fue la idea. Era que un plano de cinco segundos de un frasco girando sobre lino pedía una mesa, una luz, un trípode y media tarde. Hoy ese plano sale del mismo JPEG que ya subiste al catálogo, y lo que decide si sirve o no es algo bastante menos glamoroso que el modelo elegido: cómo está encuadrada esa foto.
Qué necesita de verdad un video de producto con IA
La distancia entre "quiero un video de mi producto" y un archivo listo para subir se mide en decisiones, no en herramientas. Y hay menos decisiones de las que parece.
Dos entradas obligatorias, y una ya la tienes
En el endpoint de imagen a video hay ocho campos y solo dos son obligatorios. El primero es image_url, descrito en el esquema como la imagen de fotograma inicial que se va a animar, con formatos JPEG, PNG y WebP y un tope de 30 MB. El segundo es prompt, descrito como el texto que describe el movimiento y la acción deseados para el video.
Esa asimetría es la lección del flujo entero. La foto aporta la apariencia: material, color, etiqueta, proporciones. El texto aporta lo único que una foto no puede aportar, que es el tiempo. Cuando alguien escribe un prompt lleno de adjetivos sobre el producto, está pagando por describir algo que el modelo ya está mirando.
Lo que el modelo decide solo cuando no se lo dices
Los otros seis campos son opcionales, y cuatro de ellos traen un valor por defecto que un primer clip va a usar sin que lo pidas:
| Campo | Por defecto | Cuándo lo mueves |
|---|---|---|
resolution | 720p | Explorar barato en 480p |
duration | auto | Fijar el corte que publicarás |
generate_audio | activado | Ya tienes locución propia |
aspect_ratio | auto, congelado | Nunca, recorta la foto |
end_image_url | vacío | Contar un cambio de estado |
end_user_id | vacío | Trazabilidad por usuario final |
Una primera prueba, entonces, es literalmente una imagen y una frase. Esa es la parte que casi ninguna guía dice, porque es más fácil vender una interfaz con veinte controles que admitir que dieciocho de ellos son opcionales.
Por qué leer el esquema y no el folleto
El esquema de un endpoint es la lista de lo que el sistema realmente acepta, y cambia sin previo aviso. Un artículo que declara "este modelo requiere X" como propiedad permanente empieza a mentir el día que el proveedor mueve un campo. Por eso todo lo que aquí se afirma sobre el endpoint está fechado en agosto de 2026 y se puede volver a comprobar en la misma URL que aparece al final de este artículo. Si vas a construir un proceso encima de una API viva, la costumbre de mirar el esquema antes de discutir con el soporte se paga sola.

La foto de producto decide el encuadre, y no hay vuelta atrás
Aquí está el detalle que separa un clip publicable de uno que hay que rehacer, y casi nunca aparece en los tutoriales.
El clip hereda la relación de aspecto de la imagen
En este endpoint el campo aspect_ratio está congelado: el esquema lo declara siempre en auto para imagen a video. No es un valor por defecto que puedas cambiar, es el único valor admitido. El clip toma su encuadre de la foto de origen.
La consecuencia práctica es directa. No eliges el formato al generar, lo elegiste al recortar la foto. Si subes una imagen cuadrada de catálogo vas a recibir un clip cuadrado, por mucho que tu plan de medios diga vertical. Si quieres vertical, recorta a vertical antes de subir.
Esto suena a limitación y en realidad es una simplificación honesta: el modelo no puede inventar los píxeles que quedaron fuera de la toma sin deformar el producto. Muchas plataformas esconden esa restricción detrás de un menú de formatos y luego completan los bordes con material inventado, que es exactamente el artefacto que un comprador nota sin saber nombrarlo.
Cómo preparar la toma antes de subirla
Cuatro comprobaciones, en orden de impacto:
- Recorta al formato de destino. Vertical para feeds verticales, horizontal si el destino es un banner de video. Ese recorte es tu decisión de encuadre.
- Deja aire alrededor del producto. El modelo necesita margen para mover la cámara. Un producto pegado al borde limita cualquier acercamiento o giro.
- Revisa la sombra. Una sombra dura y mal orientada se anima igual de dura y sigue estando mal orientada.
- Mira la etiqueta. El texto pequeño e ilegible en la foto se vuelve texto pequeño e ilegible en movimiento, y a menudo se degrada más.
Si tu foto de catálogo llega recortada contra un fondo blanco puro, vale la pena pasarla antes por un paso de imagen que la relocalice en una escena creíble. Ese es el mismo flujo de foto de producto a creatividad que ya usan quienes hacen anuncios sin cámara, y cuesta una fracción de lo que cuesta el video.
Los límites del archivo que sí importan
El endpoint acepta JPEG, PNG y WebP hasta 30 MB. En la práctica el peso no suele ser el problema: una foto de catálogo bien exportada vive muy por debajo de ese techo. Lo que sí falla es subir una captura de pantalla de la ficha del producto, con el logotipo de la tienda y el badge de descuento incrustados. El modelo animará también el badge.
El prompt describe movimiento, no producto
Con la foto resuelta, la frase es el único lugar donde queda información nueva que aportar. Vale la pena gastarla bien.
Nombra la cámara, no el adjetivo
El esquema es explícito sobre para qué sirve este campo: describe el movimiento y la acción deseados para el video. Así que la estructura útil de un prompt de producto tiene tres partes y ninguna es "elegante" ni "premium":
- Qué hace la cámara: un acercamiento lento, un giro orbital, un plano fijo.
- Qué pasa en escena: el producto gira, una mano entra en cuadro, el vapor sube.
- Qué se mantiene: la etiqueta legible, la luz de ventana, el fondo intacto.
Plantilla para copiar y pegar:
Acercamiento lento de cámara al [producto] sobre [superficie].
[Sujeto o elemento] [acción concreta] mientras la etiqueta permanece
legible y enfocada. Luz suave de ventana desde la izquierda, fondo
sin cambios, sin texto en pantalla.
Un ejemplo trabajado
Un frasco de sérum de 30 ml, foto de catálogo vertical sobre lino claro. El prompt:
Acercamiento lento de cámara al frasco de sérum ámbar sobre lino claro.
El frasco gira un cuarto de vuelta mientras la etiqueta permanece
legible y enfocada. Luz suave de ventana desde la izquierda, fondo
sin cambios, sin texto en pantalla.
Tres cosas hace este prompt que el prompt promedio no hace:
- Fija el eje de la cámara, así que el modelo no improvisa un travelling que saca el producto de cuadro.
- Acota la rotación a un cuarto de vuelta, así que la cara con la etiqueta no desaparece a mitad del plano.
- Prohíbe el texto en pantalla, que es la fuente principal de rótulos no solicitados en modelos que construyen audio y letreros a partir del propio prompt.
El resto del anuncio, el gancho hablado y el remate, no vive en este clip. Vive en el guion, y ahí aplican las reglas de siempre sobre cómo escribir un hook.
Tres errores que arruinan una toma de producto
- Pedir demasiado movimiento. Un giro completo más un acercamiento más una mano que entra, en cinco segundos, produce una toma nerviosa donde el producto nunca se ve entero.
- Describir el producto en vez de la acción. "Sérum facial premium de textura ligera" no le dice nada al modelo que la foto no le haya dicho ya.
- Dejar el fondo abierto. Si no dices que el fondo se mantiene, a veces no se mantiene, y una escena que cambia detrás del frasco delata el origen sintético del plano al instante.

El fotograma final: un guion pequeño en una sola generación
De todos los campos opcionales, este es el que más cambia lo que puedes contar con un solo producto.
De la mesa a la mano sin editar dos clips
El campo end_image_url es opcional y acepta una segunda imagen. Cuando se proporciona, según el propio esquema, el video generado hará una transición desde la imagen inicial hasta esta imagen final. Dos fotogramas, una generación, una transición coherente entre ambos.
Para un producto eso resuelve el caso más común de todos, el cambio de estado:
- De la mesa a la mano de alguien.
- De cerrado a abierto, con el producto ya en uso.
- Del estante al carrito.
Sin ese campo, cada uno de esos pequeños arcos pide dos clips y un corte. Con él, es una sola pieza continua.
La condición es que las dos imágenes sean reconciliables entre sí. Misma luz, mismo producto, misma escena general. Dos fotos tomadas con seis meses de diferencia y una iluminación distinta producen una transición que se siente como un error de edición.
Cuándo no usarlo
Si el objetivo del clip es una sola idea visual, un giro limpio, un macro de la textura, el fotograma final estorba: obliga al modelo a reservar tiempo para llegar a un destino en vez de dedicar el clip entero al plano que querías. Guárdalo para cuando el clip tenga que contar un cambio de estado, no un atributo.
Audio, duración y resolución: los tres ajustes que sí eliges
Congelado el encuadre, quedan tres perillas reales. Cada una tiene una respuesta por defecto razonable y una razón concreta para moverla.
El audio viene encendido y no cambia el costo
La generación de audio está activada por defecto e incluye efectos de sonido, ambiente y voz sincronizada con los labios. El esquema añade un dato que casi nadie menciona: el costo de la generación de video es el mismo se genere audio o no.
Eso invierte el razonamiento habitual. No apagas el audio para ahorrar, porque no ahorra. Lo apagas por tres razones editoriales:
- Ya tienes una locución grabada que vas a montar encima.
- Tienes una pista de música y no quieres competencia de fondo.
- La marca exige silencio bajo el rótulo.
En cualquier otro caso, dejarlo encendido te da una capa de textura ambiental sin costo adicional que hace que un plano de producto se sienta filmado en un lugar real.
La duración por defecto la decide el modelo
El campo duration viene en auto, es decir, el modelo elige la longitud a partir del prompt, dentro de un rango de 4 a 30 segundos. Para explorar está bien. Para producir conviene fijarla, por dos motivos: el costo escala con los segundos, y un clip de producto que se alarga solo suele estar rellenando con movimiento que no aporta.
La disciplina útil es al revés de la intuición. Primero decides el corte que vas a usar en el anuncio, luego pides exactamente esa duración. Pedir treinta segundos "por si acaso" y recortar después es la forma más cara de llegar al mismo sitio.
480p para probar, 720p para publicar
El valor por defecto es 720p, descrito como el punto de equilibrio, con 480p como la opción rápida. El flujo que ahorra dinero de verdad es explorar ángulos en la resolución baja y regenerar solo el ganador en la alta.
Un matiz honesto: lo que declara un esquema y lo que una plataforma concreta te ofrece no siempre coinciden. En Novoads, por ejemplo, Seedance 2.5 se ofrece en 480p y 720p. Si tu plan de entrega depende de una resolución superior, confírmalo en el menú que tienes delante y no en la documentación del proveedor, antes de prometerle a un cliente una entrega en alta.
Cómo saber que el clip salió bien
Un video de producto tiene un criterio de aceptación más estricto que un video genérico, porque el comprador conoce el objeto. Si algo no cuadra, no piensa "esto es IA", piensa "esto no es mi producto".
La lista de cuatro comprobaciones
Míralo dos veces, sin sonido la primera vez:
- ¿La etiqueta se lee y dice lo que dice? Los modelos de video reconstruyen texto y a veces lo reescriben. Es el fallo más caro porque es el que un comprador puede contrastar contra el paquete real.
- ¿La forma se mantiene durante todo el movimiento? Congela el último fotograma y compáralo con la foto original. Los bordes son donde primero aparece la deformación.
- ¿El material se comporta como el material? El vidrio refleja, el plástico mate no. Un frasco de vidrio que deja de reflejar a mitad del giro rompe la ilusión aunque la forma sea perfecta.
- ¿El clip funciona con el sonido apagado? La mayoría de las reproducciones en un feed empiezan en silencio.
Qué hacer cuando el producto se deforma
Antes de cambiar de modelo, cambia de petición. La deformación casi siempre viene de pedir un movimiento que obliga al modelo a inventar caras del producto que la foto nunca mostró. Por orden de coste:
- Reduce el ángulo del giro. Un cuarto de vuelta en vez de media.
- Acorta la duración. Menos segundos, menos ocasiones de inventar.
- Parte de una foto en tres cuartos. Da más información volumétrica de entrada que una frontal plana.
- Ancla el destino con el fotograma final. Un final definido deja menos margen a la deriva que un final abierto.
Y si el producto es directamente difícil, algo transparente, algo con texto denso, algo muy pequeño, vale la pena presupuestar más intentos en la resolución baja. Ese cálculo de intentos por ganador es el mismo que gobierna cualquier presupuesto de producción de video, solo que con un orden de magnitud distinto.

Cómo Novoads convierte una foto de producto en un anuncio
Novoads ejecuta este flujo completo desde el panel, sin que tengas que tocar una API. Subes la foto del producto, la conviertes en una imagen de anuncio limpia, la animas y le pones voz y subtítulos.
Del archivo al clip, en el mismo panel
El primer paso es Producto a Anuncio: subes un archivo de imagen, JPEG, PNG o WebP de hasta 20 MB, y obtienes una imagen de anuncio con el producto relocalizado en una escena. No hay campo de URL de producto, la entrada es el archivo. Ese paso cuesta 0,3 créditos por imagen.
Desde ahí, el selector de modelos incluye Seedance 2.5 junto al resto de la familia, de modo que el mismo fotograma inicial puede probarse en más de un motor sin rehacer el material. Y como el flujo termina en un archivo de video descargable, el resultado entra directo en el gestor de anuncios que uses, igual que cualquier pieza del proceso de crear anuncios con IA. Si prefieres seguir la versión en inglés de este mismo recorrido, está en how to make product videos with AI.
Qué cuesta y cómo se cuenta
El costo se cuenta en créditos y sube con la duración del clip: es una escala por segundo, no una tarifa plana. La escala de 480p cuesta la mitad que la de 720p en cada tramo, lo que refuerza el mismo consejo de antes, explorar barato y publicar caro. Los números exactos por modelo y duración viven en la tabla de precios, y ahí es donde conviene leerlos: un precio copiado dentro de un artículo envejece más rápido que el artículo.
Si estás empezando por el formato en vez de por el producto, la guía hermana sobre cómo crear anuncios UGC cubre el lado del guion y del actor, y la de texto a video cubre el caso en que no tienes ninguna foto todavía. Puedes probar el flujo completo en Novoads con tu propia foto de catálogo antes de decidir nada.
El encuadre se decide antes de escribir el prompt
La parte contraintuitiva de hacer videos de producto con IA es que la decisión creativa importante ocurre en un editor de imágenes, no en un campo de texto. El modelo hereda el encuadre, la luz y las sombras que le entregues, y solo controla lo que pasa después. Quien entiende eso deja de buscar el modelo perfecto y empieza a arreglar la foto, que es más rápido, más barato y funciona en todos los modelos a la vez.
Prueba el flujo con la foto que ya tienes. $1 por 3 días de acceso. Cancela cuando quieras.
Preguntas Frecuentes
¿Qué necesito para hacer un video de producto con IA?
Dos cosas: una foto del producto y una frase que describa el movimiento que quieres ver. A fecha de agosto de 2026, el esquema OpenAPI del endpoint de imagen a video de Seedance 2.5 publicado por fal declara exactamente esas dos entradas como obligatorias, prompt e image_url. Resolución, duración y audio ya vienen con un valor por defecto, así que una primera prueba no exige configurar nada más.
¿Puedo elegir formato vertical para un video de producto hecho con IA?
En un flujo de imagen a video el formato no se elige al generar: el clip hereda la relación de aspecto de la foto de origen. Si quieres un clip vertical, sube una foto vertical. Por eso el recorte de la imagen deja de ser un detalle estético y se convierte en la primera decisión de producción.
¿Qué debo escribir en el prompt de un video de producto?
Movimiento y acción, no descripción del producto. La foto ya se encarga de cómo se ve el frasco, la lata o la zapatilla. La frase se encarga de qué hace la cámara y qué ocurre en escena: un giro lento, un acercamiento a la etiqueta, una mano que entra y levanta el producto. Un prompt que repite los adjetivos de la ficha desperdicia la única entrada que aporta información nueva.
¿Cuánto dura un video de producto generado con IA?
El esquema del endpoint acepta de 4 a 30 segundos, o el valor auto para que el modelo decida a partir del prompt, que es además el valor por defecto. Para publicidad en redes, el rango útil sigue siendo corto: suficiente para mostrar el producto en movimiento y un beneficio claro, no más.
¿El video de producto viene con audio?
En ese endpoint la generación de audio viene activada por defecto e incluye efectos de sonido, ambiente y voz sincronizada con los labios. El propio esquema aclara que el costo de la generación es el mismo se genere audio o no, así que apagarlo no ahorra nada. La razón para desactivarlo es editorial, no económica.
¿Sirve la foto que ya tengo en el catálogo?
Casi siempre sí, y ese es el punto. El endpoint acepta JPEG, PNG y WebP hasta 30 MB. Lo que conviene revisar antes de subirla no es la resolución sino el encuadre, el fondo y las sombras: el modelo va a animar exactamente lo que le des, incluidos los defectos de la toma original.
Lo esencial
- Un video de producto con IA parte de dos entradas obligatorias: la foto del producto y una frase que describa el movimiento. Todo lo demás son ajustes con valor por defecto.
- El encuadre no se elige al generar, se hereda de la foto. Recortar la imagen antes de subirla es la decisión de producción que más pesa en el resultado.
- El prompt describe movimiento y acción, no adjetivos del producto. La foto ya dice cómo se ve; la frase dice qué pasa.
- El fotograma final opcional convierte una sola generación en un pequeño guion: el producto empieza sobre la mesa y termina en la mano, sin editar dos clips.
- Prueba en la resolución más baja y publica el ganador en la alta. El costo sube con la duración, así que la duración es la palanca de presupuesto, no la calidad.




