Qwen Image 3 para anuncios: qué promete Alibaba y qué todavía nadie ha verificado
Alibaba presentó Qwen-Image-3.0 sin tabla de benchmarks, sin pesos abiertos y sin informe técnico. Las cifras del titular, prompts de 4.500 tokens y texto legible tan pequeño como diez píxeles, son del fabricante. Qué sí se puede comprobar hoy en fal, qué encontró la única prueba independiente y cómo decidir si lo pruebas o esperas.
Mauricio Valdivia
·12 min

Un lanzamiento sin benchmarks, sin pesos y sin informe técnico
El titular es bueno: un modelo de imagen que escribe texto legible tan pequeño como diez píxeles, y que arma una infografía entera de nueve paneles en una sola pasada. Así que abres el anuncio a buscar la tabla de resultados, el recuento de parámetros, la licencia. No está. Ninguna de las tres. Lo que hay son las imágenes de ejemplo que la propia empresa eligió publicar.
El 21 de julio de 2026, el equipo Qwen de Alibaba presentó Qwen-Image-3.0, la tercera generación de su modelo de imagen. Según el anuncio de Qwen, acepta instrucciones de hasta 4.500 tokens, renderiza texto legible tan pequeño como diez píxeles y dibuja de forma nativa 12 idiomas. Si trabajas en publicidad, esas tres frases apuntan justo al punto que más duele: el precio, la promo y el nombre de marca de un anuncio estático son texto, y el texto es lo que casi todos los modelos deletrean mal.
Esta es una nota de actualidad, no una reseña. El ángulo es angosto a propósito, y no es "qué tan bueno es": es qué de todo esto se puede comprobar hoy. Qué dijo Alibaba y con qué respaldo, qué encontró la única persona que lo probó en serio y lo publicó, qué se puede verificar carácter por carácter en la ficha de fal, y con eso en la mano, si te conviene probarlo esta semana o esperar.
Qué anunció Alibaba, y quién lo dice
Antes de opinar conviene separar dos cosas que la cobertura mezcla: lo que el modelo promete y quién está poniendo la firma detrás de esa promesa. En este lanzamiento la respuesta a la segunda pregunta es una sola, y eso cambia cómo hay que leer la primera.
Las tres cifras del anuncio
El equipo Qwen organizó el lanzamiento alrededor de tres capacidades, y cada una llega con su número:
- Prompts largos. El modelo acepta instrucciones de hasta 4.500 tokens, lo que según la empresa le permite componer imágenes densas en información de una sola vez. Su ejemplo central es una grilla de tres por tres de infografías distintas, producida, dice Alibaba, a partir de una única instrucción de 3.700 tokens en lugar de ensamblarse desde imágenes separadas.
- Detalle fino. Alibaba afirma que el modelo renderiza texto tan pequeño como diez píxeles de forma legible, y que reproduce texturas como piel, pelo y papel cerca de la calidad fotográfica.
- Conocimiento del mundo. Renderizado nativo de 12 idiomas, más el repertorio tipográfico que eso implica.
Las tres son afirmaciones del fabricante. Ninguna viene con una medición al lado.
"Tan pequeños como diez píxeles", no "hasta diez píxeles"
Vale detenerse un segundo en la cifra estrella, porque al cruzar el idioma se da vuelta. El original dice que el modelo renderiza texto as small as ten pixels, es decir, que baja hasta ese tamaño y todavía se lee. Es un piso: diez píxeles es lo más chico que promete sostener.
En español, "texto de hasta diez píxeles" se lee como un techo, como si diez píxeles fuera lo más grande que puede escribir, que sería una limitación absurda en lugar de una proeza. La forma correcta de decirlo es "texto tan pequeño como diez píxeles" o "de apenas diez píxeles de alto". Suena a detalle de traductor y no lo es: es la diferencia entre entender la afirmación y entenderla al revés, y buena parte de la cobertura en español la va a repetir mal.
Lo que el anuncio no trae
Aquí está la parte que casi ningún agregador está cubriendo, y es la más importante para decidir. El anuncio de Qwen-Image-3.0 se publicó, en palabras de la cobertura independiente, sin "benchmark table, no parameter count, no license, and no downloadable weights", y sin informe técnico que describa cómo se entrenó o se probó el modelo. A los usuarios se los remite a Qwen Chat para probarlo.
Eso es una ruptura con la propia línea. Qwen-Image 1.0 llegó en agosto de 2025 con pesos abiertos bajo licencia permisiva Apache 2.0 y un informe técnico el mismo día, y Qwen-Image-2.0 también publicó el suyo. La versión anterior incluso declaraba su límite, unos 1.000 tokens de prompt, lo que vuelve al salto a 4.500 la cifra más concreta del lanzamiento nuevo y, en palabras de esa misma cobertura, "one no outside party has verified".
Y hay un matiz que importa especialmente aquí: el renderizado de texto "is precisely the axis where generators tend to look strong in hand-picked demos and weaker under systematic testing". Es exactamente la capacidad que nos interesa, y exactamente la que peor sobrevive al pasar de la demo al lote de producción. Es el mismo criterio con el que conviene leer cualquier modelo de semana de lanzamiento, incluidos los que sí publicaron sus pesos, como Ideogram 4 y su apuesta por el texto en la imagen.

La única prueba independiente contradice en parte el titular
Con el modelo abierto al público en Qwen Studio, alguien tenía que sentarse a usarlo. GIGAZINE publicó el 22 de julio la única prueba práctica independiente que existe hasta ahora, y su resultado es mixto de una forma muy informativa.
Lo que sí aguantó
La prueba pidió una pantalla de juego estilo anime, con HUD de action RPG, es decir, el caso difícil de texto pequeño incrustado en una interfaz. El resultado, en palabras del tester, "looks just like a game screenshot" y "overall the image turned out exactly as instructed". El texto chiquito tipo captura de pantalla se sostuvo. También probó textura y describió la piel de un primer plano como "incredibly realistic".
Nada de eso es menor. En un anuncio estático, un modelo que compone una interfaz creíble con texto legible a tamaño pequeño resuelve un caso real: la captura de producto, el mockup de app, la ficha con especificaciones.
Lo que se rompió
Y ahora la otra mitad, que son dos hallazgos concretos:
- Una etiqueta corta en inglés salió mal escrita. En esa misma pantalla, el tester anotó que "the 'do' in 'Maid Punch' is slightly distorted and 'Quest' looks like 'Keesuto'".
- El japonés salió peor. Al pedirle la captura de un blog en japonés, el resultado se veía bien de lejos, pero al enfocar el texto aparecían "many awkward parts". La conclusión del tester fue directa: "there are still challenges to be overcome in describing Japanese text". El japonés es uno de los 12 idiomas que el anuncio declara soportar de forma nativa.
Y nota lo que no pasó: nadie midió la afirmación de los diez píxeles. La cifra estrella sigue sin una sola verificación externa, y el único dato independiente que existe sobre el texto apunta en la dirección contraria al titular.
La pregunta que esto deja abierta para el español
Aquí es donde el hallazgo se vuelve nuestro problema. Si el modelo tropieza con el japonés teniéndolo declarado como idioma nativo, la pregunta práctica para quien produce anuncios en español no es si escribe bien, sino cómo se comporta con la tilde, la ñ y los signos de apertura ¿ y ¡ en un copy publicitario real.
Y hay que decirlo con todas las letras: ninguna fuente lo establece todavía. No hay prueba publicada de Qwen-Image-3.0 con texto en español, ni del fabricante ni de terceros. No lo voy a adivinar por analogía con el japonés, que es un sistema de escritura completamente distinto.
Lo que sí se puede afirmar es la forma del riesgo, porque es la misma que rompe a los modelos de imagen entrenados sobre todo en inglés:
- La tilde. Se pierde del todo o aterriza en la vocal equivocada, y en un titular grande el error es enorme.
- La ñ. Sale como una n pelada, y "año" pasa a ser otra palabra con otro significado, en el titular de tu promo.
- Los signos ¿ y ¡. El modelo los omite porque no existen en inglés, y te deja "Aprovecha!" en lugar de "¡Aprovecha!".
Un lector nativo detecta cualquiera de las tres en medio segundo, aunque no sepa señalar qué le chirrió.
Ese es el hueco de evidencia concreto que te toca a ti cerrar, y más abajo está el protocolo para hacerlo en un rato.
Dos endpoints en fal, no uno
Salgamos de las promesas. Esto es lo que se puede comprobar hoy en la ficha del proveedor, y es también donde la mayoría de las notas se equivoca, porque la propia copy de fal confunde los dos endpoints.
Generación: el endpoint que no acepta imágenes de referencia
alibaba/qwen-image-3/text-to-image es el de generación desde texto. Su ficha en fal indica que cada solicitud cuesta $0.075 por imagen, con la imagen como unidad de facturación, y fal lo etiqueta como partner API.
Lo que importa para un flujo publicitario es lo que no tiene. Su esquema de entrada expone exactamente esto:
prompt,negative_prompty la expansión automática de promptimage_size,num_images,output_formatyseed- el verificador de seguridad
Y nada más. No incluye ningún campo de imágenes de referencia. Si tu plan era pasarle la foto de tu producto por este endpoint, no hay por dónde. La consistencia de producto y la de actor, que es la que sostiene una campaña entera, no vive aquí.
Edición: de una a tres imágenes de referencia
La edición es un endpoint separado, alibaba/qwen-image-3/edit, y cuesta lo mismo, $0.075 por imagen. Su esquema sí incluye el campo de referencias, descrito como "Reference images for editing (1-3 images required). Order matters: reference as 'image 1', 'image 2', 'image 3' in prompt."
Dos detalles prácticos ahí dentro:
- De 1 a 3 imágenes, obligatorias. No es un extra opcional. El endpoint no corre sin al menos una, así que este es el único camino por el que el modelo llega a mirar tu producto real.
- El orden importa. Las referencias se nombran por posición dentro del prompt. Si mandas la foto del envase, la del producto en uso y la de la modelo, tienes que saber cuál es cuál al escribir la instrucción, o le pedirás el cambio a la imagen equivocada.
| Endpoint | Qué hace | Imágenes de referencia | Precio en fal |
|---|---|---|---|
.../qwen-image-3/text-to-image | Generación desde texto | Ninguna en el esquema | $0.075 por imagen |
.../qwen-image-3/edit | Edición con referencia | De 1 a 3, obligatorias | $0.075 por imagen |
La copy de fal tiene las descripciones cruzadas
Y aquí está la trampa que explica por qué media internet lo va a contar mal. En la ficha del endpoint de generación, la descripción que fal muestra dice "Edits images from one to three reference images and a natural-language instruction, preserving key details such as facial features and identity". Es la descripción del editor, puesta sobre el generador.
En la ficha del endpoint de edición, la descripción dice "Generates images from a text prompt at resolutions up to 2048×2048, with automatic prompt rewriting and prompt-guided resolution selection". Es la descripción del generador, puesta sobre el editor.
Están cambiadas, las dos. Si lees la ficha y no el esquema, terminas mandando imágenes de referencia al endpoint que no las acepta y recibiendo un rechazo que parece un bug tuyo. Cuando evalúes cualquier modelo nuevo, el esquema manda sobre la descripción: la descripción es marketing con posibilidad de erratas, el esquema es el contrato.

El límite que no aparece en el titular: 800 caracteres
Hay un dato en el esquema de fal que reordena por completo la lectura del anuncio, y no aparece en ninguna de las notas que celebran los 4.500 tokens.
Dónde se corta el prompt
En ambos endpoints de fal, el campo de prompt está descrito como "Max 800 characters". No 800 tokens: 800 caracteres, en el generador y en el editor por igual.
La cifra del anuncio, 4.500 tokens, describe al modelo tal como Alibaba lo presenta en su propio chat. Tokens y caracteres no son la misma unidad y no conviene convertir una en otra a ojo, pero un token cubre normalmente más de un carácter, así que la ventana del anuncio y la que te deja el endpoint comercial no están en el mismo orden de magnitud. Son dos cosas distintas bajo el mismo nombre.
Qué significa para un brief real
Piensa en el brief que de verdad escribirías para una creatividad:
- la marca, el producto y el encuadre
- la paleta, la luz y el estado de ánimo
- el layout, dónde va el titular y dónde el precio
- el copy exacto, con sus tildes y sus signos de apertura
Eso son varios párrafos. En 800 caracteres entra un párrafo corto.
La lectura práctica, y es mía, no del comunicado: la promesa de "instrucciones larguísimas" es hoy una propiedad del modelo en Qwen Chat, no del producto que puedes contratar por API. Si tu evaluación depende de mandar briefs largos, pruébalo en el chat y no supongas que eso se traslada al endpoint. Y si lo que quieres es un flujo automatizado que produzca lotes, diseña el prompt para 800 caracteres desde el primer día. Es el mismo tipo de detalle que separa una demo linda de un pipeline que aguanta, y que conviene revisar antes de mover un proceso completo a un modelo nuevo, tal como pasa al elegir entre las plataformas de video ads con IA.
Cómo probarlo sin creerle al comunicado
Nada de lo anterior dice "no lo uses". Dice "mídelo tú". A $0.075 por imagen, medir es barato, y en una hora sales de la duda con datos propios en vez de con capturas ajenas.
El lote de prueba en español
Toma tu copy real, no un texto de ejemplo en inglés. Digamos que vendes café de especialidad y quieres el cartel de una rebaja. Arma doce prompts con el copy exacto que publicarías, forzando a propósito los tres puntos frágiles: "¡Últimas unidades!" con signo de apertura y tilde, "Café de especialidad" con tilde, "Envío el mismo año" con ñ y tilde juntas.
Doce imágenes por el endpoint de generación son 12 × $0.075 = $0.90. Ese es el costo entero de saber si el modelo te sirve para español, contra el costo de descubrirlo con una campaña ya publicada. Si además quieres evaluar la fidelidad de tu producto, repite el ejercicio por el endpoint de edición pasándole de una a tres fotos reales del envase, que es la única vía por la que este modelo mira tu producto.
Cómo saber que salió bien
Un lote con texto es fácil de aprobar de más, porque cada pieza suelta se ve bien. Tres chequeos rápidos atrapan un set que se iba a publicar roto:
- Carácter por carácter. Lee cada titular letra por letra, no de un vistazo. Si falta una tilde, la ñ salió como n o se comió el "¿", esa pieza se regenera. No la publiques porque "casi está".
- La prueba del thumbnail. Achica las doce a tamaño feed y pásalas de corrido. Si un titular se vuelve papilla al reducirlo, el mensaje no llega aunque esté bien escrito, y es justo el tamaño al que lo verá tu audiencia.
- La prueba del nativo. Que alguien que hable español las mire tres segundos sin contexto. Detecta un acento raro más rápido que cualquier corrector.
Anota el resultado como un porcentaje, cuántas de doce salieron publicables sin retoque. Ese número es tu benchmark, y vale más que la cifra del comunicado porque está medido sobre tu copy, tu idioma y tu caso. Si armas ese hábito, cualquier modelo nuevo pasa de "hay que ver" a una decisión de una hora. El resto del flujo, de la imagen aprobada al anuncio terminado, lo cubrimos en la guía de crear anuncios con IA.
Pruébalo si, espera si
Con todo lo anterior sobre la mesa, el veredicto se puede repartir en dos columnas en lugar de una recomendación única.
Pruébalo esta semana si:
- Haces estáticos con texto incrustado y hoy pagas un retoque manual por pieza.
- Tu brief cabe en 800 caracteres o puedes reescribirlo para que quepa.
- Quieres medir el español tú mismo, y menos de un dólar por un lote de doce te parece un precio justo por salir de la duda.
- Necesitas edición con referencia y puedes trabajar con una a tres imágenes por pasada.
Espera si:
- Vas a mover un pipeline de producción entero a este modelo. Sin pesos, sin licencia publicada y sin informe técnico, estás construyendo sobre una superficie que puede cambiar sin aviso.
- Tu caso depende de instrucciones largas, porque el endpoint que puedes contratar hoy no las acepta.
- Necesitas garantías de idioma por contrato con un cliente. La única señal externa que existe sobre texto no latino es un resultado mixto, no un aval.

Dónde encaja junto a los modelos de imagen que ya usas
Para que quede claro, porque importa: Qwen Image 3 no está dentro de Novoads. Es un modelo externo, no hay un desplegable de Qwen que ir a buscar en la app, y no lo servimos.
Dentro de Novoads, el paso de imagen corre sus propios modelos: GPT Image 2, que impulsa el flujo Producto a Anuncio, donde subes la foto de tu producto y recibes de vuelta una imagen de anuncio, a 0.3 créditos por imagen, más Nano Banana Pro a 0.5 créditos, Seedream 5 Lite a 0.4 y Seedream 5 Pro a 0.6. Ese cuadro no es el final del camino: es el fotograma inicial de un anuncio en video estilo UGC, donde escribes o autogeneras un guion, eliges un actor de IA y la imagen se vuelve la apertura de un clip que habla y se mueve en 9:16. Ese traspaso de la imagen fija al movimiento es su propio paso, y es el que cubre un flujo de texto o imagen a video con IA.
La lección de este lanzamiento viaja a cualquiera de esos modelos, y a cualquiera que venga después. Un modelo nuevo llega con una cifra de titular; tu trabajo no es creerla ni descartarla, es reemplazarla por una medición tuya sobre tu copy en tu idioma. Si quieres ver ese loop completo, de la foto de producto al anuncio con actor, eso es lo que hace Novoads. Y si estás ordenando el panorama más amplio de IA para publicidad, tenemos una guía dedicada; para el caso específico de fijar un mismo look de marca en un lote entero, está el repaso de Krea 2 y su style reference.
Un modelo sin evidencia es una promesa, no una herramienta
El veredicto honesto sobre Qwen Image 3 no es "es bueno" ni "es humo". Es más útil que eso: lo que se puede comprobar vale la prueba, y lo que no se puede comprobar todavía no se puede planificar. Que existan dos endpoints vivos a $0.075 por imagen, con un límite de 800 caracteres y de una a tres imágenes de referencia en el editor, es un hecho verificable hoy y suficiente para un lote de prueba de menos de un dólar. Que escriba texto legible de apenas diez píxeles en tu idioma es, por ahora, una frase de un comunicado.
Esa distinción es todo el oficio. Un modelo de imagen sin benchmarks, sin pesos y sin informe técnico no es necesariamente peor que otro; es simplemente uno sobre el que todavía no puedes tomar decisiones, y la diferencia entre las dos cosas es un lote de doce imágenes con tu propio copy. Si quieres correr ese loop completo, de la imagen aprobada al anuncio en video con actor, puedes producir tu primer anuncio UGC con IA con Novoads por $1 en novoads.ai. Son $1 por 3 días de acceso, cancela cuando quieras.
Preguntas Frecuentes
¿Qué es Qwen Image 3 y qué promete hacer?
Qwen-Image-3.0 es la tercera generación del modelo de imagen del equipo Qwen de Alibaba, presentada el 21 de julio de 2026. Según el propio anuncio, acepta instrucciones de hasta 4.500 tokens, renderiza texto legible tan pequeño como diez píxeles y dibuja de forma nativa 12 idiomas, todo en una sola pasada en lugar de componer varias imágenes. La palabra clave es "según": esas tres cifras salen del comunicado de la empresa y ningún tercero las ha medido.
¿Las cifras de 4.500 tokens y diez píxeles están verificadas?
No. El lanzamiento se publicó sin tabla de benchmarks, sin recuento de parámetros, sin licencia, sin pesos descargables y sin informe técnico que explique cómo se entrenó o se probó el modelo. La cobertura independiente señala que el salto a 4.500 tokens es la cifra más concreta del lanzamiento y una que ninguna parte externa ha verificado, y advierte que el renderizado de texto es justo el eje donde los generadores se ven fuertes en demos elegidas a mano y más débiles bajo pruebas sistemáticas. Trátalas como afirmaciones del fabricante hasta que haya pesos o evaluaciones independientes.
¿Qwen Image 3 escribe bien el español, con tildes, ñ y signos de apertura?
No hay ninguna fuente que lo establezca todavía, y conviene decirlo en lugar de adivinar. Lo que sí existe es una señal: la única prueba independiente publicada encontró japonés distorsionado y una etiqueta de interfaz mal renderizada, con "Quest" saliendo como "Keesuto", pese a que el anuncio declara soporte nativo para 12 idiomas. Cuando un modelo tropieza fuera del inglés, la pregunta práctica para nosotros es cómo se comporta con la tilde, la ñ y los signos ¿ y ¡ en un copy publicitario. La forma de saberlo es probarlo con tu copy exacto y revisarlo carácter por carácter.
¿Cuánto cuesta Qwen Image 3 en fal y cuáles son sus endpoints?
Son dos endpoints distintos y ambos cuestan $0.075 por imagen. alibaba/qwen-image-3/text-to-image es el de generación desde texto y su esquema no incluye ningún campo de imágenes de referencia. alibaba/qwen-image-3/edit es el de edición y su esquema exige de 1 a 3 imágenes de referencia, donde el orden importa porque las referencias se nombran como "image 1", "image 2" e "image 3" dentro del prompt. Son precios de lista en la capa del modelo y pueden moverse.
¿Puedo mandarle a fal un prompt de 4.500 tokens?
No. El esquema de ambos endpoints de fal limita el prompt a 800 caracteres. La cifra de 4.500 tokens describe al modelo tal como Alibaba lo presenta, no lo que cabe por el endpoint comercial que hoy puedes contratar. Si tu plan era mandar un brief creativo largo con la marca, el tono, el layout y el copy exacto, ese brief tiene que caber en 800 caracteres o el endpoint lo rechaza.
¿Qwen Image 3 está disponible dentro de Novoads?
No. Qwen Image 3 es un modelo externo y Novoads no lo sirve. El paso de imagen de Novoads corre sus propios modelos: GPT Image 2, que impulsa el flujo Producto a Anuncio a 0.3 créditos por imagen, más Nano Banana Pro, Seedream 5 Lite y Seedream 5 Pro. La disciplina que enseña este lanzamiento viaja igual a cualquiera de ellos: mide el texto de tu creatividad con tu propio copy antes de creerle a una cifra de comunicado.
Lo esencial
- Alibaba presentó Qwen-Image-3.0 el 21 de julio de 2026. Según el anuncio de Qwen, acepta prompts de hasta 4.500 tokens y renderiza texto legible tan pequeño como diez píxeles, con soporte nativo para 12 idiomas.
- Esas cifras son del fabricante y nadie las ha verificado por fuera. El lanzamiento llegó sin tabla de benchmarks, sin recuento de parámetros, sin licencia, sin pesos descargables y sin informe técnico, rompiendo con Qwen-Image 1.0, que salió con pesos Apache 2.0 y un informe técnico el mismo día.
- La única prueba independiente con las manos en el modelo no midió la afirmación de los diez píxeles. Encontró que el texto pequeño tipo captura aguantó, pero que el japonés salió distorsionado y una etiqueta de interfaz se renderizó como "Keesuto" en lugar de "Quest", pese al soporte declarado de 12 idiomas.
- En fal son dos endpoints, no uno: alibaba/qwen-image-3/text-to-image genera y no acepta imágenes de referencia; alibaba/qwen-image-3/edit edita y exige de 1 a 3. Ambos cobran $0.075 por imagen y ambos limitan el prompt a 800 caracteres.
- Qwen Image 3 es externo y no está dentro de Novoads. El paso de imagen de Novoads corre GPT Image 2 (0.3 créditos por imagen, el motor de Producto a Anuncio), Nano Banana Pro, Seedream 5 Lite y Seedream 5 Pro.
Fuentes
- •the-decoder: Alibaba's Qwen-Image-3.0 renders full infographic grids and readable ten-pixel text in a single pass
- •Unite.AI: Alibaba Launches Qwen-Image-3.0 Without Benchmarks or Weights
- •GIGAZINE: prueba práctica de Qwen-Image-3.0 en ilustración y texto japonés
- •Qwen Image 3 (Text to Image) API en fal
- •Qwen Image 3 Image Editing (Image to Image) API en fal




