Interes General

Qwen presenta su nuevo modelo de generación de imágenes IA

La tercera versión de Qwen-Image puede crear una infografía compuesta por nueve escenas distintas en una sola imagen, con texto legible incluso a 10 píxeles y soporte para 12 idiomas.

Por Administrador 3 min de lectura596 visualizaciones
Qwen presenta su nuevo modelo de generación de imágenes IA

La compañía china Alibaba, a través de su línea Qwen, lanzó Qwen-Image-3.0, la tercera generación de su modelo de generación de imágenes mediante inteligencia artificial. A diferencia de sus predecesores, centrados en precisión y variedad, este modelo apunta a un objetivo concreto: producir contenido visual "real" y utilizable como herramienta de trabajo, no solo estético.

El desarrollo se apoya en tres capacidades técnicas que sus creadores destacan como el eje de esta versión: mayor volumen de contenido por imagen, precisión en el detalle y un conocimiento amplio del mundo que le permite reproducir con exactitud interfaces, idiomas y estilos.

Imágenes con estructura compleja en una sola pasada

Uno de los ejemplos difundidos por la empresa muestra una grilla de 3x3 generada en un único proceso, sin combinar imágenes por separado. Cada uno de los nueve cuadros contiene una escena temática distinta —desde una lección de geometría hasta un esquema médico o una explicación de parasitología— con texto en chino e inglés, fórmulas y gráficos propios de cada tema.

Según la compañía, describir en detalle esa única imagen requirió un texto de instrucción de 3.700 tokens, dentro del límite máximo de 4.500 tokens que admite el modelo, una cifra que supera ampliamente a versiones anteriores y le permite manejar diseños con múltiples elementos dispuestos sin interferencias entre sí.

El modelo también demostró capacidad para anidar interfaces dentro de otras interfaces: en un solo pedido, generó una imagen que combina un entorno de programación, una app de chat, otra de mensajería y, dentro de esta última, un póster, todo en capas sucesivas que conservan el estilo visual real de cada plataforma.

Texto legible incluso en tamaños diminutos

Otro de los focos del modelo es la fidelidad en el detalle mínimo. Qwen-Image-3.0 puede renderizar texto legible a partir de 10 píxeles, un umbral que la empresa usó como prueba de estrés generando una página completa de un paper académico de geometría algebraica, con fórmulas en LaTeX, subíndices, superíndices y notación matemática compleja, manteniendo la lectura clara pese al tamaño reducido de la tipografía.

También se probó con la generación de un diario impreso con texto denso y aspecto realista, y con tareas de edición de imágenes donde el modelo agregó anotaciones manuscritas simuladas —subrayados, flechas y comentarios— con una caligrafía que imita apuntes escolares reales.

En materia de texturas, la empresa mostró retratos fotográficos donde se aprecian poros y mechones de cabello con nivel de detalle cercano al fotográfico, y ejemplos de restauración de pinturas tradicionales dañadas, donde el modelo reconstruyó las partes faltantes respetando el pincelado y los degradados originales de tinta.

Soporte para 12 idiomas y conexión a información actualizada

La tercera pata del desarrollo es lo que la empresa llama "conocimiento profundo": la capacidad de renderizar con precisión 12 idiomas, más de 100 estilos artísticos y distintas interfaces de usuario reales, como sitios web, videojuegos o plataformas de streaming.

Entre los ejemplos difundidos se incluyen textos generados correctamente en japonés, coreano y español, además de interfaces gráficas que imitan aplicaciones existentes.

La compañía indicó además que el modelo puede conectarse a internet para incorporar información actualizada al momento de generar una imagen. Como ejemplo, mostró la creación de un pronóstico del clima para una fecha y ciudad específicas, generado con datos obtenidos en tiempo real.

  • Entrada de hasta 4.500 tokens para layouts complejos
  • Texto legible desde 10 píxeles
  • Soporte nativo para 12 idiomas
  • Más de 100 estilos artísticos y simulación de interfaces reales

Desde la empresa remarcaron que el objetivo de esta actualización es que la generación de imágenes por IA pase de ser "vistosa" a ser una herramienta aplicable en tareas concretas de diseño, educación, contenido y comercio electrónico.

Publicidad Wire

Comentarios

Ingresá para comentar — leer es gratis, comentar también.

Todavía no hay comentarios. Sé el primero en opinar.

Notas relacionadas