Skip to main content

No todas las IA sirven para crear imágenes, o para mantener conversaciones con el usuario (chat) ni para…

No no. La IA se aplica a centenares por no decir miles de aplicaciones distintas en sectores y áreas completamente diferentes. Algunas se complementan, otras no tienen nada que ver con el resto. En Pixel Editions nos efocamos mucho a dos tipos concretos: las de imagen y las de chat. ¿Por qué? Porque la generación de imágenes nos parece muy interesante y las de chat complementan a las primeras generando prompts complejos que pueden ser utilizados para crear imágenes e incluso historias completas con mucho más contenido.

Las IA dedicadas a vídeo y audio todavía no están en nuestro radar por el momento.

Otras IA más específicas, como las de programación de código o las aplicaciones a Big Data, etc. se quedan fuera de nuestros alcance. Por el momento. Nunca se sabe cuándo veremos por aquí a Copilot o a cualquier otra.

Volviendo a las imágenes. Hay muchas IA en el mercado. Muchas gratuítas, otras de pago, algunas pueden usarse como aplicación de escritorio (es decir, en local), otras no hay más solución que usarlas online vía interfaces Web o similares.

Sin querer dejar a nadie fuera creemos que actualmente hay cuatro grandes líneas o ¿paradigmas? para todas estas IA:

  • Stable Diffusion con todas sus variantes y apps basadas en el esquema de usar modelos y otros componentes entrenados de forma específica para un tema determinado. Aquí podemos englobar a Leonardo, Ideogram, Remix y muchísimas más. Stable Diffusion es gratuíto o mejor dicho, Open Source, pero para poder utilzarlo es necesario el uso de hardware con potencia de cálculo suficiente. O bien disponer de tarjeta gráfica cuya GPU y VRAM cumplan con los requisitos o con CPU con uso de RAM unificada como los Apple M1, M2, etc. Si no la alternativa es el uso de interfaces online (Leonardo, etc.) o incluso cuentas en Cloud para poder ejecutar Stable Diffusion remotamente en hardware que sea lo suficientemente potente. Hay muchos esquemas de suscripción y uso, desde los créditos gratuítos al día/semana/mes hasta los planes de suscripción por un número determinado de usos, minutos de GPU, generaciones de imágenes, etc. Queda la opción de Civitai, un portal Web en el que se pueden descargar modelos y también generar imágenes y publicarlas.
  • Dall-E. Funciona como aplicación online a través de ChatGPT y otras posibilidades (por ejemplo con aplicaciones de escritorio como PyGPT que utilizan la API de OpenAI para ChatGPT y Dall-E). No hay opción gratuíta. De vez en cuando existen ofertas de uso limitado para poder probar pero por lo general no es así. Dall-E tiene un coste mensual que permite crear equis generaciones de imágenes.
  • Adobe Firefly. Adobe apuesta por su propio modelo, en constante evolución, y entre Firefly y la inclusión de IA generativa en Photoshop 2024 se adentra en el mundo de la generación de imágenes. Firefly funciona exclusivamente online mientras que con Photoshop se puede retocar una imagen con relleno generativo de forma local. Los filtros aplicados a los prompts, es decir la censura, es tal que en ocasiones uno se pregunta quién los ha escrito. A pesar de ello es una opción interesante para usuarios de la Creative Suite completa o suscritos a Photoshop.
  • Midjourney. Al final tenemos Midjourney que es un “hijo escindido” de Stable Diffusion. Se basaron en los modelos de SD para crear su propio modelo y cerraron el código. Ahora funciona como una aplicación convertida en un bot de Discord. Hay que tener una cuenta en Discord para ejecutarlo. Y tal como es fácil adivinar sólo se puede usar online. Una vez pasemos el listón de las 1.000 imágenes generadas se abre la posibilidad de usar la versión alfa de la interface Web. No hay APi pública ni privada, ni tampoco posibilidad de instalación local. Midjourney tiene opciones de suscripción desde los 10-12$ al mes en adelante.

La gran pregunta es ¿cuál utilizo si nunca he usado una IA generativa de imágenes?

Pues puedes empezar por Leonardo o Remix (ésta mejor en el móvil). No tienen la flexibilidad de una interface que explote hasta el último recurso de Stable Diffusion pero tampoco tienes que invertir en hardware ni pagar suscripción alguna. Los resultados no serán los mejores, claro está. Puede que incluso no aprecies lo que es posible hacer con una IA generativa por esas limitaciones. Para probar la potencia real y las posibilidades que hay creemos que una buena opción es la suscripción básica a Midjourney por un mes. En ese tiempo es más que suficiente para ver sus posibilidades, incluso en menos tiempo agotaremos el tiempo asignado. Comparando imágenes creadas con el mismo prompt entre Midjourney y Leonardo se ve claramente la diferencia existente. Es como comparar Photoshop con Paint, o bueno, quizás algo más completo que Paint.

Con esa pequeña inversión es posible darse de cuenta de:

  • Esto no es para mí, es solo un juguete para diseñadores
  • Esto está hecho para mí y necesito saber más

El segundo caso es el que nos ocupa en Pixed Magazine cada mes. El primero, como todo, los intereses de cada cual son muy respetables. El hecho de que exista una IA para generar imágenes no implica que todo el mundo la necesite o la tenga que usar.

Cuando ya has probado una IA como Midjourney (y puede ser otra, insistimos) y ves que esto tiene futuro la cuestión es decidir si seguir con un plan similar o más completo, cambiar de IA, invertir en hardware para poder usar IA’s en modo local. O un mix de todo.

Repasemos

Stable DiffusionLocal/OnlineGratis/Suscripción
Dall-EOnlineSuscripción
FireflyOnlineSuscripción
MidjourneyOnlineSuscripción

Existe una gran comunidad partidaria de Stable Diffusion por cuanto es “gratis”. Ese gratis viene condicionado por los límites que imponga cada herramienta y por el gasto en hardware necesario si se usa en local. Hemos comentado ya interfaces como ConfyUI y Invoke AI en números pasados de la revista Pixed Magazine y también en artículos en la Web. El argumento número uno es que aparte del coste se pueden utilizar modelos para casi todo y se pueden entrenar modelos para temas que no estén ya disponibles. Por ejemplo, un modelo especializado en maquinaria a vapor o en la invasión de Normandia. Cualquier tema es susceptible de ser entrenado para crear un modelo.

Está muy bien. Otra cosa es que sea fácil entrenar un modelo. Exige tiempo y paciencia aparte de eventuales costes por el uso. Y dentro de los modelos hay una plétora de variantes: checkpoints, VAE’s, LORA’s, adaptadres IP, etc. Es un mundo complejo el de SD como si fuera un gran mecano. Abierto a la experimentación pero cerrado al novato que quiere hacer una imagen el primer día.

¿Y luego que?

Cuando ya has elegido la herramienta, sea cual sea, ¿cuál es el paso siguiente? Saber cómo usarla, sin duda. Todo se basa en una premisa común, el prompt.

El prompt es la orden, el comando, la descripción de lo que queremos obtener. Por algo estamos ante IA definidas como de Texto a Imagen. Leen un texto y lo convierten en una imagen. Así de simple.

Un prompt puede ser muy sencillo, como

Un limón

o tan complejo como

A rickshaw is a human-powered vehicle commonly used for short distance transportation, particularly in densely populated urban areas of Asia and Africa. It consists of a single passenger seat attached to a lightweight frame with two wheels, typically made of bamboo or metal. The driver, called a rickshaw puller, sits behind the passenger and propels the vehicle by pushing it along the ground with long poles attached to the front wheels, often while balancing on a small platform. Rickshaws come in different variations such as cycle rickshaws, which are pedal-powered, or motorized rickshaws that run on an engine.

Es necesario aprender a describir el mundo que nos rodea, o al menos el mundo que rodea a todo lo que queremos expresar en una imagen. Como si explicáramos la escena a un invidente, por ejemplo. Sin dejarnos un detalle, nada.

El prompt usado en la imagen destacada de este artículo es:

user building a prompt to generate this image:: user is thinking about phrases, words and semantics:: computer waits for orders to execute and generate the picture

Parece fácil y no lo es tanto. Todo lo que aparece en una imagen es responsabilidad nuestra. Si en la imagen aterior no queremos un coche circulando por la parte derecha, tenemos que decírselo. Si la imagen la queremos en color y sale siempre en blanco y negro, también hay que decírselo. La pose del personaje, su vestimenta, su peinado, la luz, si es de día o de noche, dónde transcurre la escena, etc.

Las primeras imágenes que generarás no saldrán como quieres, eso seguro. El experimento es la base del aprendizaje para llegar a crear tu propio estilo de imagen y por tanto de composición. Fijarte en prompts de los demás no es malo, al contrario, te ayuda a ver cómo se consigue tal o cual estilo, efecto, iluminación, todo. Aplicarlo a tus imágenes ya es cosa tuya.