Inicio Blog Página 87

La artista IA de ‘La Mesías’: «es una herramienta creativa con muchísima potencia»

Alejandra G. López es la artista digital que está detrás de la escena con inteligencia artificial (IA) de la serie La Mesías (2023), dirigida por Javier Calvo y Javier Ambrossi (los javis). Nacida en Bilbao y residente en Madrid, ha dedicado los últimos años a explorar e investigar la composición de video e imagen mediante IA generativa. Actualmente, es estudiante de VFX en la U-tad y ha expuesto en diversas galerías de arte, siendo su participación más reciente en MMMAD Art.

En su trabajo, Alejandra G. López construye mundos visuales y poéticos en entornos surreales, generando una obra donde la nostalgia y el miedo toman forma de micro-cuentos. Utiliza la síntesis como herramienta comunicativa, dando espacio a los juegos incómodos de los conflictos internos y guiándolos por espacios inquietantes a través de diferentes técnicas.

La siguiente entrevista fue realizada en febrero durante el congreso The AI Revolution por el también artista audiovisual Javier de la Chica.

Imagen promocional de la serie 'La Mesías'
Imagen promocional de la serie ‘La Mesías’.

Javier de la Chica: ¿Cómo llega Alejandra G. López a trabajar con IA?

Alejandra G. López: La IA es algo muy reciente. Yo estudié Restauración de Arte y me he dedicado a ello, pero me quedaba la espinita del diseño gráfico. Así que jugando con el diseño de manera autodidacta acabé cruzándome con la IA en 2021 o así. Es decir, he visto todo el proceso de los usos de IA generativa en procesos creativos. Al principio era más ruidoso, más abstracto, y ahora hemos llegado a un hiperrealismo bastante loco. Desde el principio me pareció una herramienta con muchísima potencia. Soy artista multidisciplinar y trabajo mucho con imaginarios surrealistas, oníricos, espacios que difieren mucho de una realidad. La IA me proporcionaba múltiples posibilidades de creación.

JC: ¿Cómo entras en el proyecto de La Mesías?

AGL: En mayo del año pasado participé en una exposición para el festival de arte MMMAD Art. Expuse una instalación en formato vídeo que trabajé con IA uniéndolo con un poemario. Una de las personas que acudió a la exposición trabajaba en el equipo de La Mesías, con los javis, y justamente estaban buscando a alguien con IA. Habían probado con diferentes personas y técnicas, pero no acababan de conseguir lo que buscaban con la escena. Me escribieron, hicimos algunas pruebas y, por suerte para mí, les gustó mucho mi trabajo.

fueron más de tres meses de trabajo en los que se hicieron muchísimas pruebas

JC: ¿Cuánto tiempo llevo construir la pieza de IA que aparece en La Mesías?        

AGL: La parte de la IA y la integración de la IA fueron más de tres meses de trabajo en los que se hicieron muchísimas pruebas.

También es verdad que no es un vídeo generado totalmente por IA, sino que he trabajado sobre algo ya rodado. También hay mucha investigación. A veces simplemente era revisitar capítulos anteriores, para darle un contexto, unas cualidades creativas que tuviesen un sentido. Le dimos mucha importancia a los recursos que iban a rodear la escena, los bodegones. ¿Qué tipo de estética había ahí? ¿Qué referencias? Hice investigación sobre bodegones simbólicos, como los de Zurbarán, que trabajan mucho con el objeto y la simbología. ¿Cómo lo integraba? ¿A qué escalas, qué niveles de distorsión o ser más fieles en cuanto al vídeo?

Los Javis hicieron algo que a mí me pareció muy interesante. Aprovecharon el error de aprendizaje de la IA para un contexto muy concreto, que es una escena en la que un personaje está alucinando colocado.

La IA te da esa sensación constante de errores de los que hay que saber aprovecharse.

JC: ¿Qué herramienta utilizaste?

AGL: Trabajé con modelos de Stable Diffusion mediante Automate. De esta forma lo tenía todo en local y podía controlar, entre otras cosas, los derechos de autor. Creé mis propios LORAS (pequeños modelos aplicados a un modelo más general) con información libre de uso, de la productora e imágenes del propio set. Por ejemplo, tenía uno que era la propia protagonista, pero en su versión adolescente. Así podía aplicar su cara como en un deep fake a la propia actriz. Lo apliqué en un momento en el que la protagonista está teniendo una vivencia un poco traumatizante, que le está devolviendo a un contexto muy concreto de cuando ella era más joven.

Alejandra G. López entrevistada por Javier de la Chica durante The AI Revolution Congress (Fotografía realizada por Guillermo Quevedo)
Alejandra G. López (izquierda) entrevistada por Javier de la Chica (derecha) durante The AI Revolution Congress (Fotografía realizada por Guillermo Quevedo).

JC: Nosotros que utilizamos la IA sabemos que por ahora es completamente impredecible pero esto no lo sabe todo el mundo que no ha trabajado con esta tecnología. ¿Te pidieron algo que no se pueda controlar?

AGL: Igual que cuando pintas o dibujas, en la casualidad puedes encontrar algo interesante. La IA te da esa sensación constante de errores de los que hay que saber aprovecharse.

Además, actualmente da unos muy buenos resultados estéticos, pero lo difícil es darle tu personalidad. Creo que eso fue lo que más trabajamos y más intentamos recuperar, para que tuviese una lectura coherente con el resto de la serie.

JC: Existe mucha polémica en torno al uso de la IA en entornos profesionales. ¿Cómo se ha recibido tu obra?

AGL: Sinceramente, tenía bastante miedo. Entiendo muchas de las críticas. Veo el potencial de la IA, pero también sus riesgos. Hay que ser críticos. Pero la verdad es que he tenido muchísimo apoyo y el mensaje que más se ha repetido es el de que mi obra es un buen ejemplo de cómo utilizar la IA.

También he tenido comentarios negativos, pero en su mayoría eran desde la desinformación. Por ejemplo, había alusiones a que la producción se quiso ahorrar un equipo de efectos visuales, cuando yo trabajé continuamente con el equipo de VFX para poder integrar la secuencia. Es decir, había equipo de efectos visuales. No se sustituyó a nadie, más bien se añadió una nueva figura, que era yo como artista para poder explorar y ver qué posibilidades teníamos.

El otro día me escribían para otro proyecto con IA y yo soy consciente de que necesitamos una parte 3D para poder aplicar esa parte con IA. Me explico: la IA no ha venido a sustituirlo todo. Depende del nivel de concreción que quieras. Creo que es una herramienta muy democratizadora. Mucha gente puede acceder a ello. Eso está genial. Pero para cosas más detalladas, más trabajadas, seguimos necesitando a técnicos que sepan hacerlo manualmente o incorporar estos resultados y herramientas en el trabajo final.

Ilya Sutskever, cofundador de OpenAI, abandona la compañía

0

Ilya Sutskever, cofundador y científico jefe de OpenAI, ha anunciado su salida de la empresa de inteligencia artificial detrás de ChatGPT. Sutskever, un destacado investigador en este campo, ha sido clave en los avances de la compañía en IA generativa. Su decisión llega seis meses después de la crisis interna de OpenAI, cuando Sutskever se alineó con los miembros del consejo que intentaron destituir al CEO Sam Altman.

Sutskever compartió su intención de abandonar OpenAI a través de la red social X, tras casi una década en la compañía. A pesar de ello, considera la trayectoria de la tecnológica como “milagrosa” y confía en que el laboratorio logrará desarrollar una inteligencia artificial general segura y beneficiosa.

Así anunció Ilya Sutskever su intención de abandonar Open AI

Tanto Sutskever como Altman han evitado mencionar la crisis de noviembre pasado. Altman se refirió a Sutskever como “una de las mentes más brillantes de nuestra generación” y “un querido amigo”. Además, anunció que Jakub Pachocki, discípulo de Sutskever, asumirá el cargo de científico jefe de la compañía.

Durante la crisis, se especuló que Sutskever se oponía a Altman debido a la carrera empresarial en la que OpenAI se había embarcado, descuidando los riesgos asociados al rápido desarrollo de la IA. Aunque inicialmente apoyó el despido de Altman, luego cambió de opinión y pidió disculpas. Una investigación posterior concluyó que la destitución de Altman no estaba justificada.

Sutskever ha insinuado que pronto lanzará un nuevo proyecto, aunque no ha proporcionado detalles específicos.

La fotografía de este artículo ha sido publicada por Ilya Sutskever en la red social X. De derecha a izquierda encontramos a Jakub Pachocki, Greg Brockman, Ilya Sutskever, Sam Altman y Mira Murati.

Google presenta novedades con búsquedas todavía más personalizadas al usuario

0

El pasado 14 de mayo, sólo un día después de la estratégicamente programada presentación de ChatGPT 4o, Google presentó sus novedades en el evento Google I/O 2024. El jefe de ceremonias ha sido el director ejecutivo de la compañía, Sundar Pichai.

Entre las novedades en Inteligencia Artificial (IA) ha destacado que el nuevo Gemini 1.5 Pro será capaz de manejar hasta un millón de tokens y se integrará con gran cantidad de aplicaciones de Google. Incluirá novedades en su interacción con Google Fotos pudiendo responder preguntas sobre las fotografías de nuestros álbumes, trabajará con GMail para los usuarios de Google Workspace, resumirá las reuniones que mantengamos por Google Meet, etcétera. Y todo ello mediante parámetros a viva voz, ya que el control de Gemini es a tiempo real con un desarrollo multimodal que evita que sea necesaria cualquier tipo de interacción que no sea por voz.

Google Search

Todos sabemos que el pilar fundacional de la multinacional son  las búsquedas y la llegada de la IA está poniendo en duda las capacidades de los motores de búsqueda tradicionales. Según la empresa, la llegada de la IA en el buscador de Google supone un antes y un después en la forma de comportarse de la compañía. El buscador de Google quiere hacer búsquedas todavía más personalizadas basadas en los resultados de búsquedas anteriores así como en los parámetros introducidos, e intentando adaptarse completamente a nuestros gustos.

Por otro lado, la presentación de Project Astra demuestra un avance importante en la información multimodal, ya que reconoce la información de nuestro entorno.

Generación de vídeo con VEO

En cuanto a IA generativa, el director de Google Research, Doug Eck, presentó el nuevo modelo de generación de imágenes de la empresa. Pero el paso ha ido mucho más allá con su presentación de VEO, la IA generativa de vídeo que pretende competir con Sora.

Sundar Pichai destacó la demanda de potencia y recursos que requiere la IA. Es por ello que han lanzado Trillium, un chip que, según Pichai, permite mejorar 4’7 veces el rendimiento y eficiencia energética de los procesos. En esta misma línea, el CEO de Google DeepMind, Demis Hassabis, colaboró en la conferencia presentando Gemini 1.5 Flash. Un modelo más ligero que consume menos recursos.

Otro de los aspectos destacados de la presentación han sido los Gem, pequeñas inteligencias artificiales especializadas en campos concretos para focalizar mejor el trabajo con la IA.

También han destacado las integraciones con Android con integraciones que, por ejemplo, permiten resumir vídeos o PDFs.

Aquí puedes ver la presentación completa.

Ciberseguridad

Google también ha abordado temas relacionados con la privacidad y la seguridad de los usuarios. En este sentido, ha presentado el AI Assisted Red Teaming, un conjunto de especialistas que se encargan de garantizar la seguridad de los modelos de IA. Su objetivo es evitar que esta tecnología se utilice para fines inapropiados.

Además presentó un sistema con el que el propio teléfono nos avisará si están intentando estafarnos a través de una llamada y ha anunciado SynthID, una marca de agua que permite identificar cualquier trabajo creado por IA. Su utilidad se hace evidente al utilizar la aplicación VEO. SynthID añade marcas de agua a textos y vídeos generados por IA, lo que facilita distinguir contenido auténtico de aquel creado por algoritmos. La colocación de la marca de agua no afecta la calidad, precisión ni velocidad de generación del texto o vídeo.

También hubo novedades en Google Gemma, la familia de modelos de lenguaje abiertos desarrollados por Google. Estos modelos, inspirados en Gemini, se caracterizan por su ligereza y rendimiento y ahora combinarán las capacidades de visión y lenguaje con PaliGemma, interpretando el contenido visual. La nueva generación de modelos, Gemma 2, estará disponible en junio.

Puedes encontrar más información en la nota de prensa oficial de la empresa: Google I/O 2024: un I/O para una nueva generación.

OpenAI vuelve a revolucionar la IA con un GPT multimodal

0

OpenAI ha presentado su nuevo modelo de inteligencia artificial, GPT-4o, en un evento en directo el pasado lunes 13 de mayo. Esta nueva versión de ChatGPT es multimodal y aborda el problema de la latencia, permitiendo una interacción “en tiempo real”. La CTO de OpenAI, Mira Murati, mencionó que GPT-4o tiene una “inteligencia al nivel de GPT-4”, pero mejora en sus capacidades de texto, audio y visión en una única red neuronal. Aunque su rendimiento en texto y codificación es similar al de GPT-4 Turbo, GPT-4o destaca por su mejora significativa en idiomas no ingleses.

Respuesta inmediata

Una característica destacada es el nuevo modo de voz, que reduce la latencia a 320 milisegundos y permite una interacción más natural. Además, GPT-4o responde en diferentes tonos de voz, puede reír, cantar y resolver problemas matemáticos.

Otra novedad es la traducción instantánea, que permitirá conversar con ChatGPT en lenguaje natural y obtener respuestas traducidas en casi tiempo real. También mejorará en sus capacidades de visión, analizando fotos o capturas de pantalla.

Gratuito

GPT-4o se desplegará entre los usuarios de ChatGPT Plus y Team, y próximamente estará disponible para los usuarios gratuitos. Los usuarios de pago tendrán un límite más amplio para utilizar el nuevo modelo y acceso al modo de voz en tiempo real. Además, OpenAI lanzará una aplicación de ChatGPT para macOS.

En el siguiente vídeo podéis ver la presentación completa:

También podéis ampliar la noticia en la web oficial de Open AI: Hello GPT-4o | OpenAI

Es importante destacar que la rueda de prensa no abordó todas las novedades de ChatGPT 4o.

Se han implementado medidas de seguridad, y su evaluación muestra que no supera un riesgo medio en categorías como ciberseguridad, persuasión y autonomía del modelo. GPT-4o representa un paso importante hacia una interacción más natural entre humanos y computadoras.

En la fotografía de este artículo podemos ver a Mira Murati durante la presentación de ChatGPT 4o en un fotograma del directo de OpenAI.