Un modelo que actúa por sí mismo, bajo supervisión humana
OpenAI ha comenzado a desplegar una nueva función para su producto estrella: el agente de ChatGPT. Se trata de una herramienta que combina navegación web, razonamiento complejo y ejecución de tareas, lo que permite a ChatGPT actuar por sí mismo en encargos como crear informes, completar formularios o analizar datos financieros. La funcionalidad se integra directamente en la plataforma y está disponible desde hoy para los usuarios Pro, Plus y Team.
Este avance representa una evolución de dos tecnologías previas desarrolladas por la compañía: Operator, que permitía la interacción directa con sitios web mediante un navegador remoto, y la investigación en profundidad, centrada en el análisis y la síntesis de información. Al unificar ambas capacidades, el agente de ChatGPT puede seleccionar herramientas según el contexto de la tarea y alternar entre diferentes modos de acción, siempre bajo el control del usuario.
Navegación visual, acceso a API y control contextual
El sistema funciona desde un ordenador virtual propio de ChatGPT. Desde allí, accede a sitios web, aplica filtros, rellena formularios y genera entregables como presentaciones o hojas de cálculo. Además, integra múltiples formas de interactuar con la web: un navegador visual, otro basado en texto y el acceso directo a API. Esto permite que el modelo elija la ruta más eficiente para cada tarea.
Por ejemplo, puede recuperar datos financieros vía API, interactuar con interfaces gráficas para aplicar filtros o completar formularios y combinar toda esa información en un único informe. Todo esto se lleva a cabo en un entorno donde el contexto de la tarea se mantiene, independientemente de las herramientas utilizadas.
Colaboración en tiempo real y tareas iterativas
Una de las principales novedades es que el modelo puede interactuar con el usuario durante la ejecución de tareas. El usuario puede interrumpir, modificar instrucciones o detener el proceso en cualquier momento. Del mismo modo, ChatGPT puede pedir aclaraciones para ajustar su enfoque. Esta dinámica convierte al agente en una herramienta flexible para flujos de trabajo que requieren interacción continua y adaptación.
Entre los casos de uso que OpenAI destaca se incluyen la creación de modelos financieros complejos, el análisis de competidores, la planificación de reuniones o la actualización de documentos. También es posible automatizar tareas repetitivas mediante programación periódica, como la generación de informes semanales.
Evaluación del rendimiento en pruebas estándar
OpenAI ha sometido a su nuevo agente a varias evaluaciones académicas. En el benchmark SpreadsheetBench, centrado en tareas con hojas de cálculo, el agente duplicó el rendimiento de GPT-4o, modelo anterior de referencia. También destacó en pruebas como DSBench, donde superó al modelo previo y a evaluadores humanos en tareas de ciencia de datos, y en BrowseComp, donde logró una puntuación récord en la localización de información difícil en la web.
En Humanity’s Last Exam, que evalúa la capacidad de modelos de IA para resolver preguntas complejas de múltiples disciplinas, el agente alcanzó una puntuación de 43,1, estableciendo un nuevo máximo.
Controles de seguridad y privacidad
OpenAI ha subrayado la importancia de mantener el control humano en todo momento. El sistema solicita permiso antes de realizar acciones sensibles, como enviar formularios o acceder a información privada. Además, se han implementado salvaguardas para evitar usos indebidos y proteger al modelo frente a manipulaciones externas.
En sesiones de navegador, los datos introducidos por el usuario no se almacenan en los servidores de ChatGPT. También se puede borrar todo el historial de navegación y cerrar sesiones activas con un solo clic.
Disponibilidad y limitaciones
El agente de ChatGPT está disponible desde ayer para los usuarios de pago Pro, Plus y Team. En julio se incorporará también a las versiones Enterprise y Education. Por ahora, los usuarios Pro cuentan con tareas casi ilimitadas, mientras que el resto tiene un límite mensual de 50 tareas, ampliables con créditos.
Aunque la herramienta puede ejecutar tareas complejas, todavía presenta limitaciones. Algunas funciones, como la generación de presentaciones desde cero, están en fase beta y ofrecen resultados básicos en cuanto a diseño. OpenAI ha señalado que trabaja en una versión mejorada con resultados más pulidos y opciones avanzadas.

