Una solución simple con resultados sorprendentes
La investigación titulada “Prompt Repetition Improves Non-Reasoning LLMs”, realizada por Yaniv Leviathan, Matan Kalman y Yossi Matias, todos ellos investigadores de Google Research, presenta una propuesta tan sencilla como eficaz: mejorar el rendimiento de los grandes modelos de lenguaje (LLMs) repitiendo el prompt original en su totalidad.
La técnica consiste en duplicar el texto de entrada, transformando una petición del tipo “<QUERY>” en “<QUERY><QUERY>”. Esta repetición permite que cada token del prompt pueda atender a todos los demás en la fase de prefill, aprovechando así mejor la arquitectura de los modelos causales, que no pueden mirar hacia el futuro.
¿Qué modelos mejora?
El estudio se ha probado en siete modelos populares: Gemini 2.0 Flash y Flash Lite (Google), GPT-4o y GPT-4o-mini (OpenAI), Claude 3 Haiku y Claude 3.7 Sonnet (Anthropic), y Deepseek V3. Los investigadores comprobaron que la repetición del prompt mejora la precisión de todos ellos cuando no se solicita razonamiento. De hecho, en 47 de los 70 casos analizados se logró una mejora estadísticamente significativa, sin que hubiera pérdidas en ninguno.
El efecto es especialmente positivo en pruebas de opción múltiple donde el modelo recibe primero las respuestas y luego la pregunta (lo que normalmente dificulta el contexto). Al repetir el prompt, los modelos acceden mejor a toda la información disponible.
Sin impacto en latencia ni tokens generados
Uno de los hallazgos más destacados es que repetir el prompt no incrementa la longitud de las respuestas ni el tiempo de generación. La técnica afecta solo a la fase inicial de procesamiento (prefill), que es paralelizable. Solo en casos muy largos, como las tareas personalizadas de “NameIndex” y “MiddleMatch”, los modelos de Anthropic experimentaron un ligero aumento en latencia.
Más allá de los razonamientos
Cuando se aplica en tareas que sí requieren razonamiento paso a paso (como el famoso “piensa paso a paso”), la repetición del prompt no genera mejoras relevantes, pero tampoco empeora los resultados. Es decir, es una técnica neutra o ligeramente positiva en estos casos.
¿Por qué funciona?
La repetición permite reforzar la representación de los tokens en la memoria del modelo. Aunque los autores no ofrecen una explicación definitiva, sugieren que repetir el prompt enriquece los patrones de atención, mejora el acceso al contexto completo y refuerza las asociaciones semánticas sin necesidad de razonamiento estructurado.
Una estrategia lista para producción
Una de las ventajas más claras es que esta técnica no requiere modificaciones en el modelo ni cambios en el formato de las respuestas. Es compatible con cualquier sistema existente y puede integrarse directamente en aplicaciones que usen modelos de lenguaje sin apenas coste adicional.
Los autores consideran que esta estrategia puede ser una configuración por defecto adecuada para muchas tareas simples que no requieren pensamiento estructurado.
¿Qué viene después?
El estudio sugiere explorar variantes como repetir el prompt tres veces (que en algunos casos mejora aún más los resultados), repetir solo partes del texto, o aplicar la técnica en entornos multimodales como imagen y texto. También plantean su uso en escenarios de diálogo o multi-turno, y combinaciones con otras técnicas como la atención selectiva.
El trabajo, disponible en arXiv, no solo aporta una herramienta práctica y fácil de implementar, sino que también abre nuevas vías para optimizar el rendimiento de los modelos sin necesidad de más entrenamiento, más tokens ni mayor coste computacional.
La fotografía de representación de esta noticia ha sido generada con ChatGPT.

