Claude Opus 5 crea un juego FPS con un prompt simple y desata imitaciones
Puntos clave
- •Shumer publicó un shooter jugable construido por Claude Opus 5 apenas dos días después del lanzamiento del modelo y dijo que no usó activos externos.
- •El prompt pidió igualar la calidad de Call of Duty reciente, dividir el trabajo en subagentes y seguir revisando con una comparación ciega frente a metraje real.
- •Shumer dijo que el build funciona en el navegador con Three.js y WebGL2, y que tiene unas 55,000 líneas de código en 11 subsistemas.
- •Su registro crítico publicado mostró que la puntuación subía desde 3.59 sobre 10 hasta poco más de 5, pero seguía por detrás del juego real.
- •Otros desarrolladores reutilizaron la idea con el mismo prompt o uno similar, aunque ninguno de los proyectos posteriores usó la misma prueba ciega de Shumer.

Claude Opus 5 “one-shotted” un juego de disparos en primera persona con un prompt tan simple, y unos resultados tan impresionantes, que a algunos lectores les costó creerlo.
Otros volvieron a ejecutar el prompt y dijeron que los resultados cuadraban.
Matt Shumer, el creador del juego asistido por Claude, llama al método Gauntlet Loop: darle a un agente una meta real que superar, repartir el trabajo entre críticos nuevos y no dejar que el propio constructor califique su tarea.
Apenas dos días después del lanzamiento de Claude Opus 5, Matt Shumer, inversor en IA y ex CEO de HyperWrite, publicó un video de un shooter en primera persona completamente jugable que el modelo había construido por su cuenta.
“Claude Opus 5 one-shotted this game”, escribió, y añadió que no entró ni un solo activo externo en el build.
Ahora bien, podrías pensar que un resultado de tan alta calidad requería un prompt largo, detallado y cuidadoso para guiar al modelo de IA a través de las complejidades de construir un shooter en primera persona pulido.
Piénsalo otra vez.
Claude Opus 5 one-shotted this game. EVERYTHING you see in this demo is custom code... not a single external asset was used. AI games are going to be amazing. (sound on) pic.twitter.com/zc7C61kgv1 — Matt Shumer (@mattshumer_) July 25, 2026
Claude Opus 5 one-shotted this game.
EVERYTHING you see in this demo is custom code... not a single external asset was used.
AI games are going to be amazing. (sound on) pic.twitter.com/zc7C61kgv1
— Matt Shumer (@mattshumer_) July 25, 2026
El prompt detrás del proyecto tenía tres párrafos breves y fue publicado completo en GitHub. Indicaba a Opus 5 que construyera un shooter al nivel de los juegos más recientes de Call of Duty, que repartiera subagentes —trabajadores que cada uno recibe su propia memoria aislada y una tarea limitada— para abordar partes por separado, y que siguiera iterando sobre cada una con un crítico aparte y severo hasta que resistiera una comparación ciega lado a lado con material real de Call of Duty. El resultado, según el prompt, debía ser “utterly perfect”.
Ese enfoque invierte gran parte del consejo que los ingenieros de prompts han dado durante el auge del vibe-coding. La recomendación habitual era especificar criterios en lugar de adjetivos: decir qué significa “bueno” en vez de pedirlo sin más.
La versión de Shumer hace casi lo contrario, pidiendo a sus subagentes que estén “utterly wowed” y dejando la definición real a un crítico que Opus 5 construyó para sí mismo.
Ese fue casi todo el encargo. Shumer escribió después que nunca especificó el renderer, enumeró los sistemas del juego ni definió qué debía incluir la “AAA quality”. Ha empezado a llamar al enfoque Gauntlet Loop: darle a un agente una meta real y verificable en lugar de una instrucción vaga, dejar que divida el trabajo en partes pequeñas y pasar cada parte por un crítico que nunca ve el razonamiento del constructor para sus decisiones.
Dos funciones de Claude Code sostienen ese bucle. Los subagentes se activan en ventanas de contexto aisladas, con sus propias instrucciones y acceso a herramientas, de modo que un crítico que evalúa el modelo del arma no hereda las excusas del constructor sobre por qué se ve como se ve. Ultracode es una configuración de Claude Code que empuja al modelo a su máximo esfuerzo de razonamiento y le permite escribir su propio plan de orquestación, repartiendo trabajo entre hasta 16 agentes a la vez, con un máximo de 1,000 por ejecución.
La habilidad /loop integrada de Anthropic, diseñada para ciclos repetidos de corregir-probar-ajustar, fue lo que evitó que la ejecución se detuviera en cuanto el juego parecía decente. Shumer no especificó un número de rondas. Dejó que el crítico siguiera marcando nuevas brechas y mantuvo al constructor persiguiéndolas durante horas antes de cerrar él mismo la sesión.
El build final funciona sobre Three.js y WebGL2 puro, con unas 55,000 líneas de código repartidas en 11 subsistemas. Cada textura, malla, animación y sonido se genera dentro del navegador al cargarse: sin modelos descargados, HDRIs, archivos de imagen ni archivos de audio. El registro crítico publicado por Shumer muestra cómo la puntuación sube desde 3.59 sobre 10 hasta poco más de 5, aunque sigue por detrás del juego real en cada ronda.
Los escépticos asumieron horas de codificación manual oculta, así que Shumer publicó el prompt completo y la base de código. Ahí fue cuando comenzaron los imitadores.
La misma técnica, tres desarrolladores distintos
James Altucher, ex gestor de un hedge fund y podcaster, ejecutó el mismo prompt y dijo que tardó “un poco más de diez horas” y gastó alrededor de 1.3 millones de tokens en Opus 5 para llegar allí. Su build, Operation Blackout, se puede jugar gratis en el navegador.
El desarrollador de Prompt Silo dirigió la misma solicitud al rival insignia de OpenAI y publicó “Sol 5.6 Ultra with same prompt” —siendo Sol el nivel superior de la familia GPT-5.6 de tres modelos que OpenAI puso a disposición general el 9 de julio, junto con las versiones más baratas Terra y Luna.
Sol 5.6 Ultra with same prompt. pic.twitter.com/1xwBQw5nRh — Rich · Atom Tan Studio (@atomtanstudio) July 26, 2026
Sol 5.6 Ultra with same prompt. pic.twitter.com/1xwBQw5nRh
— Rich · Atom Tan Studio (@atomtanstudio) July 26, 2026
El desarrollador Leon Lin tomó el camino opuesto y usó el prompt detallado habitual. En lugar de copiar la versión corta de Shumer, se propuso “reverse engineer a prompt for this game”, y produjo un documento de unas 20 secciones que detalla todo, desde física ragdoll hasta cascaded shadow maps. Lo introdujo en Cursor usando Opus 5 en high effort, sin subagentes ni ultracode, y el resultado —un shooter de calle comercial llamado Dust Corridor— también se juega en el navegador y se ve sólido.
Ninguno de los proyectos posteriores se ha sometido a la prueba ciega que Shumer aplicó a su propio proyecto. Su registro crítico sigue mostrando que el Call of Duty real gana en cada ronda que anotó —el listón que Altucher y Atom Tan Studio persiguen con su mismo prompt de tres párrafos, y el que Leon Lin persigue con unas 20 secciones propias.
¿Cuánto de esto es realmente nuevo?
Las herramientas de codificación agéntica como Claude Code escriben software del modo en que podría hacerlo un ingeniero junior supervisado: leen archivos, ejecutan código, miran las capturas de pantalla que generan y entregan partes del trabajo a subagentes y críticos que comprueban el resultado frente a un objetivo declarado. Ese bucle es real, y el Gauntlet Loop de Shumer es una forma legítima de estructurarlo.
Nada de eso, por sí solo, demuestra que el modelo diseñó un juego desde la imaginación en lugar de recombinar patrones de código que ya había absorbido.
Three.js incluye sus propios controles de cámara con pointer-lock como ejemplo oficial, y ese patrón base —mouse-look, movimiento WASD y raycasting para los disparos— se ha bifurcado y tutorializado en GitHub, gists y foros de desarrolladores durante más de una década. Un modelo de código entrenado con repositorios públicos casi con seguridad ha visto cientos, si no miles, de shooters casi idénticos antes incluso de leer el prompt de Shumer.
Eso no hace que Claude of Duty sea falso, pero sí hace que “built from scratch” sea una afirmación más difícil de aceptar por completo, así que conviene tomar esos resultados con cautela.
Los investigadores que estudian modelos generadores de código tienen un nombre para el problema más amplio: data contamination, cuando un modelo rinde bien en una tarea sobre todo porque ya había ejemplos casi idénticos en sus datos de entrenamiento, y no porque haya razonado algo nuevo.
Ninguno de los builds de shooter en primera persona publicó una comprobación para ese tipo de contaminación. El propio repositorio de Shumer sí contiene la creatividad de Claude, si es justo llamarla así. Esa es una razón para leer “one-shotted a AAA game” como un agente competente trabajando dentro de uno de los géneros más documentados de la programación, y no como prueba de que una IA diseñó un shooter sin apoyarse en arte previo.