En ajedrez, ambos jugadores ven el tablero completo. En Stratego, no: cada persona conoce la identidad de sus propias piezas, pero debe deducir las del rival hasta que chocan. Esa diferencia convierte cada movimiento en una apuesta sobre información que no está a la vista. Un sistema de inteligencia artificial llamado Ataraxos logró dominar ese problema en el juego de mesa y venció por amplio margen a Pim Niemeijer, uno de los jugadores más laureados de Stratego.
El resultado, publicado en Nature, importa menos por el tablero en sí que por la clase de decisión que representa. En muchas situaciones no se conocen todas las alternativas ni las intenciones de los demás participantes. En los mercados, las negociaciones o la ciberseguridad, por ejemplo, distintas personas actúan con datos parciales. El estudio no prueba que Ataraxos resuelva esos problemas fuera de los juegos, pero ofrece una estrategia para entrenar sistemas que deben elegir cuando una parte crucial del escenario permanece oculta.
Stratego es una prueba especialmente exigente. Cada jugador dispone de 40 piezas, que acomoda en secreto al comienzo de la partida. Hay más de 10⁶⁶ configuraciones posibles para esas piezas; una vez iniciada la partida, las identidades se revelan solo en los enfrentamientos. Por eso, una jugada útil no depende únicamente de la posición visible: también depende de qué distribución de piezas escondidas parezca más probable y de cómo podría reaccionar el oponente.
Ataraxos se entrenó mediante autojuego: disputó muchas partidas contra versiones de sí mismo y ajustó sus decisiones según los resultados. Además, aprendió a construir hipótesis sobre las piezas que no podía ver. Durante una partida, genera escenarios plausibles para esa información oculta, simula qué podría ocurrir tras varias jugadas posibles y usa esas simulaciones para afinar su elección inmediata. No adivina el tablero verdadero; compara alternativas bajo distintas posibilidades coherentes con lo que ya observó.
En una serie de 20 partidas contra Niemeijer, el sistema obtuvo 15 victorias, una derrota y cuatro empates. Los autores también adaptaron el enfoque a Barrage Stratego, Hanabi y dou dizhu, tres juegos con reglas y tipos de cooperación distintos. Allí informan resultados superiores a los métodos de referencia disponibles para esas pruebas. El entrenamiento de la versión de Stratego costó, según el artículo, unos pocos miles de dólares y utilizó muchas menos partidas de autojuego que intentos previos que no habían alcanzado el nivel de los mejores humanos.
La demostración sigue teniendo límites claros. El sistema se evaluó en juegos cuyas reglas permiten simular rápidamente un gran número de escenarios; trasladar el método a decisiones reales exigirirá modelos fiables del entorno y de sus incertidumbres. Tampoco alcanza con que una IA encuentre una estrategia eficaz: si fuera a apoyar decisiones que afectan a personas, harían falta mecanismos para revisar sus razones, medir errores y decidir cuándo no debe intervenir. Por ahora, Ataraxos muestra que la información oculta no impide por sí sola que una IA aprenda a jugar con gran nivel, pero no convierte esa habilidad en una solución lista para otros ámbitos.
This game-playing AI is the new champ at Stratego · MIT News Research
MIT News | Massachusetts Institute of Technology · Imagen acompañante del artículo fuente; atribución preservada · Fuente de imagen
Sokota, S., Vinitsky, E., Hu, H., Fan, Z., Kolter, J. Z., & Farina, G. (2026). Scalable decision-making for games of imperfect information. Nature, 658, 55–59. https://doi.org/10.1038/s41586-026-11036-y
Relacionadas por categoría
Ver masUn método combina mapas moleculares e imágenes para leer la organización de un tejido
SpaMOAL integra imágenes histológicas, ubicación y señales moleculares para distinguir regiones de un tejido con mayor detalle.
Un método busca que la IA generativa respete límites de seguridad sin reentrenarse
HardFlow guía modelos generativos para que sus resultados cumplan restricciones estrictas, como evitar choques en una trayectoria robótica, sin tener que volver a entrenarlos.
Un sistema ayuda a anticipar cuándo puede fallar un vehículo autónomo
Un método del MIT traduce en conceptos comprensibles parte del razonamiento de un vehículo autónomo y ayuda a que humanos anticipen mejor sus errores.
Más de la misma fuente
Ver masDos vías por las que un tumor de pulmón puede resistir fármacos contra KRAS
Un estudio en ratones identifica dos formas en que algunos tumores pueden resistir inhibidores de KRAS: amplificar el gen o cambiar de tipo celular.
Una formulación guiada por IA vuelve más estables las vacunas de ARN fuera de la cadena de frío
Un equipo del MIT desarrolló formulaciones de nanopartículas para vacunas de ARN que conservaron actividad tras meses a 37 °C en estudios preclínicos.
Un modelo transparente identifica señales de mayor riesgo suicida en conversaciones de crisis
Un análisis de unas 16.000 conversaciones de una línea de crisis probó un modelo que explica qué señales textuales sustentan cada estimación de riesgo.
Más del mismo autor
Ver masLos sapos de Yosemite salen del invierno con más infecciones por un hongo
Un seguimiento en Yosemite detectó que las infecciones por el hongo quítrido aumentan con fuerza en sapos jóvenes durante su primera brumación.
Un superconductor de tipo I muestra una ruptura inusual de la simetría temporal
Un experimento detectó campos magnéticos internos espontáneos en YbSb₂ al entrar en superconductividad, una señal de un estado cuántico poco habitual.
Una pintura que brilla ayuda a medir el aire sobre un ala en movimiento
NASA probó una pintura que cambia de brillo según la presión del aire sobre un ala móvil. Las imágenes obtenidas en túnel de viento permiten contrastar mediciones físicas con simulaciones.