Solvers de póker. La herramienta que revolucionó el juego

La mayoría de los jugadores actuales al menos conocen los solvers, y como mínimo, los utilizan con regularidad. Pero ¿cómo surgieron estos programas y por qué se convirtieron en una parte tan importante del póker? Intentemos entenderlo.

Actualizado
Solvers de póker. La herramienta que revolucionó el juego

Los solvers son un fenómeno bastante joven en el póker. Se hicieron accesibles para el público general hace tan solo 11 años, pero de inmediato empezaron a tener una demanda enorme. La aparición de estos programas marcó el paso hacia un póker orientado al GTO. Incluso profesionales de renombre se vieron obligados a seguir esta tendencia, porque de lo contrario dejaban de entender las acciones de sus rivales y, por consiguiente, terminaban perdiendo. Sin embargo, los solvers, como cualquier otra novedad, siguen teniendo escépticos y detractores hasta el día de hoy. 

Qué es un solver

Foto: Pokercode

Un solver es un programa que, para un escenario definido por el usuario, calcula una estrategia «no explotable», lo más cercana posible al equilibrio de Nash. En la teoría de juegos se llama así al conjunto de estrategias en el que ningún participante puede aumentar su ganancia cambiando su enfoque de juego, si sus rivales no cambian sus estrategias. En el contexto del póker, dicho equilibrio significa que el jugador no podrá aumentar su ganancia únicamente modificando su propia estrategia.

La base de los solvers modernos es el algoritmo de minimización del arrepentimiento contrafactual (CFR). Fue presentado en 2007 por investigadores de la Universidad de Alberta, en Canadá, que buscaban enseñar a un programa a ganar al póker. El nombre del algoritmo suena complicado, pero en la práctica se parece mucho al enfoque basado en la experiencia que utilizan las personas que quieren aprender a jugar al póker. En esencia, es un método de prueba y error gracias al cual la persona, a lo largo de las partidas, recuerda qué decisiones le trajeron mayor éxito. 

El CFR funciona acumulando el «arrepentimiento» por el beneficio perdido que se podría haber obtenido con otras decisiones, y utiliza esos datos para modificar la estrategia en iteraciones futuras. En última instancia, el programa debe reducir el «arrepentimiento» medio a cero y acercarse al equilibrio de Nash. Resulta que el programa simplemente registra las mejores jugadas y construye una estrategia que está lo más optimizada posible desde el punto de vista de la teoría de juegos: el famoso GTO.

La era anterior a los solvers

Andrew Prock. Foto: PokerNews

El primer giro, y muy importante, hacia el enfoque matemático y el GTO se produjo mucho antes de la aparición de los solvers, a principios de la década de los dos mil. Entonces surgió la primera herramienta de póker masiva: la calculadora de equity gratuita PokerStove, desarrollada por Andrew Prock.

PokerStove supuso una revolución, ya que permitió calcular la equity no de manos concretas, sino de todo un rango. La calculadora daba la posibilidad de calcular el EV tanto en el preflop, usando los métodos de Montecarlo, como en el postflop gracias a la enumeración exhaustiva. Fue precisamente este programa el que impulsó a los jugadores a dejar de analizar manos concretas y pasar al estudio de rangos.

Paralelamente se desarrollaban también los trackers de póker, por ejemplo, PokerTracker y Hold'em Manager. En la segunda versión de PokerTracker, lanzada en 2003, apareció el primer HUD (Heads-Up Display) comercialmente exitoso. Dio una enorme ventaja informativa a los jugadores que conocían esta herramienta y la usaban activamente.

Foto: PokerTracker

El HUD permitía a los jugadores de póker seguir en tiempo real las estadísticas de sus rivales en la mesa. Los jugadores empezaron a ver con qué frecuencia el oponente pone dinero voluntariamente en el bote (VPIP), con cuánta actividad sube en el preflop (PFR) o se retira tras un 3-bet. Gracias a estas y otras métricas se podía entender más rápido qué tipo de jugador tenías delante: tight o agresivo. Y las conclusiones intuitivas sobre los rivales obtuvieron una confirmación estadística que permitía construir una estrategia más óptima. Además, los HUD ayudan a analizar las sesiones y a encontrar los propios puntos débiles.

El desarrollo de PokerStove se detuvo en 2008, y la web cerró en 2013. Andrew Prock publicó después el código fuente del programa en GitHub. En cambio, PokerTracker y Hold'em Manager se fusionaron en 2014 en una sola empresa, aunque ambos programas siguieron desarrollándose de forma independiente. Los trackers continúan siendo una herramienta importante para el análisis de sesiones; sin embargo, algunas grandes salas de póker online o prohíben el uso de HUD de terceros, o ofrecen sus propias alternativas con un conjunto limitado de datos estadísticos.

El primer programa que venció a un jugador de póker

Phil Laak contra la máquina. Foto: UA Alberta

Los científicos intentaban «resolver» el póker ya desde los años 1990 en el contexto del estudio de la teoría de juegos y el aprendizaje automático. De esta cuestión se ocupaba el grupo de investigación informática del póker (CPRG) de la Universidad de Alberta. Durante muchos años desarrolló programas que debían encontrar la estrategia de juego perfecta. 

A finales de la década de 1990 aparecieron los modelos Loki y Poki, que fueron representantes de los sistemas expertos. En ellos, las representaciones humanas de la estrategia correcta desempeñaban un papel importante, y en el caso de Loki, los investigadores tenían que buscar errores manualmente y añadir nuevas reglas para hacer al bot más fuerte. 

Sin embargo, el hold'em sin límite es demasiado complejo para calcularlo por completo. Por eso, los científicos se centraron en el heads-up en hold'em con límite y comenzaron a entrenar programas con un modelo simplificado del juego. Los bots recibieron abstracciones de cartas y acciones que agrupaban manos y texturas de board similares en «cestas» especiales, además de limitar el número de líneas y sizings considerados.  

El siguiente paso fue PsOpti, uno de los primeros bots fuertes, construido en torno a la teoría de juegos y a la resolución de una versión simplificada del hold'em con límite en formato heads-up. La cuarta versión del programa supuso un punto de inflexión importante en la investigación, ya que para lograr un juego sólido no utilizó un conjunto de reglas humanas, sino cálculos de un equilibrio aproximado. Este enfoque también se aplicó en la siguiente línea de bots llamada Hyperborean.

En 2007, investigadores de la Universidad de Alberta publicaron un estudio sobre el algoritmo CFR, que mencionamos al principio del artículo. Este algoritmo permitió aumentar significativamente el volumen de abstracciones calculadas y crear una base equilibrada de soluciones que luego podían adaptarse. Precisamente gracias a CFR, los científicos lograron crear un bot que finalmente conseguiría vencer a los humanos en hold'em con límite.

Ali Eslami. Foto: PokerNews

Ese bot fue Polaris, lanzado en 2007. Este programa ya era un sistema de varias estrategias que, durante el juego, podía elegir entre una estrategia cautelosa y una agresiva. El bot jugó contra los profesionales Phil Laak y Ali Eslami. El formato fue inusual: partidos duplicados de 500 manos. Para minimizar la varianza al máximo, cada pareja de jugadores en cada partido recibía las mismas cartas, pero con las posiciones invertidas como en un espejo. Es decir, si en la partida contra Laak el bot recibía cartas malas, en la misma mano contra Eslami recibía las cartas buenas que había tenido Phil.

La primera sesión terminó en empate, en la segunda ganó Polaris, y en la tercera la victoria fue para los humanos. El resultado del enfrentamiento se decidió en la cuarta sesión. Laak y Eslami lograron vencer al programa, terminando la sesión final con un saldo positivo de 570 $. Sin embargo, tras el partido, Phil Laak admitió: «El detalle es que ganamos, pero con una ventaja pequeña. Los bots están alcanzando a los humanos. Ese es el verdadero resultado de este evento». 

En 2008, una versión actualizada y mejorada de Polaris disputó una revancha contra seis jugadores de póker profesionales. Entre los rivales del bot se encontraba Matt Gavrilenko, quien en 2009 se convertiría en poseedor de un brazalete de las Series Mundiales en el evento de $5000 No-Limit Hold'em Short-Handed. 

La nueva versión de Polaris aprendió a detectar cómo se adaptaban los humanos a su táctica y a cambiar de estrategia en respuesta. Laak y Eslami pudieron ganar el primer partido precisamente porque encontraron las debilidades del programa y comenzaron a explotarlas. En la revancha, Polaris obtuvo tres victorias frente a dos derrotas, y una sesión volvió a terminar en empate. El resultado se incluyó en el Libro Guinness de los Récords como el primer caso en el que un bot venció a jugadores humanos profesionales en un torneo de póker.

Los creadores de Cepheus. Foto: ohn Ulan, University of Alberta

En 2015, los investigadores del CPRG afirmaron que, en esencia, habían «resuelto» el hold'em con límite en formato heads-up, presentando el modelo Cepheus. Este utilizaba una nueva versión de CFR —CFR+— y se volvió prácticamente invencible para el ser humano. Según los cálculos, la contraestrategia óptima frente al bot le aportaría al jugador de póker una ganancia media de 0,000986 ciegas grandes por mano jugada. Esto significa que, incluso si una persona jugara contra Cepheus toda su vida, no podría vencerlo.
«No estamos diciendo que vaya a ganar dinero en cada mano. Pero a largo plazo, el ordenador no puede perder: habrá empate o victoria de la IA», declaró uno de los desarrolladores de Cepheus, Michael Bowling, en una entrevista para The Verge. 

La solución del hold'em sin límite

Jugadores contra Libratus. Foto: Carnegie Mellon University

Los investigadores Noam Brown y Tuomas Sandholm, de la Universidad Carnegie Mellon, fueron aún más lejos. Desarrollaron un programa que desafió a los humanos en el hold'em sin límite. Ese mismo 2015, los científicos crearon el bot Claudico, que jugó partidas heads-up contra Doug Polk, Jason Les, Dong Kim y Bjorn Li. Tres de los cuatro profesionales ganaron los enfrentamientos de 20 000 manos.  

En 2017, Brown y Sandholm presentaron un nuevo programa, Libratus. Este modelo elaboró de antemano una estrategia base general, resolvía las tareas no estándar en las calles finales de manera que no rompiera el equilibrio del enfoque calculado previamente, y tras cada día analizaba los exploits encontrados por los humanos y adaptaba su defensa frente a ellos.

Contra el bot jugaron Jason Les, Dong Kim, Jimmy Chou y Daniel McAulay. Los partidos mantuvieron la duplicación de manos, igual que en el caso de Polaris, y se disputaron en el casino Rivers de Pittsburgh durante 20 días. Tras 120 000 manos, Libratus venció a todos los profesionales con un beneficio total de 1 766 250 dólares ficticios. Les perdió más de 880 mil dólares, Chou perdió 520 mil, McAulay perdió 277 mil y Dong Kim perdió 85 mil. El winrate del bot fue de 14,72 BB/100.

Foto: youtube.com/Engadget

La aparición de Libratus fue una etapa importante en el desarrollo de los solvers. Este programa demostró que en los heads-up de Hold'em sin límite la IA es capaz de manejar bien situaciones distintas del modelo simplificado de póker. Pero los científicos de la Universidad Carnegie Mellon no se detuvieron ahí.

El siguiente paso fue el salto al juego en multi-pot. Para ello, Brown y Sandholm, junto con Facebook AI, desarrollaron Pluribus. Este modelo también construía su estrategia base jugando contra sí mismo. Esta táctica se necesitaba principalmente en el preflop, mientras que en el postflop el programa ejecutaba una búsqueda de soluciones con profundidad limitada, calculando las acciones sin llegar hasta el final de la mano. Además, Pluribus resultó ser mucho menos exigente en potencia de cálculo que Libratus.

Contra el bot jugaron profesionales que habían ganado al menos $1 000 000 en su carrera. Entre ellos estaban el plusmarquista en títulos del WPT Darren Elias, el ganador de seis brazaletes de la WSOP Chris «Jesus» Ferguson, Nick Petrangelo, Linus Loeliger y Michael Gagliano. Se realizaron dos experimentos con humanos. En el primero, cinco personas jugaron contra una única copia de Pluribus, y en el segundo, un jugador de póker se enfrentó a cinco copias independientes del programa.

En el primer caso, se jugaron 10 000 manos en 12 días. Los oponentes del bot cambiaban cada día. De un grupo de 13 profesionales, los organizadores elegían a cinco jugadores disponibles. Pluribus se llevó la victoria, mostrando un winrate de alrededor de 5 BB/100. Se destacó que el programa cambiaba de táctica con frecuencia y recurría a donk bets, es decir, jugaba de forma pasiva y luego apostaba contra el oponente que había sido el agresor en la calle anterior.

En el segundo experimento, con cinco copias de la IA, se enfrentaron Elias y Ferguson, cada uno de los cuales jugó 5000 manos. Pluribus también resultó victorioso en este caso. Sin embargo, el porcentaje de pérdidas de Ferguson fue menor que el de Elias. Los investigadores sugirieron que esto podría ser consecuencia de la varianza, del nivel de habilidad o de una estrategia más conservadora, que implicaba foldear en situaciones desconocidas.

«El bot no jugaba contra jugadores mediocres. Jugaba contra algunos de los mejores jugadores del mundo. Su principal fortaleza radica en su capacidad para usar estrategias mixtas. Los humanos también intentamos hacerlo, pero la mayoría no logra hacerlo de forma consistente», declaró Elias tras el experimento.

«Fue increíblemente fascinante jugar contra un bot de póker y observar algunas de las estrategias que elegía. Hubo varias jugadas que los humanos simplemente no hacen. Esto se aplica especialmente al tamaño de las apuestas», comentó Gagliano sobre sus impresiones. 

Éxito comercial

Foto: PokerSnowie

Muy cerca de la funcionalidad de los solvers modernos se acercó el programa PokerSnowie, lanzado en 2013 por la empresa de Olivier Egger y Johannes Levermann. Esta red neuronal se entrenó en póker sin límite a partir de millones de manos jugadas contra sí misma y utilizaba el conjunto de datos obtenido para evaluar las situaciones planteadas por el usuario.

Sin embargo, PokerSnowie tenía una desventaja importante. Los solvers reales calculan las mejores decisiones para spots concretos definidos por el usuario. PokerSnowie no podía hacer esto. El programa más bien predecía la jugada más fuerte por analogía con situaciones que ya conocía, pero en spots poco comunes su eficacia se reducía notablemente. Sin embargo, fue precisamente esta herramienta la que dio a conocer al gran público del póker los principios del GTO.

El gran avance llegó en 2015, el mismo año en que aparecieron Claudico y Cepheus. Los desarrolladores polacos Piotr Łopuszewicz y Kuba Straszewski lanzaron PioSOLVER. Se inspiró en los motores de ajedrez y se convirtió en el primer solver de escritorio accesible que no requería una enorme potencia de cálculo. Este programa, en un PC doméstico normal, podía resolver una situación típica en el flop en cuestión de minutos.

Foto: PioSOLVER

Al mismo tiempo apareció SimplePostflop, que se distingue por admitir no solo el heads-up, sino también los botes multi-way. Este solver pone énfasis en la claridad visual y en plantillas ya preparadas de árboles de juego. Pio, en cambio, gana en posibilidades de personalización y ofrece más herramientas para estudiar situaciones no estándar. Además, cuenta con la función Node locking, que permite fijar la estrategia del oponente en determinados botes y buscar exploits contra él de forma más eficaz. 

En 2017, el número de solvers de escritorio se amplió con GTO+ de los desarrolladores de Flopzilla y MonkerSolver. La primera herramienta logró alcanzar un verdadero equilibrio de Nash sin margen de error residual. Además, GTO+ se diferencia de sus competidores por su precio más bajo (compra única de $75) y su avanzado sistema de almacenamiento de datos, que redujo el «consumo» de memoria de cientos de megabytes a cientos de kilobytes. Entre sus desventajas está la ausencia de cálculos ICM y de soluciones completas para el preflop.

MonkerSolver, por su parte, fue el primero en admitir simulaciones para omaha. También permite calcular soluciones para botes multivía. Sin embargo, este programa se caracteriza por una interfaz muy compleja, un precio considerable de $500 y requisitos de hardware muy altos. Para calcular spots de preflop se necesitan desde 64 GB de RAM, y para 4-max, hasta 256 GB.

Foto: GTO Wizard

Y en 2021 llegó al mercado GTO Wizard, que hoy en día es el solver más popular. Provocó otra revolución en su campo al trasladar los cálculos del ordenador del usuario a la nube. Se puede usar directamente en el navegador, sin necesidad de instalar programas adicionales en el PC. 

GTO Wizard ofrece millones de soluciones precalculadas con una precisión muy alta. Además, el usuario puede obtener el cálculo para un spot personalizado y utilizar el análisis del historial de manos. Y en el último año, el solver ha incorporado soporte para PLO y para el preflop multivía, incluso para situaciones en 9-max.

Descubre más sobre GTO Wizard y otro software de póker en nuestro artículo:
Software de póker: guía de programas para profesionales

Qué piensan los profesionales sobre los solvers de póker

Jeremy Ausmus. Foto: Eloy Cabacas

La mayoría de los profesionales exitosos reconocen que en el póker moderno es extremadamente difícil competir sin usar solvers en los entrenamientos. Jeremy Ausmus, ganador de seis brazaletes de la WSOP, contó que al principio no le dio importancia a estas herramientas, pero rápidamente comprendió que era necesario estudiarlas. «Los solvers destruyeron las ideas sobre el póker que se habían formado durante décadas. No me puse a estudiar GTO de inmediato, confiando en mi puro talento. Pero hacia 2017 empecé a ver cómo los jugadores más respetados, como Stephen Chidwick, mostraban líneas que simplemente no entendía. Entonces me di cuenta de que ya no podía seguir postergándolo, o me quedaría rezagado. Empecé a trabajar con el solver y reinventé mi juego».

Nick Petrangelo, quien jugó contra Pluribus, está convencido de que un solver puede ayudar a los jugadores a aumentar significativamente la rentabilidad de su juego en límites medios. Al mismo tiempo, el regular estadounidense subraya que, para obtener el máximo beneficio, es necesario entender la lógica de las decisiones y no simplemente copiarlas.

«Supongamos que un aficionado juega torneos dominicales con un ROI de entre -40% y -60%. Le basta con abrir el solver una vez a la semana, trabajar un poco el preflop, y su EV aumentará considerablemente. Los solvers se usan en torneos de altas apuestas desde 2015, y es difícil decir que el póker de altas apuestas haya muerto en este tiempo. 

Pero para mí hay dos señales claras de un mal «buen jugador»: cuando el jugador le da demasiada importancia a los pequeños errores del rival que juega según el GTO, y cuando copia ciegamente los solvers sin entender en absoluto por qué lo hace». 

Phil Hellmuth. Foto: Trevor Scott

Aunque también hay escépticos sobre los solvers y el GTO. El poseedor del récord de brazaletes de la WSOP, Phil Hellmuth, sigue confiando más en su «magia blanca». Después de vencer a Daniel Negreanu en el High Stakes Duel, afirmó abiertamente que no tiene intención de adaptar su estilo a las nuevas tendencias del póker. 

Tom Dwan, allá en 2011, ni siquiera creía en el éxito de los solvers: «Puede que el equilibrio de Nash esté equivocado —yo no entiendo nada de eso— o puede que las razones sean otras, pero sé con certeza que en el heads-up de no limit hold'em no existe un juego óptimo y no explotable. Estoy seguro de que podría demostrárselo fácilmente a una persona inteligente con pensamiento racional en persona».

Dwan estaba entonces tan seguro de tener razón que casi se comprometió a una apuesta descabellada. El profesional estadounidense declaró que, en un plazo de 10 a 15 años, estaba dispuesto a jugar un heads-up de no limit hold'em contra un bot GTO durante 500 000 manos. Alex Millar propuso una apuesta de $100 000 en contra de Dwan, pero Tom nunca aceptó ese desafío.

La influencia de los solvers en el póker

Dong Kyu Kim contra la IA. Foto: Carnegie Mellon University

La amplia difusión de los solvers, sin duda, ha elevado el nivel general de los jugadores. Los matices del bluff y la selección del sizing, antes conocidos solo por profesionales experimentados y sofisticados, ahora están disponibles para todos los que estén dispuestos a dedicar tiempo al estudio del juego. El propio aprendizaje de la estrategia se ha convertido en una parte inseparable del trabajo de los regulares. Ahora es necesario pasar horas fuera de las mesas de juego para seguir siendo competitivo. 

Por supuesto, es imposible aprender póker únicamente con solvers. Antes de pasar a estos programas es necesaria una base sólida. Puedes obtenerla en el curso gratuito FF Inicio, donde te familiarizarás con los principios básicos de la estrategia GTO. Y ya en las siguientes etapas, los solvers se convertirán para ti en una herramienta fiable de progreso.

Empezar a aprender

Empieza a aprender póker gratis

  • Regístrate en el programa gratuito FF Inicio
  • Completa la formación, obtén un certificado y una invitación al fondo
  • Empieza tu carrera como jugador con el apoyo del fondo