Покерные солверы. Инструмент, перевернувший игру
Большинство современных игроков как минимум знают о солверах, а как максимум — регулярно их используют. Но как появились эти программы, и почему они стали столь важной частью покера? Попробуем разобраться.

Солверы — довольно молодое явление в покере. Они стали доступны широкой аудитории всего 11 лет назад, но сразу стали пользоваться огромным спросом. Появление этих программ ознаменовало переход к GTO-ориентированному покеру. Даже именитые профессионалы были вынуждены следовать за этим трендом, потому что в противном случае переставали понимать действия соперников и, соответственно, оказывались в проигрыше. Однако у солверов, как и у любой другой новинки, по сей день есть скептики и противники.
Что такое солвер

Солвер — это программа, которая для заданного пользователем сценария рассчитывает «неэксплуатируемую» стратегию, максимально близкую к равновесию Нэша. В теории игр так называется набор стратегий, в котором ни один участник не может увеличить выигрыш, изменив свой подход к игре, если его соперники не меняют своих стратегий. В контексте покера такое равновесие означает, что игрок не сможет увеличить свой выигрыш только за счёт изменения своей стратегии.
В основе современных солверов лежит алгоритм минимизации контрфактического сожаления (CFR). Он был представлен исследователями из канадского Университета Альберты в 2007 году, которые стремились научить программу выигрывать в покере. Название алгоритма звучит сложно, но на практике он очень похож на основанный на опыте подход, который используют люди, желающие научиться покеру. По сути, это метод проб и ошибок, благодаря которому человек по ходу игр запоминает, какие решения принесли ему наибольший успех.
CFR работает путём накопления «сожаления» об упущенной выгоде, которую можно было бы получить при других решениях, и использует эти данные для изменения стратегии в будущих итерациях. В конечном счёте программа должна свести среднее «сожаление» к нулю и приблизиться к равновесию Нэша. Получается, что программа просто фиксирует лучшие ходы и выстраивает стратегию, которая максимально оптимизирована с точки зрения теории игры — та самая GTO.
Эпоха до солверов

Первый и очень важный сдвиг в сторону математического подхода и GTO произошёл задолго до появления солверов, ещё в начале нулевых. Тогда появился первый массовый покерный инструмент — бесплатный калькулятор эквити PokerStove, разработанный Эндрю Проком.
PokerStove совершил революцию, поскольку позволил считать эквити не отдельных рук, а целого диапазона. Калькулятор давал возможность считать EV как на префлопе, используя методы Монте-Карло, так и на постфлопе благодаря исчерпывающему перебору. Именно эта программа подтолкнула игроков отойти от анализа отдельных рук и переключиться на изучение диапазонов.
Параллельно развивались и покерные трекеры, например, PokerTracker и Hold’em Manager. Во второй версии PokerTracker, вышедшей в 2003 году, появился первый коммерчески успешный HUD (Heads-Up Display). Он дал огромное информационное преимущество игрокам, которые знали об этом инструменте и активно использовали его.

HUD позволял покеристам в режиме реального времени отслеживать статистику соперников за столом. Игроки стали видеть, как часто оппонент добровольно вкладывает деньги в банк (VPIP), насколько активно рейзит на префлопе (PFR) или фолдит после 3-бета. Благодаря этим и другим метрикам можно было быстрее понять, какой игрок перед тобой: тайтовый или агрессивный. А интуитивные выводы о соперниках получили статистическое подтверждение, позволившее выстраивать более оптимальную стратегию. Кроме того, HUD’ы помогают разбирать сессии и находить собственные слабые места.
Разработка PokerStove прекратилась в 2008 году, а сайт закрылся в 2013-м. Эндрю Прок после этого опубликовал исходный код программы на GitHub. А вот PokerTracker и Hold’em Manager в 2014-м объединились в одну компанию, при этом обе программы продолжили развиваться отдельно друг от друга. Трекеры по-прежнему остаются важным инструментом для анализа сессий, однако некоторые крупные онлайн-румы либо запрещают использование сторонних HUD’ов, либо предлагают собственные альтернативы с ограниченным набором статистических данных.
Первая программа, победившая покериста

Учёные пытались «решить» покер ещё с 1990-х годов в контексте изучения теории игр и машинного обучения. Этим вопросом занималась группа по компьютерному исследованию покера (CPRG) Университета Альберты. Она на протяжении многих лет разрабатывала программы, которые должны были найти идеальную стратегию игры.
В конце 1990-х вышли модели Loki и Poki, которые были представителями экспертных систем. В них большую роль играли человеческие представления о правильной стратегии, а в Loki исследователям приходилось вручную искать ошибки и дописывать новые правила, чтобы сделать бота сильнее.
Правда, безлимитный холдем слишком сложен для того, чтобы его полностью просчитать. Поэтому учёные сосредоточились на хедз-апе в лимитном холдеме и стали учить программы на упрощённой модели игры. Боты получили абстракции карт и действий, которые объединяли похожие руки и текстуры доски в специальные «корзины», а также ограничивали число рассматриваемых линий и сайзингов.
Следующим шагом стал PsOpti — один из первых сильных ботов, который строился вокруг теории игр и решения упрощённой версии хедз-ап лимитного холдема. Четвёртая версия программы совершила важный перелом в исследованиях, поскольку для достижения сильной игры использовала не набор человеческих правил, а вычисления приближённого равновесия. Такой подход применялся и в следующей линейке ботов под названием Hyperborean.
В 2007-м исследователи Университета Альберты опубликовали работу об алгоритме CFR, который мы упоминали в начале статьи. Этот алгоритм позволил значительно увеличить объём рассчитываемых абстракций и создать сбалансированную основу решений, которые затем можно адаптировать. Именно благодаря CFR учёным удалось создать бота, который наконец сумеет победить людей в лимитном холдеме.

Этим ботом стал Polaris, выпущенный в 2007 году. Эта программа уже была системой из нескольких стратегий, которая во время игры могла выбирать между осторожной и агрессивной стратегией. Бот сыграл против профессионалов Фила Лаака и Али Эслами. Формат был необычным — дублирующие матчи по 500 раздач. Чтобы свести дисперсию к минимуму, пары игроков в каждом матче получали одни и те же карты, но с зеркально отражёнными позициями. То есть, если боту в игре с Лааком доставались плохие карты, то в такой же раздаче против Эслами он получал хорошие карты из руки Фила.
Первая сессия завершилась вничью, во второй выиграл Polaris, а в третьей победу одержали люди. Исход матча решался в четвёртой сессии. Лааку и Эслами удалось обыграть программу, завершив финальную сессию в плюсе на $570. Однако после матча Фил Лаак признал: «Нюанс в том, что мы выиграли, но с небольшим преимуществом. Боты догоняют людей. Вот настоящий итог этого события».
В 2008 году обновлённый и улучшенный Polaris получил матч-реванш против шестерых профессиональных покеристов. Среди соперников бота был Мэтт Гавриленко, который в 2009-м станет обладателем браслета Мировой серии в ивенте $5000 No-Limit Hold'em Short-Handed.
Новая версия Polaris научилась отслеживать, как люди адаптируются к его тактике, и менять стратегию в ответ. Первый матч Лаак и Эслами смогли выиграть как раз потому, что нашли слабости программы и стали их эксплуатировать. В реванше Polaris одержал три победы при двух поражениях, а одна сессия вновь завершилась вничью. Результат был внесён в Книгу рекордов Гиннесса как первый случай, когда бот обыграл людей-профессионалов в покерном турнире.

В 2015 году исследователи из CPRG заявили, что, по сути, «решили» лимитный холдем в формате хедз-ап, представив модель Cepheus. Она использовала новую версию CFR — CFR+ — и стала фактически непобедима для человека. Согласно расчётам, оптимальная контрстратегия против бота принесла бы покеристу средний выигрыш в размере 0,000986 больших блайндов за игру. Это означает, что даже если человек будет играть против Cepheus всю жизнь, то не сможет его победить.
«Мы не говорим, что он будет выигрывать деньги каждую раздачу. Но на дистанции компьютер не может проиграть — будет ничья или победа ИИ», — говорил один из разработчиков Cepheus Майкл Боулинг в интервью The Verge.
Решение безлимитного холдема

Ещё дальше пошли исследователи Ноам Браун и Туомас Сандхольм из Университета Карнеги Меллон. Они разработали программу, которая бросила людям вызов в безлимитном холдеме. В том же 2015 году учёные создали бот Claudico, который сыграл хедз-апы против Дага Полка, Джейсона Леса, Дон Гю Кима и Бьорна Ли. Три из четырёх профессионалов выиграли матчи по 20 000 раздач.
В 2017-м Браун и Сандхольм представили новую программу, Libratus. Эта модель заранее составила общую базовую стратегию, нестандартные задачи на поздних улицах решала так, чтобы не разрушить баланс ранее рассчитанного подхода, и после каждого дня анализировала найденные людьми эксплойты и адаптировала защиту от них.
Против бота сыграли Джейсон Лес, Дон Гю Ким, Джимми Чоу и Дэниел Маколи. Матчи сохранили дублирование раздач, как и в случае с Polaris, и проходили в казино Rivers в Питтсбурге на протяжении 20 дней. По итогам 120 000 раздач Libratus победил всех профессионалов с общим профитом в 1 766 250 условных долларов. Лес проиграл более 880 тысяч долларов, Чоу — 520 тысяч, Маколи — 277 тысяч, а Дон Ким — 85 тысяч. Винрейт бота составил 14,72 ВВ/100.

Появление Libratus стало важным этапом в развитии солверов. Эта программа показала, что в хедз-апах по безлимитному холдему ИИ способен хорошо работать с ситуациями, отличающимися от упрощённой модели покера. Но и на этом учёные из Университета Карнеги Меллон не остановились.
Следующим шагом стал переход к игре в мультипотах. Для этого Браун и Сандхольм совместно с Facebook AI разработали Pluribus. Эта модель тоже составляла базовую стратегию через игры против самой себя. Эта тактика в основном была нужна на префлопе, а на постфлопе программа запускала поиск решений с ограничением по глубине, просчитывая действия не до конца раздачи. При этом Pluribus оказался гораздо менее требовательным к вычислительной мощности, чем Libratus.
Против бота сыграли профессионалы, заработавшие за карьеру не менее $1 000 000. Среди них были рекордсмен по титулам WPT Даррен Элиас, обладатель шести браслетов WSOP Крис «Jesus» Фергюсон, Ник Петранджело, Линус Лёлигер и Майкл Гальяно. Экспериментов с людьми было два. В первом пять человек играли против одной копии Pluribus, а во втором один покерист противостоял пяти отдельным копиям программы.
В первом случае за 12 дней было сыграно 10 000 раздач. Соперники бота менялись каждый день. Из пула 13 профессионалов организаторы выбирали по пять доступных игроков. Pluribus одержал победу, показав винрейт около 5 ВВ/100. Отмечалось, что программа часто меняла тактики и прибегала к донк-бетам, то есть играла пассивно, а затем ставила в соперника, который был агрессором на предыдущей улице.
Во втором эксперименте с пятью копиями ИИ встретились Элиас и Фергюсон, каждый из которых сыграл по 5000 раздач. Pluribus и здесь одержал победу. Однако процент проигрышей у Фергюсона оказался ниже, чем у Элиаса. Исследователи предположили, что это может быть следствием дисперсии, мастерства или более консервативной стратегии, предполагающей фолды в незнакомых ситуациях.
«Бот играл не против середнячков. Он играл против одних из лучших игроков в мире. Его главная сила заключается в способности использовать смешанные стратегии. Люди тоже пытаются делать это, но большинству из них не удаётся делать это последовательно», — говорил Элиас после эксперимента.
«Было невероятно увлекательно играть против покерного бота и наблюдать за некоторыми стратегиями, которые он выбирал. Было несколько ходов, которые люди просто не делают. Особенно это касается размера ставок», — делился впечатлениями Гальяно.
Коммерческий успех

Очень близко к функционалу современных солверов подобралась программа PokerSnowie, выпущенная в 2013 году компанией Оливье Эггера и Йоханнеса Левеманна. Эта нейросеть обучилась безлимитному покеру на миллионах раздач против самой себя и использовала полученный массив данных для оценки пользовательских ситуаций.
Однако PokerSnowie имела один важный недостаток. Настоящие солверы вычисляют лучшие решения для конкретных спотов, заданных пользователем. PokerSnowie этого не умела. Программа скорее предсказывала наиболее сильный ход по аналогии с уже знакомыми ей ситуациями, но в редких спотах её эффективность заметно снижалась. Однако именно этот инструмент познакомил широкое покерное сообщество с принципами GTO.
Прорыв случился в 2015-м, тогда же, когда вышли Claudico и Cepheus. Польские разработчики Пётр Лопушевич и Куба Страшевски выпустили PioSOLVER. Он был вдохновлён шахматными движками и стал первым доступным десктопным солвером, который не требовал огромных вычислительных мощностей. Эта программа на обычном домашнем ПК могла за считанные минуты решить типичную ситуацию на флопе.

В то же время вышел и SimplePostflop, который отличается тем, что поддерживает не только хедз-ап, но и мультивэй-поты. Этот солвер делает упор на визуальную наглядность и готовые шаблоны деревьев игры. Pio же выигрывает в возможностях кастомизации и предлагает больше инструментов для изучения нестандартных ситуаций. Кроме того, он имеет функцию Node locking, которая позволяет зафиксировать стратегию соперника в определённых потах и эффективнее искать эксплойты против него.
В 2017-м число десктопных солверов пополнили GTO+ от разработчиков Flopzilla и MonkerSolver. Первый инструмент сумел достичь настоящего равновесия Нэша без остаточной погрешности. Кроме того, GTO+ отличается от конкурентов более низкой ценой (единоразовая покупка за $75) и продвинутой системой хранения данных, сократившей «потребление» памяти с сотен мегабайт до сотен килобайт. Из минусов — отсутствие ICM-расчётов и полноценных решений для префлопа.
MonkerSolver же стал первым поддерживать симуляции по омахе. Он также позволяет рассчитывать решения для мультивэй-потов. Однако эта программа отличается очень сложным интерфейсом, кусающейся ценой в $500 и очень высокими требованиями к «железу». Для вычисления в префлоп-спотах потребуется от 64 ГБ оперативной памяти, а для 4-макса — до 256 ГБ.

А в 2021-м на рынок вышел GTO Wizard, который сейчас является самым популярным солвером. Он совершил ещё одну революцию в своей сфере, перенеся расчёты с компьютера пользователя на облако. Пользоваться им можно прямо в браузере, не устанавливая дополнительные программы на ПК.
GTO Wizard предоставляет миллионы заранее просчитанных решений с очень высокой точностью. Кроме того, пользователь может получить расчёт для кастомного спота и воспользоваться анализом истории раздач. А за последний год в солвере появилась поддержка PLO и префлоп-мультивэя, в том числе для ситуаций в 9-максе.
Узнайте больше про GTO Wizard и другой покерный софт в нашей статье:
Покерный софт: гайд по программам профи
Что о покерных солверах думают профессионалы

Большинство успешных профессионалов признают, что в современном покере крайне трудно выдержать конкуренцию, если не использовать в тренировках солверы. Обладатель шести браслетов WSOP Джереми Осмус рассказал, что сначала не придал значения этим инструментам, но быстро понял, что их необходимо изучать.«Солверы разрушили представления о покере, которые складывались десятилетиями. Я не сразу взялся за изучение GTO, полагаясь на свой чистый талант. Но ближе к 2017-му стал видеть, как самые уважаемые игроки вроде Стивена Чидвика стали показывать линии, которых я просто не понимал. Тогда и осознал, что медлить больше нельзя, иначе я просто останусь не удел. Стал заниматься в солвере и переизобрёл свою игру».
Ник Петранджело, который играл против Pluribus, уверен, что солвер способен помочь игрокам значительно повысить прибыльность игры на средних лимитах. При этом американский регуляр подчёркивает — для максимальной пользы необходимо понимать логику решений, а не просто копировать их.
«Предположим, какой-то любитель играет воскресные турниры с ROI минус 40-60%. Ему достаточно раз в неделю открыть солвер, немного поработать над префлопом — и его EV значительно вырастет. Солверами в хайроллерных турнирах пользуются с 2015 года, и сложно сказать, что хай-стейкс покер за это время умер.
Но для меня есть два явных признака плохого «хорошего игрока» — когда покерист придаёт большое значение мелким ошибкам соперника в игре по GTO, и когда он слепо копирует солверы, абсолютно не понимая, зачем это делает».

Хотя скептики у солверов и GTO тоже есть. Рекордсмен по количеству браслетов WSOP Фил Хельмут по-прежнему больше полагается на свою «белую магию». После победы над Даниэлем Негреану на High Stakes Duel он прямо говорил, что не собирается подстраивать свой стиль под новые тенденции в покере.
Том Дван в далёком 2011-м и вовсе не верил в успех солверов: «Возможно, равновесие Нэша ошибочно — я в нём совсем не разбираюсь — или причины могут быть в чем-то другом, но я точно знаю, что в хедз-апе по безлимитному холдему не существует оптимальной и неэксплуатируемой игры. Уверен, что легко смогу это доказать умному человеку с рациональным мышлением при личной встрече».
Дван тогда был так уверен в своей правоте, что чуть не подписался на безумное пари. Американский профессионал заявил, что в течение 10-15 лет готов сыграть с GTO-ботом хедз-ап на 500 000 раздач по безлимитному холдему. Алекс Миллар предложил ставку в $100 000 на поражение Двана, но Том этот спор так и не принял.
Влияние солверов на покер

Широкое распространение солверов, безусловно, подняло общий уровень игроков. Тонкости блефа и подбора сайзинга, ранее известные только опытным и искушённым профи, стали доступны всем, кто готов уделить время изучению игры. Само обучение стратегии стало неотъемлемой частью работы регуляров. Теперь необходимо проводить часы за пределами игровых столов, чтобы оставаться конкурентоспособным.
Разумеется, с помощью одних только солверов научиться покеру невозможно. До перехода к этим программам необходима крепкая база. Получить её можно на бесплатном курсе FF Старт, где вы познакомитесь с основными принципами GTO-стратегии. А уже на следующих этапах солверы станут для вас надёжным инструментом прогресса.
Начать обучениеSigue leyendo

Jason Wheeler se proclamó campeón del Main Event de la serie PokerStars Open Barcelona con un buy-in de €1 650, embolsándose $847 960 en premios. El torneo reunió 4333 entradas, generando un fondo de premios de $7,3 millones.

El dealer provocó una pelea en una disputa por las ciegas

«10 millones de dólares no me cambiarán». Lucas Djumalon habló sobre sus objetivos en la carrera de póker y la gran compra tras ganar el evento principal de las WSOP

