sumário do guia
Baixada · Estudo · Guia de campoParte I · A solução, e como lê-la
Capítulo v

As quatro visões

Cada célula do lab responde uma de quatro perguntas sobre a mesma decisão resolvida: o que a solução faz aqui (Estratégia), quais mãos realmente chegam aqui (Range), quanto custaria um hábito fixo (Custo) e como o jogo muda entre dois pontos (Comparar). A tabela dá as quatro de relance; as seções abaixo tomam uma por vez — primeiro a fórmula, depois uma figura de células resolvidas reais, desenhada com os próprios componentes do lab.

§

As quatro visões de relance

VisãoO que o número mostraFórmulaPara o seu jogo
Estratégiaa fatia de cada ação na mistura — as faixas de cor; o número impresso é a maior fatiaσ(ah)\sigma(a \mid h)Quando a célula mistura, misture também: um hábito fixo num ponto de mistura é exatamente o que um leitor explora.
Rangea fatia de cada mão no range que chega do jogador na vez; o sombreado acompanha a célula mais pesadaP(h)P0(h)σP(h \mid \ell) \propto P_0(h)\,\textstyle\prod \sigmaRanges se conquistam, não se recebem — cada ação que um jogador atravessa filtra o que ele ainda pode ter.
Custoquanto o hábito precificado abre mão frente à melhor ação disponível, mão a mãomaxav(a)v()\max_{a} v(a) - v(\cdot)Células escuras são onde a disciplina paga; células claras perdoam quase qualquer hábito.
Compararquanto a mesma decisão se desloca entre dois pontos resolvidos — gap de aceite nas apostas, variação total no restoΔσaccept  /  TV(σ,σ)\Delta\sigma_{\mathrm{accept}} \;/\; \mathrm{TV}(\sigma, \sigma')Se o Comparar acende, o placar mudou o jogo — não carregue um gráfico de um placar para outro.
§ 1

Estratégia — a mistura em si

Fixe uma mão e a resposta da solução não é uma carta, é uma probabilidade para cada ação legal: σ(a | h), a estratégia média nesta decisão. A célula desenha essa mistura como faixas de cor, cada uma da largura da fatia da sua ação, e imprime só a maior fatia como número. A mistura completa está sempre a um hover — o tooltip e o painel da mão abrem cada ação; o número sozinho, nunca.

ncell=100maxaσ(ah)n_{\mathrm{cell}} = 100 \cdot \max_{a}\, \sigma(a \mid h)
hh
uma mão exata
σ(ah)\sigma(a \mid h)
com que frequência a solução toma a ação a segurando h

O número impresso é a fatia modal da mistura exibida. Cada célula é uma mão exata, então as faixas são o σ daquela mão — nada é agregado.

Quando a célula mistura, misture também: um hábito fixo num ponto de mistura é exatamente o que um leitor explora.

L = 4
H \ M55532AKJQ764
55010010010010010010010010010010051
55010010010010010010010010010086
55010010010010010010010010091
59410010010010010010010093
310010010010010010010010097
210010010010010010010097
A1009810010010010097
K1009610010010097
J1006510010096
Q1009910087
71007059
67899
4100
jogar a mais altajogar a do meiojogar a mais baixa
Prancha IV Dados reais — 11x11 v4, saída da mão, bloco L = 4: cada mão exata cuja carta mais fraca é um 4. 23 destas 87 células misturam; o número é a maior fatia, e o tratamento ≈ marcaria qualquer célula subtreinada (este bloco não tem nenhuma).

Arrumação, para fatias minúsculas não parecerem ruído: uma ação exibida abaixo de 3% que também perde mais de 1 pp de equity de partida é descartada e o resto renormalizado. O export guarda a mistura crua — o gráfico só é mais arrumado que os decimais crus.

§ 2

Range — quem realmente chega

Um range é toda mão que um jogador ainda pode ter numa decisão, cada uma pesada por quão frequentemente ela de fato está aqui. Esse peso é a aritmética de Bayes: comece por quão frequentemente a distribuição produz a mão, depois multiplique σ para cada ação observada da linha. O gráfico normaliza esses pesos em fatias do range que chega.

P(h)  =  w(h)hw(h)w(h)    P0(h)dσ(adh)\begin{aligned} P(h \mid \ell) \;&=\; \frac{w(h)}{\sum_{h'} w(h')} \\[10pt] w(h) \;&\propto\; P_0(h) \prod_{d \,\in\, \ell} \sigma(a_d \mid h) \end{aligned}
P0(h)P_0(h)
com que frequência a distribuição produz h
\ell
a linha de jogo observada até aqui
dd
uma decisão observada ao longo de ℓ
w(h)w(h)
o peso de chegada de h — enviado por nó no export

O export traz w(h) pré-calculado por nó — o lab só normaliza e sombreia.

É por isso que ranges se movem conforme você percorre. Cada decisão multiplica mais um σ, e mãos que raramente teriam jogado a linha observada escorrem para fora do quadro — mãos de desistir somem depois de um aceite, mãos fracas somem depois de uma saída confiante. A árvore de brinquedo do capítulo de resolução é o caso mínimo: um truco do pé repesa na hora o range dele para dois terços de manilha.

Ranges se conquistam, não se recebem — cada ação que um jogador atravessa filtra o que ele ainda pode ter.

alta \ baixa555532AKJQ764
50.2%0.2%0.2%0.6%0.6%0.6%0.6%0.6%0.6%0.6%0.2%0.3%
50.2%0.2%0.6%0.6%0.6%0.6%0.6%0.6%0.6%0.2%0.3%
50.2%0.6%0.6%0.6%0.6%0.6%0.6%0.6%0.2%0.3%
50.6%0.6%0.6%0.6%0.6%0.6%0.6%0.2%0.3%
31%3%3%3%3%3%3%1%1%
21%3%3%3%3%3%1%1%
A1%3%3%3%3%1%1%
K1%3%3%3%1%1%
J1%3%3%1%1%
Q1%3%1%1%
71%1%1%
60.2%0.5%
40.2%
Prancha V Dados reais — 11x11 v4 : 4 6 — pé respondeu o 4 da mão com um 6 e agora sai na rodada 2. Cada célula é um par exato de cartas restantes; o % é sua fatia do range que chega do pé, sombreada contra a célula mais pesada. Os pesos carregam σ(responder 6 | h): mãos que prefeririam responder diferente ficam pálidas.
§ 3

Custo — o preço de um hábito

O Custo precifica erros em vez de descrever a mistura. Para cada mão ele enfileira o valor das ações disponíveis — v(a) — e cobra a diferença entre a melhor ação e a que o seu hábito toma. PIOR AÇÃO precifica o maior erro à disposição; MAIS JOGADA precifica o hábito mais brando de tomar sempre a ação mais jogada da solução em vez de misturar.

Δworst(h)  =  maxaPv(a)    minaPv(a)Δplayed(h)  =  maxaPv(a)    v(a)\begin{aligned} \Delta_{\mathrm{worst}}(h) \;&=\; \max_{a \in \mathcal{P}} v(a) \;-\; \min_{a \in \mathcal{P}} v(a) \\[8pt] \Delta_{\mathrm{played}}(h) \;&=\; \max_{a \in \mathcal{P}} v(a) \;-\; v(a^{\star}) \end{aligned}vpts(a)  =  pts(a)vwin(a)  =  50q(a)v_{\mathrm{pts}}(a) \;=\; \mathrm{pts}(a) \qquad\qquad v_{\mathrm{win}}(a) \;=\; 50\, q(a)
P\mathcal{P}
o pool de ações: todas, ou só as jogadas abertas sob IGNORAR ESCONDIDAS
v(a)v(a)
o valor de uma ação na moeda escolhida (pontos ou pp de vitória)
q(a)q(a)
a equity de partida do solver após a ação, na escala ±1 (50 pp por unidade)
aa^{\star}
a ação mais jogada da mistura

Duas moedas: pontos da mão — os 1 · 3 · 6 · 9 · 12 em jogo nesta mão — ou pontos percentuais de vitória na partida, em que a equity q do solver (±1) converte a 50 pp por unidade: % de vitória = 50 + 50 q.

Células escuras são onde a disciplina paga; células claras perdoam quase qualquer hábito.

L = 4
H \ M55532AKJQ764
50.97.7151731363529221715·
50.47.31126333227211614·
50.24.5222930262015130.1
52.0172627241914130.1
3133.612171714109.40.2
29.52.37.29.98.96.96.50.1
A6.81.74.25.44.54.30.1
K4.61.12.32.52.60.1
J2.70.51.01.4·
Q1.40.30.5·
70.5··
6··
4·
Prancha VI Dados reais — o mesmo bloco da figura de Estratégia (11x11 v4, saída, L = 4), precificado com PIOR AÇÃO em pp de vitória, IGNORAR ESCONDIDAS ligado. Células '·' são planas de custo: qualquer carta serve. As escuras são as mãos onde um hábito preguiçoso sangra de verdade — compare com as misturas acima.
§ 4

Comparar — mesma decisão, outro ponto

O Comparar carrega a mesma decisão de um segundo ponto resolvido e colore a discordância. Em decisões de aposta — a mão de onze, um truco pendente — cada célula mostra o gap de aceite com sinal: verde onde o outro ponto aceita mais, vermelho onde desiste mais. Em decisões de carta mostra a distância de variação total: a fatia do jogo que precisaria se mover para transformar uma mistura na outra, de 0 (idênticas) a 100 (opostas).

Δaccept(h)  =  σ(accepth)    σ(accepth)\Delta_{\mathrm{accept}}(h) \;=\; \sigma'(\mathrm{accept} \mid h) \;-\; \sigma(\mathrm{accept} \mid h)TV(h)  =  12aσ(ah)σ(ah)\mathrm{TV}(h) \;=\; \tfrac{1}{2} \sum_{a} \bigl|\, \sigma'(a \mid h) - \sigma(a \mid h) \,\bigr|
σ\sigma'
a mistura da mesma decisão no ponto comparado

σ′ é a mistura do outro ponto. A célula escolhe Δaceite exatamente quando a decisão oferece aceitar / desistir; caso contrário, TV.

Se o Comparar acende, o placar mudou o jogo — não carregue um gráfico de um placar para outro.

L = 4
H \ M55532AKJQ764
5···········89
51·········82
55········65
545·······55
3···77422283325
2·141181315158
A·362232742
K·35132411
J·2225··
Q1279876
7198283
6573
4·
Prancha VII Dados reais — a saída depois do aceite, mão a 10 (11x10 v4) contra mão a 2 (11x2 v4), bloco L = 4. O dourado marca mãos que a mão atrás no placar joga diferente. No próprio aceite da mão de onze essa comparação fica quase em branco — entre esses placares o limiar de aceite quase não se move.
§ 5

Os seletores da barra

Os seletores da barra não trocam a maquinaria — trocam qual pergunta o Custo responde, e quais ações contam.

Pontos
precifica o CUSTO em pontos da mão — os 1 · 3 · 6 · 9 · 12 em jogo nesta mão — em vez de equity da partida. Bom para intuição; a equity segue sendo a régua real, porque os mesmos pontos valem diferente em placares diferentes. v=pts(a)v = \mathrm{pts}(a) · v=50q(a)v = 50\,q(a)
Ignorar escondidas
mantém jogadas encobertas fora do pool de melhor/pior do Custo sempre que existe uma jogada aberta, então o número precifica qual carta você escolhe, não se você a esconde. Desligue para precificar a própria decisão de esconder. A ação mais jogada da mistura ainda pode ser uma escondida — só o pool é filtrado.
Mais jogada
a base padrão do CUSTO: o que você perde jogando sempre a única ação mais jogada em vez da mistura verdadeira. maxPvv(a)\max_{\mathcal{P}} v - v(a^{\star})
Pior ação
a base adversarial: o que a ação disponível mais cara perde — o tamanho do pior erro possível em cada célula. maxPvminPv\max_{\mathcal{P}} v - \min_{\mathcal{P}} v