índice de la guía
Baixada · Estudio · Guía de campoParte I · La solución, y cómo leerla
Capítulo v

Las cuatro vistas

Cada celda del lab responde una de cuatro preguntas sobre la misma decisión resuelta: qué hace la solución acá (Estrategia), qué manos llegan de verdad hasta acá (Rango), cuánto costaría un hábito fijo (Costo) y cómo cambia el juego entre dos puntos (Comparar). La tabla da las cuatro de un vistazo; las secciones de abajo las toman de a una — primero la fórmula, después una figura de celdas resueltas reales, dibujada con los mismos componentes del lab.

§

Las cuatro vistas de un vistazo

VistaQué muestra el númeroFórmulaPara tu juego
Estrategiala porción de cada acción en la mezcla — las bandas de color; el número impreso es la porción más grandeσ(ah)\sigma(a \mid h)Cuando la celda mezcla, mezclá vos también: un hábito fijo en un punto de mezcla es justo lo que un lector explota.
Rangola porción de cada mano dentro del rango que llega del jugador en turno; el sombreado sigue a la celda más pesadaP(h)P0(h)σP(h \mid \ell) \propto P_0(h)\,\textstyle\prod \sigmaLos rangos se ganan, no se reparten — cada acción que un jugador atraviesa filtra lo que todavía puede tener.
Costocuánto resigna el hábito tasado frente a la mejor acción disponible, mano por manomaxav(a)v()\max_{a} v(a) - v(\cdot)Las celdas oscuras son donde la disciplina paga; las claras perdonan casi cualquier hábito.
Compararcuánto se corre la misma decisión entre dos puntos resueltos — brecha de aceptar en las apuestas, variación total en el restoΔσaccept  /  TV(σ,σ)\Delta\sigma_{\mathrm{accept}} \;/\; \mathrm{TV}(\sigma, \sigma')Si Comparar se enciende, el marcador cambió el juego — no lleves un gráfico de un marcador a otro.
§ 1

Estrategia — la mezcla misma

Fijá una mano y la respuesta de la solución no es una carta: es una probabilidad para cada acción legal: σ(a | h), la estrategia promedio en esta decisión. La celda dibuja esa mezcla como bandas de color, cada una tan ancha como la porción de su acción, e imprime solo la porción más grande como número. La mezcla completa está siempre a un hover — el tooltip y el panel de la mano abren cada acción; el número solo, nunca.

ncell=100maxaσ(ah)n_{\mathrm{cell}} = 100 \cdot \max_{a}\, \sigma(a \mid h)
hh
una mano exacta
σ(ah)\sigma(a \mid h)
qué tan seguido la solución toma la acción a con h

El número impreso es la porción modal de la mezcla mostrada. Cada celda es una mano exacta, así que las bandas son el σ de esa mano — nada se agrega.

Cuando la celda mezcla, mezclá vos también: un hábito fijo en un punto de mezcla es justo lo que un lector explota.

L = 4
H \ M55532AKJQ764
55010010010010010010010010010010051
55010010010010010010010010010086
55010010010010010010010010091
59410010010010010010010093
310010010010010010010010097
210010010010010010010097
A1009810010010010097
K1009610010010097
J1006510010096
Q1009910087
71007059
67899
4100
jugar la más altajugar la del mediojugar la más baja
Lámina IV Datos reales — 11x11 v4, salida de la mano, bloque L = 4: cada mano exacta cuya carta más débil es un 4. 23 de estas 87 celdas mezclan; el número es la porción más grande, y el tratamiento ≈ marcaría cualquier celda subentrenada (este bloque no tiene ninguna).

Orden, para que las porciones diminutas no parezcan ruido: una acción mostrada por debajo del 3% que además pierde más de 1 pp de equity de partida se descarta y el resto se renormaliza. El export guarda la mezcla cruda — el gráfico solo es más prolijo que los decimales crudos.

§ 2

Rango — quién llega de verdad

Un rango es cada mano que un jugador todavía puede tener en una decisión, pesada por qué tan seguido de verdad está acá. Ese peso es la aritmética de Bayes: arrancá por qué tan seguido el reparto produce la mano, y multiplicá σ por cada acción observada de la línea. El gráfico normaliza esos pesos en porciones del rango que llega.

P(h)  =  w(h)hw(h)w(h)    P0(h)dσ(adh)\begin{aligned} P(h \mid \ell) \;&=\; \frac{w(h)}{\sum_{h'} w(h')} \\[10pt] w(h) \;&\propto\; P_0(h) \prod_{d \,\in\, \ell} \sigma(a_d \mid h) \end{aligned}
P0(h)P_0(h)
qué tan seguido el reparto produce h
\ell
la línea de juego observada hasta acá
dd
una decisión observada a lo largo de ℓ
w(h)w(h)
el peso de llegada de h — enviado por nodo en el export

El export trae w(h) precalculado por nodo — el lab solo normaliza y sombrea.

Por eso los rangos se mueven a medida que recorrés. Cada decisión multiplica otro σ, y las manos que rara vez habrían jugado la línea observada se escurren del cuadro — las manos de retirarse desaparecen después de un aceptar, las manos débiles desaparecen después de una salida confiada. El árbol de juguete del capítulo de resolución es el caso mínimo: un truco de pie repesa al instante su rango a dos tercios de manilha.

Los rangos se ganan, no se reparten — cada acción que un jugador atraviesa filtra lo que todavía puede tener.

alta \ baja555532AKJQ764
50.2%0.2%0.2%0.6%0.6%0.6%0.6%0.6%0.6%0.6%0.2%0.3%
50.2%0.2%0.6%0.6%0.6%0.6%0.6%0.6%0.6%0.2%0.3%
50.2%0.6%0.6%0.6%0.6%0.6%0.6%0.6%0.2%0.3%
50.6%0.6%0.6%0.6%0.6%0.6%0.6%0.2%0.3%
31%3%3%3%3%3%3%1%1%
21%3%3%3%3%3%1%1%
A1%3%3%3%3%1%1%
K1%3%3%3%1%1%
J1%3%3%1%1%
Q1%3%1%1%
71%1%1%
60.2%0.5%
40.2%
Lámina V Datos reales — 11x11 v4 : 4 6 — pie respondió el 4 de mano con un 6 y ahora sale en la ronda 2. Cada celda es un par exacto de cartas restantes; el % es su porción del rango que llega de pie, sombreada contra la celda más pesada. Los pesos cargan σ(responder 6 | h): las manos que hubieran preferido responder distinto quedan pálidas.
§ 3

Costo — el precio de un hábito

El Costo tasa errores en vez de describir la mezcla. Para cada mano alinea cuánto valen las acciones disponibles — v(a) — y cobra la brecha entre la mejor acción y la que toma tu hábito. PEOR ACCIÓN tasa el error más grande disponible; MÁS JUGADA tasa el hábito más suave de tomar siempre la acción más jugada de la solución en vez de mezclar.

Δworst(h)  =  maxaPv(a)    minaPv(a)Δplayed(h)  =  maxaPv(a)    v(a)\begin{aligned} \Delta_{\mathrm{worst}}(h) \;&=\; \max_{a \in \mathcal{P}} v(a) \;-\; \min_{a \in \mathcal{P}} v(a) \\[8pt] \Delta_{\mathrm{played}}(h) \;&=\; \max_{a \in \mathcal{P}} v(a) \;-\; v(a^{\star}) \end{aligned}vpts(a)  =  pts(a)vwin(a)  =  50q(a)v_{\mathrm{pts}}(a) \;=\; \mathrm{pts}(a) \qquad\qquad v_{\mathrm{win}}(a) \;=\; 50\, q(a)
P\mathcal{P}
el pool de acciones: todas, o solo las jugadas boca arriba bajo IGNORAR OCULTAS
v(a)v(a)
el valor de una acción en la moneda elegida (puntos o pp de victoria)
q(a)q(a)
la equity de partida del solver tras la acción, en escala ±1 (50 pp por unidad)
aa^{\star}
la acción más jugada de la mezcla

Dos monedas: puntos de la mano — los 1 · 3 · 6 · 9 · 12 en juego en esta mano — o puntos porcentuales de victoria en la partida, donde la equity q del solver (±1) convierte a 50 pp por unidad: % de victoria = 50 + 50 q.

Las celdas oscuras son donde la disciplina paga; las claras perdonan casi cualquier hábito.

L = 4
H \ M55532AKJQ764
50.97.7151731363529221715·
50.47.31126333227211614·
50.24.5222930262015130.1
52.0172627241914130.1
3133.612171714109.40.2
29.52.37.29.98.96.96.50.1
A6.81.74.25.44.54.30.1
K4.61.12.32.52.60.1
J2.70.51.01.4·
Q1.40.30.5·
70.5··
6··
4·
Lámina VI Datos reales — el mismo bloque de la figura de Estrategia (11x11 v4, salida, L = 4), tasado con PEOR ACCIÓN en pp de victoria, con IGNORAR OCULTAS prendido. Las celdas '·' son planas de costo: cualquier carta sirve. Las oscuras son las manos donde un hábito perezoso sangra en serio — comparalas con sus mezclas de arriba.
§ 4

Comparar — misma decisión, otro punto

Comparar carga la misma decisión desde un segundo punto resuelto y colorea el desacuerdo. En decisiones de apuesta — la mano de once, un truco pendiente — cada celda muestra la brecha de aceptar con signo: verde donde el otro punto acepta más, rojo donde se retira más. En decisiones de carta muestra la distancia de variación total: la porción del juego que tendría que moverse para convertir una mezcla en la otra, de 0 (idénticas) a 100 (opuestas).

Δaccept(h)  =  σ(accepth)    σ(accepth)\Delta_{\mathrm{accept}}(h) \;=\; \sigma'(\mathrm{accept} \mid h) \;-\; \sigma(\mathrm{accept} \mid h)TV(h)  =  12aσ(ah)σ(ah)\mathrm{TV}(h) \;=\; \tfrac{1}{2} \sum_{a} \bigl|\, \sigma'(a \mid h) - \sigma(a \mid h) \,\bigr|
σ\sigma'
la mezcla de la misma decisión en el punto comparado

σ′ es la mezcla del otro punto. La celda elige Δaceptar exactamente cuando la decisión ofrece aceptar / retirarse; si no, TV.

Si Comparar se enciende, el marcador cambió el juego — no lleves un gráfico de un marcador a otro.

L = 4
H \ M55532AKJQ764
5···········89
51·········82
55········65
545·······55
3···77422283325
2·141181315158
A·362232742
K·35132411
J·2225··
Q1279876
7198283
6573
4·
Lámina VII Datos reales — la salida después del aceptar, mano a 10 (11x10 v4) contra mano a 2 (11x2 v4), bloque L = 4. El dorado marca manos que la mano que va perdiendo juega distinto. En el propio aceptar de la mano de once esta comparación queda casi en blanco — entre esos marcadores el umbral de aceptar casi no se mueve.
§ 5

Los selectores de la barra

Los selectores de la barra no cambian la maquinaria — cambian qué pregunta responde el Costo, y qué acciones cuentan.

Puntos
tasa el COSTO en puntos de la mano — los 1 · 3 · 6 · 9 · 12 en juego en esta mano — en vez de equity de la partida. Sirve para la intuición; la equity sigue siendo la vara real, porque los mismos puntos valen distinto según el marcador. v=pts(a)v = \mathrm{pts}(a) · v=50q(a)v = 50\,q(a)
Ignorar ocultas
deja las jugadas tapadas fuera del pool de mejor/peor del Costo siempre que exista una jugada boca arriba, así el número tasa qué carta elegís, no si la tapás. Apagalo para tasar la propia decisión de tapar. La acción más jugada de la mezcla todavía puede ser una tapada — solo se filtra el pool.
Más jugada
la base por defecto del COSTO: lo que perdés jugando siempre la única acción más jugada en vez de la mezcla verdadera. maxPvv(a)\max_{\mathcal{P}} v - v(a^{\star})
Peor acción
la base adversarial: lo que pierde la acción disponible más cara — el tamaño del peor error posible en cada celda. maxPvminPv\max_{\mathcal{P}} v - \min_{\mathcal{P}} v