Teorema de Bayes / Explorador de Falsos Positivos

cómo la prevalencia cambia la fiabilidad de un resultado positivo

Cargando simulación interactiva...

por qué la precisión es solo la mitad de la historia 🖖

La sensibilidad y la especificidad describen el test; la prevalencia describe a la población antes de realizar el test. El teorema de Bayes combina ambas cosas. Cuando la prevalencia es baja, incluso una tasa de falsos positivos pequeña puede generar muchas falsas alarmas, porque la mayoría de las personas analizadas no tienen la enfermedad. Por eso un resultado positivo en un cribado suele necesitar confirmación, mientras que el mismo test puede ser muy convincente en un grupo de alto riesgo.

una prueba actualiza una creencia, no la reemplaza 🖖

El teorema de Bayes es una regla para cambiar de opinión ante la evidencia. Se parte de una probabilidad a priori —tu mejor estimación antes de la prueba, que aquí es la prevalencia— y el resultado la desplaza hacia arriba o hacia abajo hasta una probabilidad a posteriori. Un único positivo rara vez te lleva directo a la certeza; multiplica tus probabilidades iniciales en lugar de sobrescribirlas. La lección: antes de fiarte de un resultado, pregunta primero qué tan probable era el hecho de entrada.

la misma trampa llevó a alguien a prisión 🖖

Confundir P(positivo | enfermedad) con P(enfermedad | positivo) tiene un nombre en los tribunales: la falacia del fiscal. En el juicio de Sally Clark en 1999, el jurado oyó que dos muertes súbitas del lactante en una familia tenían una probabilidad de 1 entre 73 millones y lo tomó como la probabilidad de que ella fuera inocente. Son cifras distintas: la segunda ignora lo rara que también es la alternativa (un doble asesinato). Su condena fue anulada en 2003 y la Royal Statistical Society condenó públicamente el error.

BAYES — UN RESULTADO POSITIVO NO ES LO MISMO QUE TENER LA ENFERMEDAD

¿Qué caso de cribado estás leyendo?

Tres números deciden qué significa un test positivo: cuán común es la condición, con qué frecuencia el test la detecta y con qué frecuencia da la voz de alarma en falso. La sensibilidad y la especificidad describen el test; la prevalencia describe a la población, y suele ser la prevalencia la que hace el daño. Trabaja en frecuencias naturales en vez de porcentajes y la respuesta deja de ser contraintuitiva: imagina 1000 personas, cuenta los verdaderos positivos, cuenta los falsos y compara.

Condición rara, test excelente — la mayoría de positivos siguen siendo falsos PPV ≈ 9%
Condición común — la prevalencia rescata a un test más flojo PPV ≈ 51%
Prevalencia moderada — y cuánto vale un negativo PPV ≈ 60%, NPV ≈ 99%
Sensibilidad alta, especificidad mediocre — el mando equivocado PPV ≈ 29%

01

Condición rara, test excelente — la mayoría de positivos siguen siendo falsos

Qué sabes: Prevalencia 0,1 %, sensibilidad 99 %, especificidad 99 %. El test es todo lo bueno que llegan a ser; la condición es de verdad rara.

Resultado: PPV ≈ 9%

Ejemplo resuelto: De 10 000 personas: 10 la tienen y unas 10 dan positivo; 9990 no la tienen y 100 dan positivo igualmente → VPP = 10/110 ≈ 9 %

Abrir este caso: enfermedad rara, test preciso
Condición rara, test excelente — la mayoría de positivos siguen siendo falsos. Diez positivos verdaderos enterrados entre cien falsos: gana la tasa base. Prevalencia 0,1 %, sensibilidad 99 %, especificidad 99 %. El test es todo lo bueno que llegan a ser; la condición es de verdad rara.
Diez positivos verdaderos enterrados entre cien falsos: gana la tasa base.

02

Condición común — la prevalencia rescata a un test más flojo

Qué sabes: Prevalencia 10 %, sensibilidad 95 %, especificidad 90 %. Un test claramente peor, aplicado donde la condición sí es frecuente.

Resultado: PPV ≈ 51%

Ejemplo resuelto: De 1000 personas: 100 la tienen y 95 dan positivo; 900 no y 90 dan positivo → VPP = 95/185 ≈ 51 %

Abrir este caso: enfermedad más común
Condición común — la prevalencia rescata a un test más flojo. La misma aritmética con diez veces la prevalencia: ahora un positivo es casi cara o cruz. Prevalencia 10 %, sensibilidad 95 %, especificidad 90 %. Un test claramente peor, aplicado donde la condición sí es frecuente.
La misma aritmética con diez veces la prevalencia: ahora un positivo es casi cara o cruz.

03

Prevalencia moderada — y cuánto vale un negativo

Qué sabes: Prevalencia 5 %, sensibilidad 85 %, especificidad 97 %: la forma de un test rápido de antígenos durante un brote.

Resultado: PPV ≈ 60%, NPV ≈ 99%

Ejemplo resuelto: De 1000: 50 infectados, 43 detectados y 7 perdidos; 950 sanos, 29 marcados por error → VPP = 43/72 ≈ 60 % y VPN = 922/929 ≈ 99 %

Abrir este caso: similar a la covid
Prevalencia moderada — y cuánto vale un negativo. Un positivo es cara o cruz con un empujón; un negativo está casi zanjado. Prevalencia 5 %, sensibilidad 85 %, especificidad 97 %: la forma de un test rápido de antígenos durante un brote.
Un positivo es cara o cruz con un empujón; un negativo está casi zanjado.

04

Sensibilidad alta, especificidad mediocre — el mando equivocado

Qué sabes: Prevalencia 2 %, sensibilidad 99 %, especificidad 95 %. Casi nadie que consuma se escapa, pero se acusa a uno de cada veinte sanos.

Resultado: PPV ≈ 29%

Ejemplo resuelto: De 1000: 20 consumidores, 20 detectados; 980 no consumidores, 49 marcados igualmente → VPP = 20/69 ≈ 29 %, así que siete de cada diez positivos son inocentes

Abrir este caso: control antidopaje
Sensibilidad alta, especificidad mediocre — el mando equivocado. Veinte consumidores reales frente a cuarenta y nueve acusaciones falsas: lo que hay que arreglar es la especificidad. Prevalencia 2 %, sensibilidad 99 %, especificidad 95 %. Casi nadie que consuma se escapa, pero se acusa a uno de cada veinte sanos.
Veinte consumidores reales frente a cuarenta y nueve acusaciones falsas: lo que hay que arreglar es la especificidad.
Referencias (1)

Problema resuelto al detalle

  1. Un segundo resultado positivo para una prevalencia del 0,1% 5 pasos

    Un segundo resultado positivo. Se trata de una prevalencia del 0,1% con una sensibilidad del 99% y una especificidad del 99%: una afección rara y una prueba excelente, en la que un único positivo constituye, como es bien sabido, una evidencia débil. Calcule cuánto vale un segundo positivo independiente.

    1. La razón de posibilidades (odds), y no la probabilidad, es la forma en que se multiplica la evidencia. Una persona de cada mil padece la afección, por lo que la posición de partida es de 1 contra 999; y es ese 999, y no ninguno de los selectores, el que causa el perjuicio.

    2. La razón de verosimilitud compara con qué frecuencia se obtiene un positivo en cada grupo. Ambas cifras proceden de los selectores: el 99% de quienes padecen la afección dan positivo en la prueba, y una especificidad del 99% deja a un 1% del resto dando positivo también.

    3. Multiplicar la razón de posibilidades a priori por la razón de verosimilitud es todo el teorema de Bayes en esta formulación, y unos odds de a contra b se reconvierten como a/(a+b). Un factor de 99 constituye una evidencia enorme, y aun así pierde, porque empezó 999 por detrás.

    4. Una segunda prueba comienza donde terminó la primera: la probabilidad a posteriori de un resultado es la a priori del siguiente. Nada en la prueba en sí ha cambiado, por lo que se aplica el mismo factor de 99, esta vez sobre unos odds que ya no son desesperanzadores.

    5. Ese paso asumía que los dos positivos son independientes, que es exactamente lo que no se obtiene al repetir la misma prueba. Si lo que marcó a una persona sana la primera vez (una proteína con reacción cruzada, una muestra mal etiquetada) vuelve a marcarla la mitad de las veces, los falsos positivos apenas se reducen.

    Respuesta

    La herramienta muestra un 9,0% para un solo positivo, a partir de una sustitución que da como resultado 0,090164 (el mismo 99/1098). Dos positivos independientes elevan la cifra al 90,75% y tres al 99,90%, porque el factor de 99 se aplica cada vez, mientras que la probabilidad a priori de 999 a 1 solo se paga una vez. Esa es la aritmética que subyace a las pruebas de confirmación, y el paso 5 es su letra pequeña: una repetición correlacionada se queda en el 16,4%, apenas más convincente que el resultado único que debía confirmar. Por lo tanto, la segunda prueba tiene que fallar de forma distinta a la primera (una molécula diana diferente, un laboratorio diferente, un mecanismo diferente) o la multiplicación será una ficción. El número que conviene recordar es 99: la sensibilidad dividida por la tasa de falsos positivos constituye todo el peso probatorio de un test, y actúa como multiplicador sobre los odds más que como una respuesta en sí.

Ruta de aprendizaje

Las probabilidades a priori y de dónde provienen

Lleva a El billar de Bayes la actualización cuando todos los datos son medibles.

Problemas de ejemplo