Lectura

Epidemiología, estadística y sesgos: cómo leer un artículo dermatológico sin confundir asociación con efecto ni significación con relevancia

Estado en los registros: Validación incompletaRevisión clínica comunicada por el responsable: realizada para el contenido actualFecha de revisión clínica no registrada en los metadatos
Inicio del contenido clínico
Lectura clínica · Lectura crítica de la literatura

Epidemiología, estadística y sesgos: cómo leer un artículo dermatológico sin confundir asociación con efecto ni significación con relevancia

Sobre las secciones «Epidemiologic definitions» · «Epidemiologic principles» · «Types of studies» · «Types of bias» (capítulo 11, Epidemiology, Statistics, Study Design, Public Health Principles, and Billing) · Alikhan y Hocker, 2.ª ed., 2024

Un valor de p, una odds ratio o una sensibilidad del 95 % no dicen nada hasta que se sabe de qué diseño salen, sobre qué población y frente a qué comparador. Esta lectura ordena las medidas por la pregunta que contestan (cuánta enfermedad hay, cuánto vale una prueba, cuánto efecto tiene un tratamiento, cuánto puede deberse al azar) y repasa los sesgos que más desvían la literatura dermatológica.

Prevalencia y valores predictivosRiesgo relativo, odds ratio y NNTError tipo I y tipo IIDiseños y certeza de la evidenciaSesgos y confusión

Obra de referencia: Ali Alikhan y Thomas L. H. Hocker (eds.), Review of Dermatology, 2.ª ed. (Elsevier, 2024). Síntesis editorial DermRX actualizada a octubre de 2026 · Revisión clínica individual pendiente · 19 min de lectura.

Decisiones esenciales

En 20 segundos

  • Prevalencia son los casos existentes en un momento dado e incidencia los casos nuevos en un periodo; una enfermedad crónica y poco letal, como la psoriasis, acumula una prevalencia alta con una incidencia baja.
  • Sensibilidad y especificidad describen la prueba; los valores predictivos describen la prueba aplicada a una población concreta y cambian con la prevalencia: el mismo positivo vale mucho en una consulta monográfica y poco en un cribado.
  • El riesgo relativo y la odds ratio dicen cuántas veces más frecuente es un desenlace; la diferencia absoluta de riesgos y su inverso, el número necesario a tratar (NNT), dicen cuántos pacientes se benefician. La decisión clínica se toma con las medidas absolutas.
  • El error tipo I (α) es declarar una diferencia que no existe y el tipo II (β) es no detectar una que existe; la potencia es 1 − β. Un resultado no significativo en un estudio pequeño no demuestra ausencia de efecto.
  • Cada diseño trae su sesgo: recuerdo y selección de controles en casos y controles, confusión y pérdidas en cohortes, adelanto diagnóstico en cribado. Solo la aleatorización equilibra también los factores no medidos.
Lo que merece la pena retener

Claves de la lectura

1

Cada medida responde a una pregunta distinta

Antes de interpretar una cifra conviene identificar la pregunta: frecuencia (prevalencia, incidencia), validez de una prueba (sensibilidad, especificidad, valores predictivos), magnitud de un efecto (riesgo relativo, odds ratio, diferencia de riesgos, NNT) o papel del azar (p, intervalo de confianza). Casi todas salen de la misma tabla de dos por dos, que cruza la exposición o el resultado de la prueba con la presencia o ausencia del desenlace; cambia qué casilla se divide entre qué.

2

La prevalencia de la consulta decide el valor de un positivo

Una prueba con sensibilidad y especificidad del 90 % aplicada donde la enfermedad afecta al 1 % acierta en 8 de cada 100 positivos; donde afecta al 30 %, en 79 de cada 100. Por eso un anticuerpo o un algoritmo validados en un centro de referencia rinden peor en atención primaria, y por eso pedir pruebas sin sospecha clínica genera sobre todo falsos positivos. El valor predictivo negativo se comporta al revés: es máximo cuando la enfermedad es rara.

3

Lo relativo impresiona, lo absoluto decide

Pasar del 2 % al 12 % de respuesta y pasar del 20 % al 70 % no son equiparables aunque el primero multiplique por 6 y el segundo por 3,5: en el primer caso hay que tratar a 10 pacientes para lograr una respuesta adicional y en el segundo a 2. El NNT es el inverso de la diferencia absoluta de riesgos y solo tiene sentido con su comparador, su desenlace y su horizonte temporal. El mismo cálculo aplicado a un efecto adverso da el número necesario para dañar (NNH).

4

La odds ratio no es un riesgo relativo

El estudio de casos y controles parte del desenlace y no conoce la incidencia, de modo que solo puede dar una odds ratio. Esta se aproxima al riesgo relativo cuando el desenlace es raro; cuando es frecuente lo exagera: un desenlace presente en el 60 % de los expuestos y en el 30 % de los no expuestos tiene un riesgo relativo de 2 y una odds ratio de 3,5. La regresión logística también devuelve odds ratios aunque el estudio sea una cohorte o un ensayo.

5

Significativo no es relevante; no significativo no es nulo

La p indica cuán compatibles son los datos con la hipótesis nula y con el resto de supuestos del análisis; no es la probabilidad de que la hipótesis nula sea cierta ni mide el tamaño del efecto. Un estudio enorme vuelve significativa una diferencia sin interés clínico y uno pequeño deja sin significación un efecto real. El intervalo de confianza informa mejor: muestra magnitud y precisión, y deja ver si sus límites incluyen efectos clínicamente importantes.

6

Cuantas más comparaciones, más falsos positivos

Con un umbral de 0,05 por contraste, tres comparaciones independientes elevan al 14 % la probabilidad de al menos un falso positivo y veinte la llevan al 64 %. Desenlaces secundarios, subgrupos y análisis no preespecificados se leen como generadores de hipótesis salvo que exista corrección por multiplicidad o una jerarquía de contrastes declarada en el protocolo. El desenlace principal registrado antes de empezar es el que conserva el error tipo I nominal.

7

El diseño fija el techo de la inferencia causal

Series de casos y estudios transversales describen y generan señales; casos y controles y cohortes analizan asociaciones, con la secuencia temporal mejor resuelta en la cohorte; el ensayo aleatorizado reparte por azar los factores pronósticos conocidos y desconocidos, y el metanálisis de ensayos de calidad gana precisión. La jerarquía no es automática: un ensayo con pérdidas desiguales o sin enmascaramiento puede valer menos que una buena cohorte, y un metanálisis hereda los defectos de lo que combina.

8

Sesgo, confusión y azar son tres problemas diferentes

El azar se reduce con tamaño muestral. El sesgo, error sistemático de selección o de medida, no se corrige con más pacientes ni con estadística: se previene en el diseño (aleatorización, enmascaramiento, definiciones objetivas, seguimiento completo). La confusión es una tercera variable asociada a la exposición, causa independiente del desenlace y ajena a la vía causal; se atenúa con emparejamiento, estratificación o análisis multivariante, pero solo para lo que se ha medido.

Repaso organizado

Medida por medida y diseño por diseño: qué pregunta contesta cada uno

El repaso sigue las preguntas del lector de un artículo: cuánta enfermedad hay, cuánto vale la prueba, cuánto efecto existe, cuánto puede ser azar y de qué diseño procede el dato, con el sesgo propio de cada uno.

Frecuencia de la enfermedad

Prevalencia

Casos existentes / población
Qué mide
Proporción de la población que tiene la enfermedad en un momento (puntual) o a lo largo de un periodo. Depende de la incidencia y de la duración: aumenta con las enfermedades largas y con los tratamientos que prolongan la vida sin curar.
Para qué sirve
Se obtiene de estudios transversales. Permite planificar recursos y actúa como probabilidad previa al interpretar una prueba; no informa de causas.

Incidencia acumulada y tasa de incidencia

Casos nuevos / población en riesgo
Incidencia acumulada
Proporción de personas libres de enfermedad al inicio que la desarrollan en un periodo determinado. Es un riesgo y carece de sentido si no se indica ese periodo.
Tasa de incidencia
Casos nuevos divididos por el tiempo en riesgo acumulado (personas-año). Es la medida adecuada cuando el seguimiento difiere entre participantes, como en los registros de fármacos.
Diseño
Exige seguimiento: cohorte o ensayo.

Precisión y validez de una medición

Fiabilidad frente a exactitud
Precisión
Consistencia de las mediciones repetidas (fiabilidad): variabilidad intra e interobservador de una escala como el Índice de Extensión y Gravedad de la Psoriasis (PASI).
Validez
Proximidad de la medición a la verdad (exactitud). Una medida puede ser muy reproducible y estar desviada de forma sistemática.

Valor de una prueba diagnóstica

Sensibilidad

Positivos entre los enfermos
Definición
Proporción de enfermos con resultado positivo: verdaderos positivos / (verdaderos positivos + falsos negativos).
Uso
Una prueba muy sensible sirve para descartar: deja pocos falsos negativos y un resultado negativo hace improbable la enfermedad. Es lo que se exige a un cribado.

Especificidad

Negativos entre los sanos
Definición
Proporción de sanos con resultado negativo: verdaderos negativos / (verdaderos negativos + falsos positivos).
Uso
Una prueba muy específica sirve para confirmar: deja pocos falsos positivos y un resultado positivo hace probable la enfermedad. Es lo que se exige antes de un tratamiento agresivo.

Valores predictivos positivo y negativo

Dependen de la prevalencia
Positivo
Proporción de resultados positivos que corresponden a enfermos: verdaderos positivos / todos los positivos. Sube con la prevalencia.
Negativo
Proporción de resultados negativos que corresponden a sanos: verdaderos negativos / todos los negativos. Baja cuando la prevalencia sube.
En melanoma
El número de lesiones biopsiadas por cada melanoma diagnosticado es el inverso del valor predictivo positivo de la decisión de biopsiar. Un metanálisis halló medias ponderadas de 14,8 para el conjunto de clínicos y de 7,5 para dermatólogos.

Cocientes de probabilidad

Independientes de la prevalencia
Cálculo
Positivo: sensibilidad / (1 − especificidad). Negativo: (1 − sensibilidad) / especificidad. Con sensibilidad y especificidad del 90 % valen 9 y 0,11.
Uso
Multiplican la odds previa a la prueba para dar la posterior; trasladan el resultado a la probabilidad de cada paciente.

Magnitud del efecto o de la asociación

Riesgo relativo

Cohortes y ensayos
Cálculo
Incidencia en expuestos dividida por incidencia en no expuestos.
Lectura
El 1 indica ausencia de asociación; por encima, más riesgo; por debajo, protección. Si el intervalo de confianza al 95 % incluye el 1, los datos son compatibles con la ausencia de efecto.

Odds ratio

Casos y controles; regresión logística
Cálculo
Cociente entre la odds de exposición de los casos y la de los controles; en la tabla de dos por dos, el cociente de los productos cruzados.
Lectura
Misma escala que el riesgo relativo, pero solo lo aproxima si el desenlace es infrecuente; con desenlaces comunes se aleja del 1 más que él.

Diferencia de riesgos, NNT y NNH

Medidas absolutas
Cálculo
Diferencia de riesgos: incidencia de un grupo menos la del otro. NNT = 1 / diferencia absoluta expresada en tanto por uno, redondeado al alza.
Condiciones
Depende del riesgo basal, del comparador y de la duración: no se traslada sin más a pacientes con otro riesgo de partida, y los NNT de ensayos distintos se comparan con cautela.
En psoriasis
Se ha usado para ordenar biológicos según las respuestas PASI 75, 90 y 100 a partir de un metanálisis en red de ensayos de fase 3.

Intervalo de confianza

Magnitud y precisión
Qué expresa
Rango de valores del efecto compatibles con los datos bajo los supuestos del modelo. Su amplitud refleja la precisión y se estrecha al aumentar la muestra.
Lectura
En los cocientes el valor nulo es 1; en las diferencias, 0. Importa además si los límites alcanzan efectos clínicamente relevantes.

Azar: contraste de hipótesis

Valor de p y error tipo I

α: falso positivo
Definición
Error tipo I es rechazar la hipótesis nula cuando es cierta. El umbral α, por convención 0,05, es la probabilidad de ese error que se acepta de antemano.
Matiz
No rechazar la hipótesis nula no equivale a demostrarla.

Error tipo II y potencia

β: falso negativo; potencia = 1 − β
Definición
No rechazar la hipótesis nula cuando es falsa. La potencia es la probabilidad de detectar un efecto de una magnitud dada si existe.
De qué depende
Tamaño muestral, magnitud del efecto buscado, variabilidad y α. El cálculo debe constar antes de empezar; un estudio con poca potencia y resultado negativo no es concluyente.

Comparaciones múltiples

Inflación del error tipo I
Problema
Cada contraste adicional suma probabilidad de un falso positivo; explorar los datos hasta dar con una p pequeña lo garantiza.
Solución
Hipótesis y desenlace principal preespecificados, corrección por multiplicidad y prudencia con los subgrupos.

Diseños y su sesgo característico

Serie de casos y estudio transversal

Descriptivos
Aportan
Señales de alerta, descripción de enfermedades raras y prevalencias. Son baratos y rápidos.
Límite
Sin grupo de comparación (series) o sin secuencia temporal entre exposición y desenlace (transversal), no sostienen causalidad.

Casos y controles

Del desenlace a la exposición
Cuándo
Enfermedades raras o de latencia larga: se seleccionan enfermos y no enfermos y se busca hacia atrás la exposición.
Medida
Odds ratio; no puede calcular incidencia.
Sesgos
Recuerdo (el enfermo rememora mejor sus exposiciones) y controles que no proceden de la misma población que los casos. Se mitigan contrastando la exposición con registros clínicos.

Cohortes

De la exposición al desenlace
Cuándo
Exposiciones raras, varios desenlaces de una misma exposición y cálculo de incidencia y riesgo relativo. Prospectiva o retrospectiva sobre registros.
Sesgos
Confusión, sobre todo por indicación; pérdidas de seguimiento desiguales; tiempo inmortal cuando la exposición se define con datos posteriores al inicio del seguimiento.
Límite
Cara y lenta si es prospectiva; poco eficiente para desenlaces raros.

Ensayo clínico aleatorizado

Experimental
Fortaleza
La asignación al azar evita el sesgo de selección y equilibra los factores de confusión; el enmascaramiento evita los sesgos de realización y de detección.
Límite
Poblaciones seleccionadas, duración corta y poca potencia para efectos adversos raros: validez externa limitada.
Qué mirar
Desenlace principal registrado, análisis por intención de tratar, pérdidas por grupo y comparador.

Revisión sistemática y metanálisis

Síntesis
Fortaleza
Combina estudios para ganar precisión y explorar la consistencia entre poblaciones.
Límite
Depende de la calidad y de la homogeneidad de lo incluido y del sesgo de publicación: los resultados negativos se publican menos.

Estudios de cribado y supervivencia

Adelanto diagnóstico
Sesgo de adelanto
Diagnosticar antes alarga el tiempo que el paciente vive con el diagnóstico aunque no retrase la muerte.
Sesgo de duración
El cribado detecta sobre todo tumores de crecimiento lento, de mejor pronóstico.
Consecuencia
Un programa de detección precoz se juzga por la mortalidad, no por la supervivencia desde el diagnóstico.
Segunda mirada

Contrastes que resuelven la duda

Cinco parejas que se confunden al leer un artículo y la consecuencia práctica de distinguirlas.

Incidencia frente a prevalencia

Numerador
Casos nuevos en la incidencia; todos los casos existentes en la prevalencia.
Relación
La prevalencia crece con la incidencia y con la duración de la enfermedad.
Sirve para
Incidencia: estudiar causas y riesgos. Prevalencia: estimar carga asistencial y probabilidad previa.

Sensibilidad y especificidad frente a valores predictivos

Punto de partida
Las primeras parten del estado real (enfermo o sano); los segundos, del resultado de la prueba.
Prevalencia
Sensibilidad y especificidad no dependen de ella, aunque sí del espectro de gravedad de los pacientes estudiados; los valores predictivos cambian con ella.
Consecuencia
Para elegir una prueba se miran las primeras; para interpretar el resultado de un paciente, los segundos.

Riesgo relativo frente a odds ratio

Diseño
Riesgo relativo en cohortes y ensayos; odds ratio en casos y controles y en modelos logísticos.
Equivalencia
Coinciden aproximadamente con desenlaces raros; con desenlaces frecuentes la odds ratio se aleja más del 1.
Error habitual
Leer una odds ratio de 3 como «el triple de riesgo».

Error tipo I frente a error tipo II

Qué es
Tipo I: falso positivo del estudio. Tipo II: falso negativo.
Probabilidad
α, fijada habitualmente en 0,05; β, de la que deriva la potencia (1 − β).
Cómo se reduce
Tipo I: desenlace principal único y corrección por multiplicidad. Tipo II: más participantes o desenlaces más sensibles.

Sesgo frente a confusión

Origen
Sesgo: error sistemático al seleccionar participantes o al medir. Confusión: mezcla real de efectos con una tercera variable.
Remedio
El sesgo solo se previene en el diseño; la confusión puede además ajustarse en el análisis si la variable se midió.
Ejemplo
Sesgo de recuerdo en casos y controles; confusión por indicación cuando los pacientes más graves reciben el fármaco estudiado.
Escenarios clínicos

Qué haría en consulta

Elaboración editorial propia de DermRX: escenarios construidos al integrar la lectura con guías, consensos y fichas técnicas vigentes. No sustituyen al juicio clínico.

Si un delegado presenta un fármaco que «reduce a la mitad» las recaídas frente a placebo y no aporta las cifras de cada grupo

Pediría los porcentajes absolutos de cada brazo y el tiempo de seguimiento. Calcularía la diferencia de riesgos y el NNT: pasar del 40 % al 20 % supone tratar a 5 pacientes para evitar una recaída; pasar del 4 % al 2 %, a 50. No valoraría el dato sin conocer el comparador.

Si un paciente joven sin factores de riesgo acude alarmado porque una aplicación de análisis de imágenes ha clasificado un nevus como sospechoso

Le explicaría que, con una probabilidad previa baja, la mayoría de los positivos de cualquier prueba son falsos. Exploraría la lesión con dermatoscopia y decidiría por mis hallazgos, no por el aviso. No daría por buena la sensibilidad anunciada sin saber en qué población y frente a qué patrón de referencia se obtuvo.

Si un estudio transversal analizado con regresión logística comunica una odds ratio de 3 para un desenlace presente en casi la mitad de la muestra

No lo traduciría como un riesgo triple: con un desenlace tan frecuente la odds ratio exagera la medida relativa. Buscaría las frecuencias brutas de cada grupo para calcular el cociente y la diferencia absoluta, y recordaría que un diseño transversal no establece qué fue antes.

Si un ensayo con 40 pacientes concluye que dos pautas son «igual de eficaces» porque la diferencia no alcanzó significación estadística

No aceptaría la equivalencia. Miraría el intervalo de confianza de la diferencia: si es amplio e incluye efectos clínicamente importantes, el estudio simplemente carece de potencia. Para afirmar equivalencia o no inferioridad exigiría un diseño con margen preespecificado.

Si un registro muestra que los pacientes con psoriasis que mantuvieron un biológico más de dos años tuvieron menos eventos cardiovasculares que quienes nunca lo recibieron

Sospecharía tiempo inmortal (para figurar en el grupo expuesto hay que pasar dos años sin evento) y confusión por indicación. Buscaría si el análisis trata la exposición como variable dependiente del tiempo o fija un punto de partida común (análisis landmark), y si el estudio emula de forma explícita un ensayo.

Si una campaña de detección precoz de melanoma presenta como éxito el aumento de la supervivencia a cinco años de los casos detectados

No lo atribuiría sin más a la campaña: el adelanto diagnóstico y la detección preferente de tumores de crecimiento lento elevan la supervivencia aunque nadie viva más. Pediría la mortalidad por melanoma de la población invitada frente a la no invitada y la proporción de tumores gruesos.

Si un ensayo negativo en su desenlace principal destaca en el resumen un subgrupo con p = 0,03 entre quince análisis secundarios

Lo leería como hipótesis para otro estudio. Con quince contrastes al 0,05 la probabilidad de al menos un falso positivo supera el 50 %. Comprobaría si el subgrupo estaba preespecificado, si hay prueba de interacción y si se corrigió la multiplicidad.

Detalles que cambian la conducta

Perlas de examen y de consulta

◆Primero, la tabla de dos por dos

Ante un problema numérico, colocar exposición o resultado de la prueba en filas y desenlace en columnas; la casilla que falta se obtiene restando del total. Sensibilidad, valores predictivos, riesgo relativo y odds ratio salen de esas cuatro cifras.

◆La p no es la probabilidad de la hipótesis nula

Una p de 0,04 no significa un 4 % de probabilidad de que el hallazgo sea azar ni un 96 % de que el efecto exista. Es la probabilidad de obtener datos tan extremos o más si la hipótesis nula y todos los supuestos del análisis fueran ciertos.

◆Más potencia, menos falsos negativos

La potencia protege del error tipo II, no del tipo I. Aumentar la muestra no reduce la tasa de falsos positivos, que queda fijada por α.

◆El espectro de pacientes también cuenta

Una prueba validada con casos floridos de un centro de referencia frente a controles sanos sobrestima su rendimiento. En cuadros leves o dudosos, que es donde hace falta, sensibilidad y especificidad bajan.

◆Efecto Hawthorne y mejoría espontánea

Quien se sabe observado cumple mejor, y muchas dermatosis fluctúan o remiten solas. Sin grupo control, la mejoría tras una intervención no puede atribuirse a ella.

◆Un NNT patrocinado se lee dos veces

En el metanálisis en red que ordena biológicos de psoriasis por NNT, seis de los ocho autores firman como empleados del laboratorio titular de uno de los fármacos mejor situados. No invalida el resultado; obliga a revisar la selección de ensayos, desenlaces y tiempos.

◆Enfermedad rara o exposición rara

Si lo infrecuente es la enfermedad, lo eficiente es reunir casos y buscar hacia atrás (casos y controles). Si lo infrecuente es la exposición, hay que partir de los expuestos y seguirlos (cohorte).

◆Un confusor no es un mediador

Ajustar por una variable situada en la vía causal entre exposición y desenlace borra parte del efecto real. Se ajusta por las causas comunes de ambos.

◆El valor E mide la fragilidad de una asociación

Indica la fuerza mínima de asociación que un confusor no medido debería tener con la exposición y con el desenlace para anular el resultado observado. Un valor E pequeño señala una asociación fácil de explicar por confusión residual.

Contraste con fuentes actuales

Actualización DermRX

Qué ha cambiado entre la obra (2024) y octubre de 2026, y qué conviene leer en clave europea.

Actualización DermRXCONSORT 2025 sustituye a CONSORT 2010 para comunicar ensayos

La obra presenta el ensayo aleatorizado como patrón de referencia sin entrar en cómo comprobar que está bien comunicado. En abril de 2025 se publicó la actualización de CONSORT: lista de 30 ítems, con siete nuevos, tres revisados y uno suprimido, integración de ítems de extensiones previas y una sección nueva dedicada a ciencia abierta. Es la plantilla con la que hoy conviene leer la sección de métodos de un ensayo.

Fuente: Hopewell S, et al. BMJ. 2025;389:e081123. PMID: 40228833.

Actualización DermRXDe la pirámide por diseños a la certeza por desenlaces (GRADE)

La obra clasifica la evidencia con dos escalas estadounidenses basadas en el tipo de estudio: la del Grupo de Trabajo de Servicios Preventivos de Estados Unidos (USPSTF) y la de la revista de la Academia Americana de Dermatología. El enfoque GRADE, condensado en 2025 en la serie Core GRADE, parte de una pregunta estructurada en población, intervención, comparación y desenlace (PICO), distingue efectos relativos y absolutos y valora la certeza de la evidencia antes de recomendar. En Europa, las guías EuroGuiDerm se elaboran como guías vivas basadas en evidencia y consenso, y la adaptación alemana de la de psoriasis (2026) apoya sus recomendaciones en el metanálisis en red Cochrane.

Fuente: Guyatt G, et al. BMJ. 2025;389:e081903. PMID: 40262844. Wollenberg A, et al. J Eur Acad Dermatol Venereol. 2025;39(9):1537-1566. PMID: 40317496. Nast A, et al. J Dtsch Dermatol Ges. 2026;24(1):122-137. PMID: 41531416.

Actualización DermRXEstudios observacionales que emulan un ensayo: declaración TARGET

La obra describe la cohorte clásica y no menciona el sesgo de tiempo inmortal. Desde septiembre de 2025 existe una guía de comunicación para estudios observacionales que emulan un ensayo diana (TARGET, 21 ítems): pide especificar el protocolo del ensayo hipotético y cómo se traslada a los datos disponibles. En la literatura dermatológica ya se usan análisis landmark y modelos con exposición dependiente del tiempo, por ejemplo al relacionar la toxicidad cutánea por enfortumab vedotina con la supervivencia.

Fuente: Cashin AG, et al. JAMA. 2025;334(12):1084-1093. PMID: 40899949. Lee E, et al. JAMA Dermatol. 2026;162(9):922-930. PMID: 42525402.

Actualización DermRXExactitud diagnóstica de la inteligencia artificial: STARD-AI

La obra trata sensibilidad, especificidad y valores predictivos pensando en pruebas convencionales. En 2025 se publicó STARD-AI, que añade 18 ítems nuevos o modificados a la lista STARD 2015 para estudios de exactitud diagnóstica con inteligencia artificial: descripción de los conjuntos de datos, de la prueba índice y de su evaluación, y consideración del sesgo algorítmico y la equidad. Es el marco aplicable a los estudios de algoritmos sobre imágenes clínicas o dermatoscópicas.

Fuente: Sounderajah V, et al. Nat Med. 2025;31(10):3283-3289. PMID: 40954311.

Actualización DermRXCorrecciones al planteamiento estadístico de la obra

No es una novedad, sino una corrección: el capítulo da a entender que la hipótesis nula puede «aceptarse», vincula la potencia con los falsos positivos y ofrece para el valor predictivo negativo una fórmula que no corresponde a su propia tabla. Lo correcto: no rechazar no es aceptar; la potencia (1 − β) protege del falso negativo; y el valor predictivo negativo es el cociente entre verdaderos negativos y todos los negativos. La guía de Greenland y colaboradores enumera 25 interpretaciones erróneas de p, intervalos de confianza y potencia.

Fuente: Greenland S, et al. Eur J Epidemiol. 2016;31(4):337-350. PMID: 27209009. Silverberg JI. J Am Acad Dermatol. 2015;73(5):733-740. PMID: 26475533.
Recursos relacionados

Conectar con DermRX

Fuentes

Referencias

Lectura de referencia

Secciones «Epidemiologic definitions» · «Epidemiologic principles» · «Types of studies» · «Types of bias» (capítulo 11, Epidemiology, Statistics, Study Design, Public Health Principles, and Billing). En: Alikhan A, Hocker TLH, editores. Review of Dermatology. 2.ª ed. Filadelfia: Elsevier; 2024.

Fuentes consultadas para contrastar y actualizar

  1. Hopewell S, Chan AW, Collins GS, et al. CONSORT 2025 statement: updated guideline for reporting randomised trials. BMJ. 2025;389:e081123. PMID: 40228833.
  2. Guyatt G, Agoritsas T, Brignardello-Petersen R, et al. Core GRADE 1: overview of the Core GRADE approach. BMJ. 2025;389:e081903. PMID: 40262844.
  3. Cashin AG, Hansford HJ, Hernán MA, et al. Transparent Reporting of Observational Studies Emulating a Target Trial-The TARGET Statement. JAMA. 2025;334(12):1084-1093. PMID: 40899949.
  4. Sounderajah V, Guni A, Liu X, et al. The STARD-AI reporting guideline for diagnostic accuracy studies using artificial intelligence. Nat Med. 2025;31(10):3283-3289. PMID: 40954311.
  5. Wollenberg A, Kinberger M, Arents B, et al. European Guideline (EuroGuiDerm) on atopic eczema: Living update. J Eur Acad Dermatol Venereol. 2025;39(9):1537-1566. PMID: 40317496.
  6. Nast A, Altenburg A, Augustin M, et al. S3 Guideline for the treatment of psoriasis vulgaris, adapted from EuroGuiDerm – part 1: Treatment recommendations and monitoring. J Dtsch Dermatol Ges. 2026;24(1):122-137. PMID: 41531416.
  7. Silverberg JI. Study designs in dermatology: A review for the clinical dermatologist. J Am Acad Dermatol. 2015;73(5):721-731. PMID: 26475532.
  8. Silverberg JI. Study designs in dermatology: Practical applications of study designs and their statistics in dermatology. J Am Acad Dermatol. 2015;73(5):733-740. PMID: 26475533.
  9. Greenland S, Senn SJ, Rothman KJ, et al. Statistical tests, P values, confidence intervals, and power: a guide to misinterpretations. Eur J Epidemiol. 2016;31(4):337-350. PMID: 27209009.
  10. Cook RJ, Sackett DL. The number needed to treat: a clinically useful measure of treatment effect. BMJ. 1995;310(6977):452-454. PMID: 7873954.
  11. Leonardi CL, See K, Burge R, et al. Number Needed to Treat Network Meta-Analysis to Compare Biologic Drugs for Moderate-to-Severe Psoriasis. Adv Ther. 2022;39(5):2256-2269. PMID: 35316500.
  12. Nelson KC, Swetter SM, Saboda K, et al. Evaluation of the Number-Needed-to-Biopsy Metric for the Diagnosis of Cutaneous Melanoma: A Systematic Review and Meta-analysis. JAMA Dermatol. 2019;155(10):1167-1174. PMID: 31290958.
  13. VanderWeele TJ, Ding P. Sensitivity Analysis in Observational Research: Introducing the E-Value. Ann Intern Med. 2017;167(4):268-274. PMID: 28693043.
  14. Lee E, Karagenova R, Lu C, et al. Enfortumab Vedotin-Induced Cutaneous Toxic Effects and Survival in Urothelial Carcinoma. JAMA Dermatol. 2026;162(9):922-930. PMID: 42525402.

DermRX · Revisión técnica por muestreo: · Alcance y estados editoriales. No equivale a una revisión clínica global.