Bibliografía de la tesis · Referencia 10 · 2017

Una imagen, varias interpretaciones

PERCH: cómo medir concordancia sin confundir consenso con verdad.

Fancourt N, Deloria Knoll M, Barger-Kamate B, et al. Standardized Interpretation of Chest Radiographs in Cases of Pediatric Pneumonia From the PERCH Study. Clin Infect Dis. 2017;64(Suppl 3):S253–S261. DOI: 10.1093/cid/cix082.

Artículo original · Volver al índice

Lectura educativa del documento de 2017. Las recomendaciones y cifras conservan su contexto histórico; esta página no las actualiza para 2026. Los ejercicios matemáticos son didácticos.

Abstract

Background

La metodología OMS nació para desenlaces radiográficos de ensayos de vacunas bacterianas; PERCH evalúa su implementación en investigación epidemiológica.

Methods

Lectura estandarizada y arbitraje en niños de 1–59 meses hospitalizados con neumonía grave/muy grave definida por OMS, en siete países.

Results

4172 imágenes; acuerdo para cualquier consolidación ≈78%, κ 0,50. Para cinco categorías: 43,5%, κ 0,25.

Conclusions

Mayor reproducibilidad para consolidación y menor para otros infiltrados pese a estandarización.

Keywords

observer variation; chest radiograph; pneumonia; pediatrics; diagnosis.

Introducción · texto inicial sin título en el original

La Rx se puede archivar y releer, pero la interpretación es subjetiva. Este artículo describe el proceso, evalúa variabilidad y compara métodos de arbitraje. No estima aquí etiología bacteriana ni beneficio de antibióticos. PERCH era un estudio de casos y controles, pero este análisis de concordancia usa imágenes de los casos hospitalizados.

Methods

Data Collection

4232 casos en nueve sitios de Bangladesh, Gambia, Kenia, Mali, Sudáfrica, Tailandia y Zambia, agosto 2011–enero 2014. Rx frontal lo antes posible y repetidas si estaban indicadas; digitales o analógicas digitalizadas. Consentimiento y aprobación local.

Chest Radiograph Interpretation

14 lectores: cinco radiólogos y nueve pediatras. Cuatro radiólogos arbitradores. Taller de dos días; lectores debían coincidir con referencias en ≥50% de veinte imágenes y ≥66% de consolidaciones y normales. Reentrenamiento hasta alcanzar esos umbrales. No interpretar imágenes del propio sitio reducía diferencias sistemáticas por centro.

1 · Dos lecturas

Pares asignados aleatoriamente clasifican la imagen.

2 · Concordancia

Si coinciden, conclusión primaria; muestra de control de calidad aparte.

3 · Discordancia

Dos arbitradores adicionales, independientes y cegados a lecturas previas.

4 · Consenso

Si persiste desacuerdo, discusión. En este estudio conocían lecturas previas en esa etapa.

Figure 1. Interpretation process for chest radiographs (CXRs) in the PERCH project

El esquema anterior redibuja el circuito. El control de calidad no cambió las conclusiones finales. La unidad es imagen, no niño: puede haber varias por caso.

Analysis

Acuerdo observado y κ. Fleiss para panel con pares de identidad variable. Cohen para reevaluación del mismo lector y cálculos binarios por conclusión que permiten IC. Además κ ajustado por prevalencia y distribuciones marginales. Algunas comparaciones excluyen imágenes que algún lector marcó no interpretables. χ² de bondad de ajuste para coincidencias de arbitraje con proporciones esperadas iguales (25%).

Table 1. Classification of Findings and Conclusions for the Standardized Interpretation of Chest Radiographs

HallazgoDefinición resumida
ConsolidationOpacidad densa o algodonosa que ocupa parte/todo un lóbulo o pulmón, con o sin broncograma.
Other infiltrateDensidades lineales/parcheadas, engrosamiento peribronquial y pequeñas atelectasias; difíciles de distinguir de consolidación.
Pleural effusionLíquido lateral entre pulmón y pared, no sólo en cisuras; se incorpora al desenlace de consolidación.
UninterpretableNo se puede determinar consolidación y/o otro infiltrado según calidad/rasgos.

Consolidación sola

Sin otros infiltrados.

Otro infiltrado solo

Sin consolidación.

Ambos

Consolidación y otros infiltrados.

Normal

Sin los hallazgos anteriores.

No interpretable

Categoría del proceso; no equivale a normal.

“Any consolidation” combina consolidación sola y ambos (con la definición de derrame de la tabla). Si se identifica un hallazgo patológico pero otra parte no es interpretable, el protocolo prioriza lo patológico identificado. Table 1 también define alternativas: single arbitrator, 4 conclusions, vaccine trial y any abnormality.

Results

4232 casos

4011 aportaron alguna imagen; 221 no.

4172 imágenes

120 casos aportaron más de una. No dividir todos los resultados por 4232.

221 sin imagen

92 murieron antes de Rx; 23 dados de alta; 36 problemas de equipo/operador; 70 motivo desconocido.

Entrenamiento

7/14 aprobaron primero; tres en segundo y cuatro en tercer intento.

Faltantes informativos: 92/221 = 41,6% de casos sin Rx fallecieron antes de obtenerla. Es una selección relacionada con gravedad; no asumir que los casos con imágenes representan por igual a todos los ingresados.

Table 2. Observer Agreement for Individual Conclusions (Present or Absent) for the 14-Member Primary Reading Panel and the 4-Member Arbitration Panel, Excluding Images for Which Either Reader/Arbitrator Interpreted as Uninterpretable

Comparación binaria por hallazgo en imágenes interpretables: 3497 lecturas primarias y 1861 arbitradas. La tabla siguiente reproduce filas centrales, no todos los estratos.

ConclusiónPrimarios: acuerdo · κ (IC95%)Arbitraje: acuerdo · κ (IC95%)
Sólo consolidación80,0% · 0,33 [0,30–0,37]82,5% · 0,32 [0,28–0,37]
Otro infiltrado66,5% · 0,15 [0,12–0,18]67,8% · 0,25 [0,20–0,29]
Ambos80,3% · 0,21 [0,18–0,24]82,6% · 0,30 [0,25–0,34]
Normal68,9% · 0,35 [0,32–0,38]77,1% · 0,52 [0,47–0,57]
Cualquier consolidación77,8% · 0,50 [0,47–0,53]83,6% · 0,61 [0,56–0,65]

κ ajustado para cualquier consolidación: 0,56 y 0,67. Table 2 también desglosa lado, edad, equipo, tiempo desde formación y experiencia/especialidad. El acuerdo primario bajó de 81,5% (≤10 meses desde formación) a 74,9% (>10 meses); no prueba por sí solo efecto causal del tiempo.

Cinco categorías, todas las imágenes

Primarios: 1814/4172 = 43,5%, κ 0,25 [0,23–0,27]. Arbitraje: 1144/2358 = 48,5%, κ 0,32 [0,30–0,34]. Estos denominadores y la tarea difieren del análisis binario de consolidación.

Figure 2. Observer agreement for individual readers for the finding of any consolidation

Cada lector interpretó en promedio 598 imágenes. Acuerdo individual para consolidación 61–81%, κ 0,22–0,60. La figura original presenta lectores con IC, excluyendo no interpretables; no son estimaciones de sensibilidad.

Table 3. Summary of Discordant and Concordant Conclusions for Either the 2 Randomly Assigned Readers or the 2 Randomly Assigned Arbitrators

La discordancia normal/otro infiltrado representó 743/2358 = 31,5% entre primarios y 360/1214 = 29,7% entre arbitradores. Son porcentajes de discordancias, no de todas las imágenes ni errores demostrados.

Normal / otro infiltrado · primarios · 31.5%
743 de 2358 imágenes discordantes
Normal / otro infiltrado · arbitraje · 29.7%
360 de 1214 imágenes discordantes

Table 4. Results of the Quality Control Process (Arbitration of a Random Selection of 10% Concordant Images for Each Conclusion from the Primary Reading)

184 imágenes concordantes revisadas. En las 44 con cualquier consolidación primaria, ambos arbitradores coincidieron en 30 (68%); al menos uno, en 41 (93%). Tras discusión, conclusión de control coincidió con lectores en 129/184 (70%). El control revela fragilidad de concordancia, no aporta un patrón perfecto de verdad.

Table 5. Comparison of PERCH Study and Alternate Processes for Chest Radiographic Interpretation (Includes Multiple Images on 120 Cases)

ProcesoCualquier consolidaciónAnormalCambio respecto PERCHLecturas
PERCH · 5 categorías25,8%49,6%Referencia14.274
Single arbitration25,2%48,6%16,3%10.702 (25% menos)
4 conclusions27,3%50,1%1,6%13.417 (6% menos)
Vaccine trial25,7%64,4%22,5%10.866 (23,9% menos)
Any abnormality · 3 categoríasNo se distingue52,4%2,8%12.237 (14,3% menos)

El método vaccine trial resuelve ciertas discordancias normal/otro infiltrado a favor de infiltrado: aumenta esa categoría de 23,8% a 38,7%. Menos lecturas no garantiza la misma clasificación individual. Single arbitration conserva porcentajes agregados parecidos mientras cambia 680/4172 imágenes.

En el método alternativo vaccine trial hubo 64 imágenes sin información para resolver nuevas discordancias; se imputaron conclusiones según distribuciones de arbitraje. Es imputación para una simulación del proceso, distinta de las diez bases de van de Maat.

Laboratorio estadístico · acuerdo, kappa y categorías

Por qué no alcanza el porcentaje

Dos lectores pueden coincidir muchas veces diciendo “normal” cuando un hallazgo es raro. κ descuenta acuerdo esperado por las distribuciones de categorías:

κ = (Pₒ − Pₑ)/(1 − Pₑ)
Pₒ = proporción observada de acuerdo
Pₑ = suma de productos de proporciones marginales (Cohen)

Ejercicio de Cohen con 100 imágenes hipotéticas; no reconstruye la base de PERCH. Filas: lector A; columnas: lector B. La matriz contiene conteos, no probabilidades.

Aplicación al artículo

“Sólo consolidación”: acuerdo 80%, κ 0,33; “cualquier consolidación”: acuerdo 77,8%, κ 0,50. La prevalencia de categorías cambia el acuerdo esperado. No comparar κ entre estudios sin mirar categorías, prevalencia, calidad y lectores. Un κ ajustado usa otra convención para prevalencia/marginales; no es precisión diagnóstica ni elimina toda subjetividad.

Fleiss versus Cohen

Cohen se aplica a un par identificado de evaluadores o a dos mediciones del mismo lector. Fleiss resume un panel donde las identidades de quienes leen cada imagen varían. Ambos comparan acuerdo con un referente probabilístico; no utilizan un cultivo como patrón de verdad. Este trabajo usa Fleiss para el panel y Cohen para análisis específicos descritos en Methods.

κ no es sensibilidad

Sensibilidad requiere enfermedad verdadera conocida; aquí se comparan lecturas sin un estándar independiente perfecto. κ = 0,50 no significa “detectaron la mitad de neumonías”. El consenso alcanza una etiqueta operativa, no confirma etiología ni corrige mágicamente errores compartidos.

χ² de bondad de ajuste

Pregunta si las conclusiones consensuadas coincidían con arbitradores en proporciones iguales: esperado 25% para cada uno, χ² = Σ(O−E)²/E. Un arbitrador tuvo 15% y otro 34%; P < 0,0001. Muestra distribución desigual; no identifica quién tenía razón ni demuestra jerarquía/influencia como causa. No inventamos los conteos completos para recalcular la prueba.

¿Por qué no regresión logística o prueba t?

La pregunta central es reproducibilidad de categorías, no predecir receta o comparar medias. Una regresión podría investigar factores asociados a desacuerdo como pregunta adicional, pero no reemplaza κ. Prueba t no resume coincidencia de etiquetas. Kappa ponderado sería apropiado para categorías ordenadas con pesos justificados; consolidación, otro infiltrado y normal no forman una escala ordinal simple.

Más categorías, menor acuerdo exacto

Un lector puede llamar “ambos” y otro “consolidación sola”: discrepan en cinco categorías, coinciden si se agrupa cualquier consolidación. Aumentar acuerdo fusionando categorías pierde información. Primero se define el desenlace clínico/epidemiológico; luego se evalúa su reproducibilidad.

Discussion

Qué aporta

Proceso grande, multicéntrico y estandarizado; mejor acuerdo para consolidación y menor para infiltrados sutiles. Deben reportarse entrenamiento, control de calidad, reglas finales y prevalencia al comparar estudios.

Limitaciones y sesgos

No hubo evaluación preentrenamiento: no se puede estimar cuánto mejoró la formación. Reevaluación voluntaria en 11/14 lectores; veinte imágenes por examen. Diferencias de experiencia y asistencia al taller pueden confundirse entre sí. No interpretables se excluyen en algunos análisis: mejora aparente de acuerdo al seleccionar imágenes más fáciles.

Arbitraje y consenso

Las imágenes arbitradas son seleccionadas por dificultad; no son comparables directamente con todas las primarias. El mayor acuerdo de arbitradores no estima sin más efecto de experiencia. En discusión conocían lecturas previas, posible anclaje; autores proponen futuras discusiones cegadas. El consenso no tiene una medida de exactitud independiente.

Selección y unidad

Muertes antes de Rx hacen que faltantes no sean aleatorios. Equipos, digitalización y mezcla de casos varían. Repeticiones por niño obligan a no confundir imágenes con pacientes. Niños hospitalizados graves de siete países no representan NAC leve ambulatoria argentina.

Relación con la tesis

Si las categorías de informes se usan como exposición/desenlace, la clasificación errónea puede alterar asociaciones con receta. No siempre las atenúa: dirección depende de si el error se relaciona con tratamiento u otras variables. Preservar “indeterminado/no interpretable” y describir criterios aporta transparencia; no usar estos porcentajes para estimar Rx entre todos los sospechosos de NAC.

Supplementary Data

Material adicional online con detalle de lectores, variación entre sitios y distribuciones marginales. El PDF remitido no contiene todos los suplementos: no se atribuyen datos nuevos a ellos.

Notes

Author contributions

Diseño, formación, lecturas, arbitraje, coordinación y análisis distribuidos entre los autores.

Acknowledgments

Reconocen equipo, asesores, investigadores y familias.

Disclaimer

Conclusiones de los autores, no necesariamente de CDC o gobierno estadounidense.

Financial support

Fundación Bill & Melinda Gates (PERCH); beca Fulbright de Nicholas Fancourt.

Supplement sponsorship

El suplemento PERCH fue patrocinado por una subvención de la misma fundación.

Potential conflicts of interest

Algunos autores declaran consultorías, financiación, honorarios o consejos de empresas de vacunas. La declaración permite valorar relaciones; no demuestra por sí sola sesgo.

References

32 referencias al final del artículo, incluidas metodología OMS, Cherian, guías y estudios de reproducibilidad. No confundir este artículo con el siguiente trabajo de Fancourt sobre hallazgos de PERCH (cix089).