Este documento establece cómo evaluamos las fuentes en Pensar es Gratis. No todas las investigaciones tienen el mismo peso. Distinguimos cuatro tipos de fuentes: estudios empíricos, teorías consolidadas, estadísticas oficiales y datos de monitorización a largo plazo. Cada una exige criterios propios. Y cada cita llevará una etiqueta que indique su fiabilidad.
1. Criterios para juzgar un estudio empírico
La fiabilidad de un estudio no se decide por su publicación en una revista prestigiosa, sino por su diseño, transparencia y trayectoria.
- Tamaño de muestra y potencia. Muestras pequeñas (menos de 50 en estudios de comportamiento humano) producen resultados inestables. La representatividad importa tanto como el número.
- Replicación independiente. Un hallazgo reproducido por laboratorios sin vínculos entre sí es mucho más sólido que uno publicado una sola vez. Los metaanálisis y revisiones sistemáticas suelen ser más fiables que estudios individuales.
- Conflictos de interés. La financiación debe declararse. Si no se hace, es una alarma. La industria tiende a financiar resultados que le benefician.
- Población estudiada. Los universitarios occidentales no representan a la humanidad. Generalizar desde muestras WEIRD es un error frecuente.
- Diseño experimental vs. observacional. Los ensayos controlados aleatorizados (RCT) permiten establecer causalidad; los observacionales, solo correlación. No se pueden equiparar.
- Preregistro. Los estudios registrados previamente en OSF u otras plataformas impiden cambiar hipótesis a posteriori. Esto reduce el HARKing y el p-hacking.
- Revisión por pares y calidad de la revista. No todas las revistas son iguales. Las revistas depredadoras existen y proliferan. Una publicación en Nature no equivale a una en una revista de dudoso estándar.
2. La crisis de replicabilidad
En 2015, el Reproducibility Project (Nosek, Universidad de Virginia) intentó replicar 100 estudios de psicología publicados en revistas de primer nivel. Solo el 36% se replicó. El 64% no, o con efectos mucho más débiles.
El problema no es exclusivo de la psicología. Oncología, neurociencia, economía conductual y biomedicina muestran tasas similares.
¿Por qué falla la replicación?
- Muestras insuficientes. Estudios con 30 participantes encuentran efectos por azar que desaparecen con muestras mayores.
- P-hacking. Analizar muchas variables hasta dar con un p < 0.05 sin declararlo infla los falsos positivos.
- HARKing. Presentar un hallazgo exploratorio como si hubiera sido la hipótesis original.
- Variabilidad no declarada. Los protocolos aparentemente idénticos esconden diferencias sutiles (hora del día, instrucciones, temperatura) que afectan los resultados.
Resultados recientes vs. resultados problemáticos
Un estudio reciente y bien diseñado no es sospechoso; simplemente no ha tenido tiempo de ser replicado. La ciencia valida con el tiempo.
Dos ejemplos:
- GFAJ-1 (2010). Science publicó que una bacteria podía sustituir fósforo por arsénico en su ADN. La NASA hizo rueda de prensa. Hicieron falta año y medio y dos estudios independientes para refutarlo.
- LK-99 (2023). Un preprint surcoreano afirmaba haber logrado un superconductor a temperatura ambiente. Como el material era fácil de sintetizar, en semanas varios laboratorios refutaron el hallazgo.
La diferencia de tiempo no es calidad metodológica, sino facilidad de replicación y si el trabajo pasó o no por revisión por pares. Por eso distinguimos entre Reciente (no ha dado tiempo a replicar) y Problemático (defectos conocidos).
3. Sesgos estructurales del sistema científico
Publicación sesgada
Las revistas prefieren resultados positivos (que encuentran un efecto) sobre los nulos. Los estudios negativos se quedan en el cajón. Consecuencia: la literatura científica sobrestima los efectos reales. Si diez laboratorios estudian lo mismo y solo el que da positivo se publica, la evidencia publicada es engañosa.
Sesgo de confirmación institucional
Los científicos son humanos. Tienden a interpretar datos ambiguos a favor de sus hipótesis favoritas. No es mala fe, pero sus efectos se acumulan en decisiones menores: exclusión de valores atípicos, elección de análisis secundarios, redacción de conclusiones.
Conflictos de interés financiero
Un metaanálisis de 2007 en PLOS Medicine (más de 1.000 estudios sobre bebidas azucaradas) mostró que los estudios financiados por la industria tenían cuatro veces más probabilidad de no encontrar relación con la obesidad que los independientes. Lo mismo ocurre en farmacología, tabaco, nutrición. No hace falta conspiración: la financiación condiciona las preguntas, los puntos de corte, los momentos de parada y lo que se publica. La solución lógica es que las industrias no financien investigación sobre sus propios productos.
Sesgo WEIRD
El 96% de los sujetos en psicología proceden de países occidentales (que son solo el 12% de la población mundial). Y dentro de eso, sobre todo estudiantes universitarios estadounidenses. La población occidental es atípica en muchas dimensiones psicológicas. Resultados presentados como universales no lo son.
4. Sesgos cognitivos en los científicos
- Confirmación. Se diseñan experimentos que difícilmente contradigan la hipótesis favorita; se persevera más en los análisis cuando los resultados son positivos.
- Autoridad. Un estudio de Harvard con metodología pobre no vale más que uno de una universidad desconocida con metodología impecable. La ciencia no se rige por autoridades.
- Novedad. Las revistas y los medios prefieren resultados sorprendentes. Eso genera que los hallazgos más llamativos sean también los más proclives a ser falsos positivos (la «maldición del ganador»).
5. Más allá del estudio individual: teorías, estadísticas y monitorización
No todo es un experimento con muestra y p-valor.
- Teorías consolidadas. La evolución, la tectónica de placas o el efecto invernadero no son estudios individuales, sino síntesis de décadas de evidencia convergente desde disciplinas independientes. Su validez no depende de un artículo concreto, sino de todo el cuerpo acumulado.
- Estadísticas oficiales e institucionales. Datos del IPCC, NOAA, NASA, IEA, OMS, Banco Mundial, etc. No prueban hipótesis; documentan hechos. Su fiabilidad se juzga por transparencia metodológica, independencia institucional, consistencia temporal y validación cruzada (ej. satélite vs. estaciones terrestres). Si la institución tiene intereses directos en el resultado, se aplica el mismo criterio que ante cualquier conflicto de interés.
- Monitorización a largo plazo. Estudios como el Framingham Heart Study (desde 1948) o las redes climáticas. Son imprescindibles porque hay preguntas que no se pueden responder con RCT (no se asigna aleatoriamente a países niveles de emisiones o a personas 40 años de tabaquismo). Su fiabilidad depende de la calibración, cobertura geográfica y temporal, y concordancia entre sistemas independientes.
Niveles de Fiabilidad
Todas las citas en Pensar es Gratis llevarán una de estas etiquetas:
- Fiable: Replicado, muestra adecuada, sin conflictos relevantes, diseño apropiado.
- Con reservas: Estudio válido pero con limitaciones importantes (muestra pequeña, sin replicación, posible conflicto, o diseño observacional con lenguaje causal).
- Reciente: Hallazgo sólido metodológicamente pero publicado hace poco; aún no ha habido tiempo para replicar. No es una alarma, es un recordatorio de que la confirmación necesita tiempo.
- Problemático: Problemas metodológicos conocidos, no replicado, conflicto grave, o conclusiones no justificadas.
- Marco teórico: No es un estudio individual, sino una teoría con décadas de evidencia convergente. No se le aplican criterios de muestra o replicación.
- En revisión: Debate activo en la comunidad; existen estudios posteriores que apuntan en direcciones distintas.
Las estadísticas institucionales y series de monitorización se etiquetarán como Fiable o Con reservas según transparencia e independencia.
Citaremos estudios problemáticos o con reservas no para validarlos, sino para documentar su existencia y explicar por qué su peso es limitado. La honestidad sobre las limitaciones es más útil que la ilusión de certeza.
Referencias
Open Science Collaboration (2015). Estimating the reproducibility of psychological science. Science, 349(6251), aac4716.
Nosek, B.A. et al. (2022). Replicability, robustness, and reproducibility in psychological science. Annual Review of Psychology, 73, 719–748.
Ioannidis, J.P.A. (2005). Why most published research findings are false. PLOS Medicine, 2(8), e124.
Simmons, J.P., Nelson, L.D., Simonsohn, U. (2011). False-positive psychology: Undisclosed flexibility in data collection and analysis allows presenting anything as significant. Psychological Science, 22(11), 1359–1366.
Henrich, J., Heine, S.J., Norenzayan, A. (2010). The weirdest people in the world? Behavioral and Brain Sciences, 33(2–3), 61–83.
Sumner, P. et al. (2014). The association between exaggeration in health related science news and academic press releases: retrospective observational study. BMJ, 349, g7015.
Makel, M.C., Plucker, J.A., Hegarty, B. (2012). Replications in psychology research: How often do they really occur? Perspectives on Psychological Science, 7(6), 537–542.
Turner, E.H. et al. (2008). Selective publication of antidepressant trials and its influence on apparent efficacy. New England Journal of Medicine, 358(3), 252–260.
Bes-Rastrollo, M. et al. (2013). Financial conflicts of interest and reporting bias regarding the association between sugar-sweetened beverages and weight gain. PLOS Medicine, 10(12), e1001578.
Chambers, C.D. (2013). Registered reports: A new publishing initiative at Cortex. Cortex, 49(3), 609–610.
Wolfe-Simon, F. et al. (2011). A bacterium that can grow by using arsenic instead of phosphorus. Science, 332(6034), 1163–1166.
Reaves, M.L., Sinha, S., Rabinowitz, J.D., Kruglyak, L., Redfield, R.J. (2012). Absence of detectable arsenate in DNA from arsenate-grown GFAJ-1 cells. Science, 337(6093), 470–473.
Lee, S., Kim, J.-H., Kwon, Y.-W. (2023). The First Room-Temperature Ambient-Pressure Superconductor. arXiv:2307.12008. Preprint, sin revisión por pares.