Un estudio encuentra una amplia sobreafirmación causal en resúmenes de ciencias sociales
Puntos clave
- •Los investigadores analizaron 194,631 artículos transversales de ciencias sociales con modelos de lenguaje grandes para medir el uso de redacción causal en títulos y resúmenes.
- •Entre 1980 y 2024, en promedio 46% de los artículos contenían lenguaje causal, y la tasa anual subió de 20% en 2000 a 60% en 2024.
- •En un experimento con sujetos humanos y 1,105 participantes, los lectores a menudo interpretaron los resúmenes con redacción causal como evidencia causal.
- •Las etiquetas metodológicas y la redacción asociativa redujeron la tendencia de los lectores a inferir causalidad a partir de los resúmenes.
- •En pruebas con cinco LLMs, los resúmenes generados por modelos a veces eliminaron matices y añadieron afirmaciones causales, mientras que pedir cautela redujo el problema.

En las ciencias sociales, muchos estudios utilizan diseños transversales que pueden mostrar asociaciones, pero por lo general no están en condiciones de respaldar afirmaciones causales directas. Aun así, los autores de esos trabajos pueden hacer o insinuar afirmaciones causales en su redacción, lo que puede difuminar la línea entre lo que los datos pueden mostrar y lo que el artículo parece concluir.
Para medir con qué frecuencia ocurre esto, los investigadores analizaron 194,631 artículos transversales utilizando modelos de lenguaje grandes. Al observar el período de 1980 a 2024, encontraron que, en promedio, 46% de los artículos contenían lenguaje causal en sus títulos o resúmenes. Desde 2000, la tasa anual ha aumentado casi tres veces, de 20% a 60%, lo que sugiere que esta redacción es lo bastante común como para influir en cómo los lectores encuentran la investigación en ciencias sociales a gran escala.
Los investigadores también examinaron los efectos de este lenguaje en un experimento con sujetos humanos que involucró a 1,105 participantes. Encontraron que con frecuencia los lectores afirmaban que los resúmenes con esta formulación proporcionaban evidencia causal. Al mismo tiempo, las etiquetas metodológicas (β = −0.4, intervalo de confianza del 95% −0.56 a −0.19) y la redacción asociativa (β = −0.3, intervalo de confianza del 95% −0.43 a −0.07) redujeron esa tendencia, lo que subraya cómo la elección de palabras puede influir en la interpretación incluso cuando el diseño del estudio subyacente no cambia.
En experimentos con cinco LLMs, los resúmenes generados por modelos de estos artículos, con 100 ejemplos para cada modelo, a veces amplificaron la sobreafirmación causal. En esos resúmenes, los modelos eliminaron matices e introdujeron afirmaciones causales incluso cuando los artículos originales utilizaban una formulación estrictamente asociativa. Pedir a los modelos que fueran cautelosos redujo este patrón, un hallazgo con relevancia práctica a medida que más lectores encuentran la investigación a través de resúmenes automatizados en lugar de artículos completos.
Los hallazgos provienen de un artículo reciente de Calvin Isch, Timothy Dörr, Neil Fasching, Grace Jennings y Duncan J. Watts. Isch está en el mercado laboral este año y trabaja con Tetlock y Watts.