Altamens Investigación · Reanálisis de datos abiertos
¿Qué estabilidad tiene su amplitud de dígitos?
Una prueba de reglas de puntuación y repetibilidad inmediata en 1433 personas: la puntuación más simple sobre todos los ensayos fue la más repetible, y nuestra puntuación preespecificada de crédito parcial fue la peor — lo contrario de lo que predijimos.
Resumen
Un resultado de amplitud de dígitos suele comunicarse como una sola cifra, pero esa cifra depende tanto de cómo se convierten los ensayos en una puntuación como de la persona evaluada. Reanalizamos el archivo público de ensayos de amplitud de dígitos del conjunto de datos Music Ensemble (CC BY 4.0), en el que adultos completaron una tarea visual de amplitud de dígitos directa dos veces de forma consecutiva con conjuntos de secuencias fijos distintos. Tras la limpieza preespecificada, 38 054 ensayos sustantivos de 1433 participantes entraron en el análisis primario. Se definieron tres reglas de puntuación antes de examinar los resultados: la amplitud máxima superada, el total de secuencias completamente correctas y el crédito parcial por posición serial restringido a las longitudes de secuencia intentadas en ambos bloques. El estimando primario fue el ICC(2,1), una correlación intraclase de efectos aleatorios de dos vías, de acuerdo absoluto y medida única, con 5000 remuestreos bootstrap de participantes.
Las secuencias completamente correctas fueron lo más repetible (ICC 0,611; IC del 95 % 0,566–0,651), seguidas de la amplitud máxima superada (0,535; 0,478–0,586). El crédito parcial de longitudes comunes quedó cerca de cero (0,050; −0,009–0,114), una diferencia de −0,485 frente a la amplitud máxima (−0,556 a −0,407). Usar todas las longitudes intentadas elevó el crédito parcial a 0,209 (0,145–0,270), pero lo dejó muy por debajo de las dos puntuaciones simples, y una variante de distancia de edición se comportó casi igual. La hipótesis preespecificada de que el crédito parcial mejoraría la repetibilidad quedó por tanto contradicha. Una puntuación puede contener más detalle numérico sin contener más señal estable entre personas.
Hallazgos clave
- En 1433 adultos que completaron dos bloques consecutivos de amplitud de dígitos directa, el número total de secuencias completamente correctas fue la puntuación más repetible: ICC(2,1) = 0,611 (IC del 95 % por bootstrap 0,566–0,651).
- La amplitud máxima superada convencional fue moderadamente repetible: ICC(2,1) = 0,535 (0,478–0,586). El recuento de secuencias completamente correctas la superó en +0,076 (IC conjunto por bootstrap +0,052 a +0,102).
- La puntuación preespecificada de crédito parcial por posición serial, calculada sobre las longitudes intentadas en ambos bloques, fue la peor: ICC(2,1) = 0,050 (−0,009–0,114), es decir −0,485 frente a la amplitud máxima (−0,556 a −0,407). Nuestra hipótesis quedó contradicha, no simplemente sin respaldo.
- Solo el 33,0 % de los participantes registró la misma amplitud máxima dos veces; el 45,8 % se movió exactamente un nivel y el 21,2 % dos o más. El cambio absoluto medio fue de 0,960 niveles de amplitud.
- El bloque 2 fue algo más alto en todas las puntuaciones (amplitud máxima +0,199 niveles; IC del 95 % +0,130 a +0,267), pero el orden de bloque está confundido con el conjunto de secuencias, así que no puede identificarse ninguna causa.
- Esto mide la repetibilidad inmediata dentro de la misma sesión en adultos de 18 a 30 años. No es una estimación de estabilidad de una semana a otra, ni un umbral clínico, ni una norma poblacional, ni evidencia de que el entrenamiento mejore la memoria.
1La pregunta de medición
La amplitud de dígitos parece la prueba más simple de la psicología cognitiva. Se presenta una secuencia de dígitos, usted la reproduce en orden y las secuencias se alargan hasta que la tarea resulta demasiado difícil. El resultado suele comunicarse como un hecho único: «mi amplitud de dígitos es siete».
Pero esa cifra no proviene solo de la persona. Proviene también de la regla usada para convertir un conjunto de ensayos en una puntuación.
Suponga que la secuencia objetivo es 5 2 9 4 7 1 y alguien responde 5 2 9 4 8 1. Cinco de seis posiciones son correctas. Una regla estricta de acierto/fallo trata esa respuesta exactamente igual que una completamente errónea. Una regla de crédito parcial conserva la información de que cinco posiciones eran correctas.
Nuestra pregunta de investigación era acotada y respondible: si la misma persona completa dos versiones consecutivas de una tarea de amplitud de dígitos directa, ¿qué regla de puntuación produce el resultado más repetible?
Nuestra hipótesis preespecificada era que el crédito parcial suavizaría los umbrales abruptos creados por la puntuación de amplitud máxima y produciría por tanto una mayor fiabilidad entre bloques — una expectativa coherente con el argumento general a favor del crédito parcial en la literatura sobre memoria de trabajo.6 No fue así. La puntuación de crédito parcial fue, con mucho, la menos repetible de las tres.
2La tarea y qué significa aquí «repetibilidad»
Los participantes completaron una tarea visual de amplitud de dígitos directa. Los dígitos se mostraban de uno en uno. La tarea comenzaba con secuencias cortas y presentaba dos ensayos en cada longitud de secuencia. Si al menos uno de esos dos ensayos se recordaba de forma completamente correcta, la longitud de la secuencia aumentaba en uno. La tarea se detenía tras dos ensayos incorrectos en la misma longitud.
De forma crucial, los participantes completaron la tarea completa dos veces de forma consecutiva, con conjuntos de secuencias fijos distintos. Eso da dos mediciones por persona en condiciones muy similares, que es exactamente lo que necesita una pregunta de repetibilidad.
La regla de parada adaptativa importa para el análisis, porque crea una ausencia estructural de datos: las longitudes de secuencia más difíciles nunca se presentan una vez que el participante se detiene. Un participante que rinde mejor en un bloque se enfrenta automáticamente a secuencias más difíciles en ese bloque, así que cualquier puntuación calculada sobre «todos los ensayos que vio la persona» es en parte una puntuación calculada sobre una prueba más difícil. El trabajo metodológico sobre amplitud de dígitos ha señalado desde hace tiempo que los detalles de administración y de parada moldean la puntuación resultante.7
3El conjunto de datos — y cómo descargarlo
Usamos el conjunto de datos público Music Ensemble: una batería estandarizada de laboratorio de medidas de musicalidad, cognición y personalidad recogida de 1438 adultos de 18 a 30 años en 35 unidades de investigación de 16 países.1 El proyecto está publicado abiertamente en OSF bajo CC BY 4.0.
La limpieza preespecificada eliminó el bloque de familiarización (bloque 0, 2866 filas) y 50 ensayos sustantivos cuyo campo de respuesta contenía un array vacío. No había ningún identificador de participante/bloque/ensayo ausente ni ningún registro duplicado de participante × bloque × ensayo. Las marcas de tiempo y los identificadores de los experimentadores se descartaron antes del análisis, y en ningún punto de este informe se clasifica ningún país, sede o grupo demográfico.
- Filas brutas de ensayos de amplitud de dígitos en OSF40,970
data/raw-after-selection/digit_span.csv · 16 variables · un bloque de familiarización más dos bloques sustantivos
- Eliminado: bloque de familiarización (bloque 0)−2,866
Ensayos de práctica, excluidos de todas las puntuaciones
- Identificadores ausentes y registros duplicados0
No se encontró ningún ID de participante/bloque/ensayo ausente ni ninguna fila duplicada de participante × bloque × ensayo
- Eliminado: respuestas vacías−50
Ensayos sustantivos cuyo campo de respuesta era un array vacío; un análisis de sensibilidad los conserva como intentos con crédito cero
- Ensayos sustantivos primarios38,054
1433 participantes, todos ellos con observaciones identificables de los dos bloques sustantivos
- Mínimo definido en el protocolo para continuar — cumplido≥ 1,200
Al menos 1200 participantes con dos bloques identificables y cadenas de estímulo/respuesta analizables
Todas las exclusiones aplicadas al archivo público de ensayos de amplitud de dígitos, en el orden preespecificado. El protocolo exigía al menos 1200 participantes con dos bloques identificables antes de poder examinar los resultados; 1433 participantes cumplieron el requisito, así que el análisis continuó.
No dimos por buena la corrección indicada en el conjunto de datos. La precisión exacta se reconstruyó de forma independiente a partir del estímulo bruto y de la respuesta bruta del participante, y luego se comparó con el indicador proporcionado: discrepancias entre lo original y lo recalculado = 0. El campo de corrección publicado coincidió perfectamente con la comparación exacta estímulo-respuesta, lo cual es una buena señal para la integridad del archivo y significa que nuestras puntuaciones se construyen sobre resultados de ensayo verificados.
4Tres formas preespecificadas de puntuar la misma prueba
Las tres puntuaciones se derivaron de forma independiente dentro de cada bloque, a partir de los mismos ensayos limpios, usando definiciones escritas antes de examinar cualquier resultado.
- Amplitud máxima superada — la longitud de secuencia más larga en la que al menos uno de los dos ensayos se recordó a la perfección. Es el resultado convencional e intuitivo («amplitud = 7»), pero comprime toda una prueba en un único umbral: un solo ensayo acertado puede mover a alguien un nivel completo.
- Secuencias completamente correctas — el recuento total de ensayos completamente correctos del bloque. Es también la puntuación por bloque usada en el estudio original Music Ensemble, y utiliza el conjunto completo de resultados de acierto/fallo sin dejar de ser trivialmente fácil de explicar.
- Crédito parcial por posición serial — la proporción de posiciones de dígito presentadas recordadas con el dígito correcto en la ubicación correcta. Una secuencia de seis dígitos con cinco dígitos correctamente posicionados puntúa 5 / 6 = 83,3 %. En el análisis primario se calculó solo sobre las longitudes de secuencia que el participante intentó en ambos bloques, precisamente para evitar que la parada adaptativa comparara una prueba más fácil con una más difícil.
5Cómo se estimó la repetibilidad
El estadístico de fiabilidad primario fue el ICC(2,1): una correlación intraclase de efectos aleatorios de dos vías, de acuerdo absoluto y medida única.3,4
El acuerdo absoluto es la elección importante. Una correlación ordinaria puede seguir siendo alta incluso cuando la puntuación de todos se desplaza sistemáticamente entre bloques, porque solo le importa que se preserve el orden. El ICC(2,1) penaliza ese tipo de desacuerdo, que es exactamente lo que se quiere cuando la pregunta práctica es «¿obtendría esta persona la misma cifra otra vez?».
Para cada regla de puntuación calculamos también la estabilidad de rangos de Spearman, la diferencia absoluta media entre bloques, la desviación estándar intrapersona, la diferencia media bloque 2 − bloque 1, y el sesgo y los límites de acuerdo del 95 % de Bland–Altman.5 Los intervalos de confianza provinieron de 5000 remuestreos bootstrap de participantes, y los contrastes entre reglas de puntuación se calcularon dentro de las mismas extracciones bootstrap, de modo que la diferencia entre dos ICC lleva su propio intervalo. Como los participantes se reclutaron en 35 unidades de investigación, todos los coeficientes principales se reestimaron además con un bootstrap de conglomerados por sede.
6Resultados: ganó la puntuación más simple sobre todos los ensayos
Resultado primario: el recuento de secuencias completamente correctas fue la puntuación más repetible (ICC 0,611; IC del 95 % 0,566–0,651), la amplitud máxima superada fue moderadamente repetible (0,535; 0,478–0,586) y la puntuación preespecificada de crédito parcial de longitudes comunes fue prácticamente no repetible (0,050; −0,009–0,114).
ICC de efectos aleatorios de dos vías, acuerdo absoluto, medida única. Pase el cursor sobre una fila para destacarla. La línea vertical gris marca el cero.
ICC(2,1) con intervalos del 95 % por bootstrap de participantes (5000 remuestreos), N = 1433. Más alto es más repetible. La estabilidad de rangos de Spearman siguió el mismo orden: 0,605, 0,535 y 0,064 respectivamente. El intervalo del crédito parcial cruza el cero, así que este análisis no puede distinguir su señal entre personas de la ausencia total de señal.
El margen entre las dos puntuaciones simples fue pequeño pero consistente: el recuento de secuencias completamente correctas superó a la amplitud máxima superada en +0,076, con un IC conjunto del 95 % por bootstrap de participantes de +0,052 a +0,102. Merece decirse con claridad, porque la mejor puntuación no fue la más sofisticada. Fue el recuento ordinario de secuencias correctamente recordadas de la tarea fuente.
El resultado del crédito parcial fue en la dirección opuesta, y con fuerza. El crédito parcial menos la amplitud máxima fue de −0,485 (IC del 95 % por bootstrap −0,556 a −0,407). El intervalo queda muy por debajo de cero, así que la hipótesis preespecificada quedó contradicha y no simplemente sin respaldo.
El rendimiento medio fue algo mayor en el segundo bloque en las tres puntuaciones. La amplitud máxima subió de 6,548 ± 1,373 a 6,747 ± 1,401 (cambio medio +0,199; IC del 95 % +0,130 a +0,267). Las secuencias completamente correctas subieron de 9,890 ± 2,443 a 10,273 ± 2,442 (+0,382; IC del 95 % +0,272 a +0,496). El crédito parcial subió de 0,876 ± 0,070 a 0,894 ± 0,074 (+0,0179; IC del 95 % +0,0128 a +0,0229).
Amplitud máxima superada (niveles)
Secuencias completamente correctas (recuento)
Puntuaciones medias en el primer y el segundo bloque consecutivo para las dos reglas basadas en recuentos (niveles de amplitud y número de secuencias). El crédito parcial se desplazó en su propia escala, de 0,876 a 0,894. Como los bloques se administraron siempre en el mismo orden con conjuntos de secuencias fijos distintos, el orden de bloque está confundido con el conjunto de ítems y no puede identificarse ninguna causa.
7Por qué una puntuación más detallada no ayudó
Una puntuación de crédito parcial conserva más información a nivel del ensayo individual. Eso no es lo mismo que conservar diferencias estables entre personas, y este conjunto de datos separa con nitidez ambas ideas.
Restringido a las longitudes intentadas en ambos bloques, el crédito parcial concentró a la mayoría de los participantes en una precisión posicional alta — media de 0,876 en el bloque 1 y 0,894 en el bloque 2, con desviaciones estándar de solo 0,070 y 0,074. La dispersión entre personas disponible para ser reproducida era, por tanto, pequeña. Al mismo tiempo, las posiciones exactas en las que caían los errores variaron considerablemente entre los dos conjuntos de secuencias. La mayor parte de la resolución numérica adicional era posición del error, y la posición del error no se repitió.
Hay una segunda razón, estructural, por la que la restricción de longitudes comunes perjudicó. Descarta deliberadamente las longitudes que un participante alcanzó en solo uno de los bloques — que es precisamente donde reside buena parte de la diferencia de capacidad entre personas. Por eso relajar la restricción mejora sustancialmente el coeficiente, como muestra la sección siguiente, sin acercarlo nunca a las puntuaciones simples.
8Cuánto se movió realmente una amplitud
La amplitud máxima es el resultado más fácil de entender para una persona, así que su inestabilidad es el hallazgo más relevante en la práctica. En 1433 participantes evaluados dos veces dentro de una misma sesión, solo un tercio reprodujo la misma cifra.
Porcentajes descriptivos de este experimento dentro de una misma sesión. No son normas ni umbrales para interpretar ningún resultado individual.
Porcentaje de los 1433 participantes según el tamaño del cambio entre bloques en la amplitud máxima superada. La dirección fue: 38,7 % mejoró, 28,3 % empeoró y 33,0 % se mantuvo igual. El cambio absoluto medio fue de 0,960 niveles de amplitud — en términos prácticos, aproximadamente un nivel.
Esto significa que un cambio como 7 → 8 es totalmente compatible con la variabilidad ordinaria de una repetición inmediata. No debe leerse como evidencia de que la capacidad de memoria subyacente de la persona haya mejorado.
Los límites de acuerdo de Bland–Altman muestran lo mismo en las unidades de cada puntuación.5 Para la amplitud máxima, el sesgo fue de +0,199 con límites del 95 % de −2,408 a +2,805 niveles. Para las secuencias completamente correctas, el sesgo fue de +0,382 con límites de −3,802 a +4,567 secuencias. Para el crédito parcial, el sesgo fue de +0,018 con límites de −0,177 a +0,212. Las medias ocultan movimientos individuales grandes: el desplazamiento medio es pequeño, y el rango individual no lo es.
9Análisis de sensibilidad y comprobaciones de validación
El resultado central no debería depender de una implementación arbitraria del crédito parcial, así que ejecutamos las alternativas preespecificadas: un crédito por distancia de edición en lugar del crédito posicional estricto, y todas las longitudes intentadas en lugar de solo las longitudes comunes.
La línea vertical gris marca el cero. Ambos intervalos de longitudes comunes incluyen el cero.
ICC(2,1) con intervalos del 95 % por bootstrap de participantes para cuatro implementaciones de crédito parcial, mostradas frente a las dos reglas simples. Usar todas las longitudes intentadas casi cuadruplica la fiabilidad del crédito parcial, y la variante de distancia de edición es casi indistinguible del crédito posicional estricto — pero ninguna versión de crédito parcial se acerca a la amplitud máxima, y menos aún al recuento de secuencias completamente correctas.
Incluso en su mejor especificación, el crédito parcial se quedó muy atrás: el crédito parcial con todas las longitudes intentadas menos la amplitud máxima fue de −0,327 (IC del 95 % −0,400 a −0,248). La conclusión no depende de qué definición de crédito parcial usemos.
- Respuestas vacías — los 50 ensayos con array vacío se excluyeron en el análisis primario. Conservarlos en su lugar como intentos genuinos con crédito cero movió el ICC del crédito parcial de longitudes comunes de 0,0498 a 0,0503. La conclusión no cambia, así que la regla de exclusión no está impulsando el resultado nulo.
- Recálculo independiente de la corrección — la precisión exacta reconstruida a partir del estímulo y la respuesta brutos discrepó del indicador proporcionado por el conjunto de datos en 0 ensayos.
- Bootstrap de conglomerados por sede — remuestrear unidades de investigación completas en lugar de individuos dio intervalos del 95 % del ICC de 0,479–0,582 para la amplitud máxima, 0,572–0,646 para las secuencias completamente correctas y −0,019–0,120 para el crédito parcial. El orden sobrevive al respetar la estructura de conglomerados del conjunto de datos.
- Etiquetas de grupo — todas las puntuaciones se calcularon con independencia de la condición de músico/no músico, de la sede y del país, y no se realizó ninguna comparación ni clasificación de grupos.
10Qué debe entenderse por una puntuación de amplitud de dígitos
La lectura más útil de estos hallazgos es que un resultado de amplitud de dígitos no es simplemente un hecho sobre la memoria de una persona. Lo producen conjuntamente el participante, las secuencias concretas presentadas, la regla de parada adaptativa y el sistema de puntuación. Cambie solo el último y la repetibilidad inmediata pasa de 0,611 a 0,050 en exactamente los mismos ensayos.
La amplitud máxima comprime toda una prueba en un único umbral. El crédito parcial conservó más detalle de los ensayos pero, aquí, conservó sobre todo detalle que no sobrevivió a un cambio de conjunto de secuencias. El recuento de secuencias completamente correctas fue el mejor compromiso disponible en este conjunto de datos: usa el conjunto completo de resultados de acierto/fallo evitando el comportamiento de umbral único de la amplitud máxima.
La implicación comunicativa es tan importante como la de puntuación. Un resultado se describe mejor como rendimiento en las condiciones de evaluación actuales, no como una medición fija de la capacidad cognitiva de alguien.
11Qué afirmamos y qué no
Los límites de las afirmaciones se fijaron antes de que existieran resultados, en línea con las buenas prácticas de evaluación.8 Con las cifras ya incorporadas, las afirmaciones respaldadas son:
- En este conjunto de datos, tres reglas de puntuación defendibles aplicadas a ensayos idénticos produjeron repetibilidades inmediatas muy distintas.
- El recuento de secuencias completamente correctas fue la puntuación más repetible de las evaluadas (ICC 0,611), de forma modesta pero consistente por delante de la amplitud máxima superada (0,535).
- La puntuación preespecificada de crédito parcial por posición serial en longitudes comunes no fue más repetible que la amplitud máxima; fue drásticamente peor (0,050), y la hipótesis quedó contradicha.
- Solo alrededor de un tercio de los participantes reprodujo la misma amplitud máxima en dos bloques consecutivos, con un movimiento absoluto medio cercano a un nivel.
12Limitaciones
- Ambos bloques se realizaron en la misma sesión de laboratorio, así que esto estima la repetibilidad inmediata, no la estabilidad a lo largo de días, semanas o meses.
- Los dos bloques usaron conjuntos de secuencias fijos distintos y se administraron siempre en el mismo orden, así que el orden de bloque está confundido con el conjunto de ítems.
- La parada adaptativa crea una ausencia estructural de datos: los ensayos más difíciles nunca se presentan después de que un participante alcance su punto de parada, que es justo lo que la restricción de longitudes comunes intentó manejar, de forma imperfecta.
- La restricción de longitudes comunes descarta las longitudes alcanzadas en un solo bloque, y esa decisión es en sí misma parte de por qué el coeficiente primario del crédito parcial es tan bajo; la variante con todas las longitudes intentadas se presenta a su lado.
- La muestra son adultos de 18 a 30 años reclutados para un programa de investigación de músicos/no músicos, no una muestra normativa representativa de la población, y pueden quedar diferencias residuales entre sedes pese al bootstrap de conglomerados.
- La tarea fuente es una amplitud de dígitos directa visual que empieza en dos dígitos; la prueba de memoria de trabajo de Altamens difiere en interfaz, dispositivo y longitud inicial, así que estos coeficientes no son estimaciones de fiabilidad de Altamens.
- La amplitud de dígitos directa es un componente estrecho de la memoria a corto plazo y no debe equipararse con la memoria de trabajo en su conjunto ni con la capacidad cognitiva general.
- Cincuenta ensayos con respuesta vacía exigieron una regla de tratamiento; se ejecutaron ambas reglas y coincidieron, pero la elección siguió siendo nuestra.
- El estudio estuvo guiado por protocolo, con las reglas de puntuación y los estimandos congelados antes de examinar los resultados, pero no fue prerregistrado formalmente en un registro público antes de su ejecución.
Referencias
- 1.Talamini F, Grassi M, Altoè G, et al. Music Ensemble: a large dataset on musicianship, cognition, and personality in musicians and nonmusicians. Scientific Data 13, 473, 2026. Dataset descriptor, cited for methods only (article is CC BY-NC-ND). https://doi.org/10.1038/s41597-026-06654-0
- 2.Music Ensemble consortium Music Ensemble — Open Science Framework project (trial-level data). OSF · DOI 10.17605/OSF.IO/Y97T3, 2026. CC BY 4.0; digit-span trial file at data/raw-after-selection/digit_span.csv. https://osf.io/y97t3/
- 3.Shrout PE, Fleiss JL Intraclass correlations: uses in assessing rater reliability. Psychological Bulletin 86(2), 420–428, 1979. Definition of the ICC(2,1) form used here. https://doi.org/10.1037/0033-2909.86.2.420
- 4.Koo TK, Li MY A Guideline of Selecting and Reporting Intraclass Correlation Coefficients for Reliability Research. Journal of Chiropractic Medicine 15(2), 155–163, 2016. https://doi.org/10.1016/j.jcm.2016.02.012
- 5.Bland JM, Altman DG Statistical methods for assessing agreement between two methods of clinical measurement. The Lancet 327(8476), 307–310, 1986. https://doi.org/10.1016/S0140-6736(86)90837-8
- 6.Conway ARA, Kane MJ, Bunting MF, Hambrick DZ, Wilhelm O, Engle RW Working memory span tasks: A methodological review and user's guide. Psychonomic Bulletin & Review 12(5), 769–786, 2005. Reviews all-or-nothing versus partial-credit span scoring. https://doi.org/10.3758/BF03196772
- 7.Woods DL, Kishiyama MM, Yund EW, et al. Improving digit span assessment of short-term verbal memory. Journal of Clinical and Experimental Neuropsychology 33(1), 101–111, 2011. https://doi.org/10.1080/13803390903424355
- 8.American Educational Research Association, American Psychological Association, National Council on Measurement in Education Standards for Educational and Psychological Testing. AERA, 2014. https://www.testingstandards.net/