Altamens Ricerca · Rianalisi di dati aperti
Quanto è stabile il tuo span di cifre?
Un test su 1.433 persone di regole di punteggio e ripetibilità immediata: il punteggio più semplice basato su tutte le prove è risultato il più ripetibile, e il nostro punteggio prespecificato a credito parziale il peggiore — l'opposto di quanto avevamo previsto.
Sintesi
Un risultato di span di cifre viene di solito riportato come un numero unico, ma quel numero dipende sia dalla persona esaminata sia dal modo in cui le prove vengono convertite in un punteggio. Abbiamo rianalizzato il file pubblico delle prove di span di cifre del dataset Music Ensemble (CC BY 4.0), in cui adulti hanno svolto due volte di seguito un compito visivo di span di cifre in avanti con insiemi di sequenze fisse diversi. Dopo la pulizia prespecificata, 38.054 prove sostanziali di 1.433 partecipanti sono entrate nell'analisi primaria. Tre regole di punteggio sono state definite prima di esaminare gli esiti: lo span massimo superato, il totale di sequenze completamente corrette e il credito parziale per posizione seriale limitato alle lunghezze di sequenza tentate in entrambi i blocchi. L'estimando primario era l'ICC(2,1), una correlazione intraclasse a effetti casuali a due vie, ad accordo assoluto e misura singola, con 5.000 ricampionamenti bootstrap sui partecipanti.
Le sequenze completamente corrette sono risultate le più ripetibili (ICC 0,611; IC 95% 0,566–0,651), seguite dallo span massimo superato (0,535; 0,478–0,586). Il credito parziale a lunghezze comuni è risultato prossimo allo zero (0,050; −0,009–0,114), una differenza di −0,485 rispetto allo span massimo (−0,556 a −0,407). Usare tutte le lunghezze tentate ha portato il credito parziale a 0,209 (0,145–0,270), lasciandolo però molto al di sotto di entrambi i punteggi più semplici, e una variante a distanza di edit si è comportata quasi allo stesso modo. L'ipotesi prespecificata secondo cui il credito parziale avrebbe migliorato la ripetibilità è dunque stata contraddetta. Un punteggio può contenere più dettaglio numerico senza contenere più segnale stabile tra le persone.
Risultati chiave
- In 1.433 adulti che hanno completato due blocchi consecutivi di span di cifre in avanti, il numero totale di sequenze completamente corrette è stato il punteggio più ripetibile: ICC(2,1) = 0,611 (IC 95% bootstrap 0,566–0,651).
- Lo span massimo superato convenzionale è risultato moderatamente ripetibile: ICC(2,1) = 0,535 (0,478–0,586). Il conteggio delle sequenze completamente corrette lo ha superato di +0,076 (IC congiunto bootstrap +0,052 a +0,102).
- Il punteggio prespecificato a credito parziale per posizione seriale, calcolato sulle lunghezze tentate in entrambi i blocchi, è risultato il peggiore: ICC(2,1) = 0,050 (−0,009–0,114), ossia −0,485 rispetto allo span massimo (−0,556 a −0,407). La nostra ipotesi è stata contraddetta, non semplicemente non supportata.
- Solo il 33,0% dei partecipanti ha registrato lo stesso span massimo due volte; il 45,8% si è spostato di esattamente un livello e il 21,2% di due o più. La variazione assoluta media è stata di 0,960 livelli di span.
- Il blocco 2 è stato leggermente più alto su ogni punteggio (span massimo +0,199 livelli; IC 95% +0,130 a +0,267), ma l'ordine dei blocchi è confuso con l'insieme di sequenze, quindi non è identificabile alcuna causa.
- Questo misura la ripetibilità immediata nella stessa sessione in adulti di 18–30 anni. Non è una stima di stabilità da una settimana all'altra, né una soglia clinica, né una norma di popolazione, né una prova che l'allenamento migliori la memoria.
1La domanda di misurazione
Lo span di cifre sembra il test più semplice della psicologia cognitiva. Viene presentata una sequenza di cifre, tu la riproduci nello stesso ordine e le sequenze si allungano fino a quando il compito diventa troppo difficile. Il risultato viene di solito riportato come un fatto: «il mio span di cifre è sette».
Ma quel numero non deriva soltanto dalla persona. Deriva anche dalla regola usata per trasformare un insieme di prove in un punteggio.
Supponiamo che la sequenza bersaglio sia 5 2 9 4 7 1 e che qualcuno risponda 5 2 9 4 8 1. Cinque posizioni su sei sono corrette. Una regola rigida di successo/insuccesso tratta quella risposta esattamente come una completamente sbagliata. Una regola a credito parziale conserva l'informazione che cinque posizioni erano corrette.
La nostra domanda di ricerca era circoscritta e con una risposta possibile: se la stessa persona completa due versioni consecutive di un compito di span di cifre in avanti, quale regola di punteggio produce il risultato più ripetibile?
La nostra ipotesi prespecificata era che il credito parziale avrebbe attenuato le soglie brusche create dal punteggio a span massimo e prodotto quindi una maggiore affidabilità tra blocchi — un'aspettativa coerente con l'argomento generale a favore del credito parziale nella letteratura sulla memoria di lavoro.6 Non è stato così. Il punteggio a credito parziale è risultato di gran lunga il meno ripetibile dei tre.
2Il compito e cosa significa qui «ripetibilità»
I partecipanti hanno svolto un compito visivo di span di cifre in avanti. Le cifre venivano mostrate una alla volta. Il compito iniziava con sequenze brevi e presentava due prove per ciascuna lunghezza di sequenza. Se almeno una di quelle due prove veniva richiamata in modo completamente corretto, la lunghezza della sequenza aumentava di uno. Il compito si interrompeva dopo due prove errate alla stessa lunghezza.
Fatto essenziale, i partecipanti hanno svolto l'intero compito due volte di seguito, con insiemi di sequenze fisse diversi. Questo fornisce due misurazioni per persona in condizioni molto simili, che è esattamente ciò che serve a una domanda sulla ripetibilità.
La regola di arresto adattiva conta per l'analisi, perché crea una mancanza strutturale di dati: le lunghezze di sequenza più difficili non vengono mai presentate una volta che il partecipante si ferma. Un partecipante che va meglio in un blocco incontra automaticamente sequenze più difficili in quel blocco, quindi qualunque punteggio calcolato su «tutte le prove che la persona ha visto» è in parte un punteggio calcolato su un test più difficile. La letteratura metodologica sullo span di cifre ha osservato da tempo che i dettagli di somministrazione e di arresto plasmano il punteggio risultante.7
3Il dataset — e come scaricarlo
Abbiamo usato il dataset pubblico Music Ensemble: una batteria standardizzata di laboratorio di misure di musicalità, cognizione e personalità raccolta da 1.438 adulti di 18–30 anni in 35 unità di ricerca in 16 paesi.1 Il progetto è pubblicato apertamente su OSF con licenza CC BY 4.0.
La pulizia prespecificata ha rimosso il blocco di familiarizzazione (blocco 0, 2.866 righe) e 50 prove sostanziali il cui campo di risposta conteneva un array vuoto. Non risultavano identificatori di partecipante/blocco/prova mancanti né record duplicati di partecipante × blocco × prova. Marche temporali e identificatori degli sperimentatori sono stati eliminati prima dell'analisi, e in questo rapporto non viene classificato alcun paese, sede o gruppo demografico.
- Righe grezze delle prove di span di cifre su OSF40,970
data/raw-after-selection/digit_span.csv · 16 variabili · un blocco di familiarizzazione più due blocchi sostanziali
- Rimosso: blocco di familiarizzazione (blocco 0)−2,866
Prove di pratica, escluse da ogni punteggio
- Identificatori mancanti e record duplicati0
Non sono stati trovati identificatori di partecipante/blocco/prova mancanti né righe duplicate di partecipante × blocco × prova
- Rimosso: risposte vuote−50
Prove sostanziali il cui campo di risposta era un array vuoto; un'analisi di sensibilità le conserva come tentativi a credito zero
- Prove sostanziali primarie38,054
1.433 partecipanti, ognuno con osservazioni identificabili in entrambi i blocchi sostanziali
- Minimo definito dal protocollo per procedere — soddisfatto≥ 1,200
Almeno 1.200 partecipanti con due blocchi identificabili e stringhe di stimolo/risposta interpretabili
Tutte le esclusioni applicate al file pubblico delle prove di span di cifre, nell'ordine prespecificato. Il protocollo richiedeva almeno 1.200 partecipanti con due blocchi identificabili prima di poter esaminare gli esiti; 1.433 partecipanti hanno soddisfatto il requisito, quindi l'analisi è proseguita.
Non abbiamo dato per buono il campo di correttezza del dataset. L'accuratezza esatta è stata ricostruita in modo indipendente dallo stimolo grezzo e dalla risposta grezza del partecipante, poi confrontata con l'indicatore fornito: discordanze tra originale e ricalcolato = 0. Il campo di correttezza pubblicato ha coinciso perfettamente con il confronto esatto stimolo-risposta, un buon segnale per l'integrità del file e ciò significa che i nostri punteggi si basano su esiti di prova verificati.
4Tre modi prespecificati di punteggiare lo stesso test
Tutti e tre i punteggi sono stati derivati in modo indipendente all'interno di ciascun blocco, dalle stesse prove pulite, usando definizioni scritte prima di esaminare qualsiasi esito.
- Span massimo superato — la lunghezza di sequenza più lunga in cui almeno una delle due prove è stata richiamata perfettamente. È il risultato convenzionale e intuitivo («span = 7»), ma comprime un intero test in una sola soglia: una singola prova riuscita può spostare qualcuno di un livello intero.
- Sequenze completamente corrette — il conteggio totale delle prove completamente corrette nel blocco. È anche il punteggio per blocco usato nello studio originale Music Ensemble e sfrutta l'intero insieme degli esiti successo/insuccesso restando banalmente facile da spiegare.
- Credito parziale per posizione seriale — la proporzione di posizioni di cifra presentate richiamate con la cifra corretta nella posizione corretta. Una sequenza di sei cifre con cinque cifre posizionate correttamente vale 5 / 6 = 83,3%. Nell'analisi primaria è stato calcolato solo sulle lunghezze di sequenza tentate dal partecipante in entrambi i blocchi, proprio per evitare che l'arresto adattivo confrontasse un test più facile con uno più difficile.
5Come è stata stimata la ripetibilità
La statistica di affidabilità primaria era l'ICC(2,1): una correlazione intraclasse a effetti casuali a due vie, ad accordo assoluto e misura singola.3,4
L'accordo assoluto è la scelta importante. Una correlazione ordinaria può restare alta anche quando il punteggio di tutti si sposta sistematicamente tra i blocchi, perché le interessa solo il mantenimento dell'ordinamento. L'ICC(2,1) penalizza quel tipo di disaccordo, che è esattamente ciò che serve quando la domanda pratica è «questa persona otterrebbe di nuovo lo stesso numero?».
Per ogni regola di punteggio abbiamo calcolato anche la stabilità dei ranghi di Spearman, la differenza assoluta media tra blocchi, la deviazione standard intra-persona, la differenza media blocco 2 − blocco 1 e il bias e i limiti di accordo al 95% di Bland–Altman.5 Gli intervalli di confidenza derivano da 5.000 ricampionamenti bootstrap sui partecipanti, e i contrasti tra regole di punteggio sono stati calcolati all'interno delle stesse estrazioni bootstrap, così che la differenza tra due ICC porti con sé il proprio intervallo. Poiché i partecipanti sono stati reclutati in 35 unità di ricerca, ogni coefficiente principale è stato inoltre ristimato con un bootstrap a cluster di sede.
6Risultati: ha vinto il punteggio più semplice su tutte le prove
Risultato primario: il conteggio delle sequenze completamente corrette è stato il punteggio più ripetibile (ICC 0,611; IC 95% 0,566–0,651), lo span massimo superato è risultato moderatamente ripetibile (0,535; 0,478–0,586) e il punteggio prespecificato a credito parziale su lunghezze comuni è risultato praticamente non ripetibile (0,050; −0,009–0,114).
ICC a effetti casuali a due vie, accordo assoluto, misura singola. Passa il cursore su una riga per evidenziarla. La linea verticale grigia indica lo zero.
ICC(2,1) con intervalli al 95% da bootstrap sui partecipanti (5.000 ricampionamenti), N = 1.433. Più alto significa più ripetibile. La stabilità dei ranghi di Spearman ha seguito lo stesso ordinamento: 0,605, 0,535 e 0,064 rispettivamente. L'intervallo del credito parziale attraversa lo zero, quindi questa analisi non può distinguere il suo segnale tra le persone dall'assenza di segnale.
Il margine tra i due punteggi semplici è stato piccolo ma coerente: il conteggio delle sequenze completamente corrette ha superato lo span massimo superato di +0,076, con un IC congiunto al 95% da bootstrap sui partecipanti da +0,052 a +0,102. Vale la pena dirlo con chiarezza, perché il punteggio migliore non è stato quello più sofisticato. È stato l'ordinario conteggio delle sequenze richiamate correttamente del compito di origine.
Il risultato del credito parziale è andato nella direzione opposta, e con forza. Credito parziale meno span massimo è stato pari a −0,485 (IC 95% bootstrap −0,556 a −0,407). L'intervallo si colloca molto al di sotto dello zero, quindi l'ipotesi prespecificata è stata contraddetta e non semplicemente non supportata.
La prestazione media è stata leggermente più alta nel secondo blocco per tutti e tre i punteggi. Lo span massimo è passato da 6,548 ± 1,373 a 6,747 ± 1,401 (variazione media +0,199; IC 95% +0,130 a +0,267). Le sequenze completamente corrette sono passate da 9,890 ± 2,443 a 10,273 ± 2,442 (+0,382; IC 95% +0,272 a +0,496). Il credito parziale è passato da 0,876 ± 0,070 a 0,894 ± 0,074 (+0,0179; IC 95% +0,0128 a +0,0229).
Span massimo superato (livelli)
Sequenze completamente corrette (conteggio)
Punteggi medi nel primo e nel secondo blocco consecutivo per le due regole basate sul conteggio (livelli di span e numero di sequenze). Il credito parziale si è spostato sulla propria scala, da 0,876 a 0,894. Poiché i blocchi sono stati sempre somministrati nello stesso ordine con insiemi di sequenze fisse diversi, l'ordine dei blocchi è confuso con l'insieme degli item e non è identificabile alcuna causa.
7Perché un punteggio più dettagliato non ha aiutato
Un punteggio a credito parziale conserva più informazione a livello della singola prova. Non è la stessa cosa che conservare differenze stabili tra le persone, e questo dataset separa nitidamente le due idee.
Limitato alle lunghezze tentate in entrambi i blocchi, il punteggio parziale ha concentrato la maggior parte dei partecipanti su un'accuratezza posizionale elevata — media 0,876 nel blocco 1 e 0,894 nel blocco 2, con deviazioni standard di soli 0,070 e 0,074. La dispersione tra le persone disponibile per essere riprodotta era quindi ridotta. Al tempo stesso, le posizioni esatte in cui cadevano gli errori variavano considerevolmente tra i due insiemi di sequenze. La maggior parte della risoluzione numerica aggiuntiva era posizione dell'errore, e la posizione dell'errore non si è ripetuta.
C'è una seconda ragione, strutturale, per cui la restrizione alle lunghezze comuni ha penalizzato. Scarta deliberatamente le lunghezze che un partecipante ha raggiunto in un solo blocco — che è precisamente dove risiede buona parte della differenza di abilità tra le persone. Per questo allentare la restrizione migliora sostanzialmente il coefficiente, come mostra la sezione successiva, senza però avvicinarlo mai ai punteggi semplici.
8Quanto si è spostato davvero uno span
Lo span massimo è il risultato più facile da capire per una persona, quindi la sua instabilità è il dato più rilevante nella pratica. Su 1.433 partecipanti testati due volte nella stessa sessione, solo un terzo ha riprodotto lo stesso numero.
Percentuali descrittive di questo esperimento nella stessa sessione. Non sono norme né soglie per interpretare un singolo risultato individuale.
Percentuale dei 1.433 partecipanti per entità della variazione dello span massimo superato tra i blocchi. La direzione è stata: 38,7% migliorati, 28,3% peggiorati e 33,0% invariati. La variazione assoluta media è stata di 0,960 livelli di span — in termini pratici, circa un livello.
Questo significa che una variazione come 7 → 8 è del tutto compatibile con la normale variabilità di una ripetizione immediata. Non va letta come prova che la capacità di memoria di fondo della persona sia migliorata.
I limiti di accordo di Bland–Altman mostrano la stessa cosa nelle unità di ciascun punteggio.5 Per lo span massimo, il bias è stato di +0,199 con limiti al 95% da −2,408 a +2,805 livelli. Per le sequenze completamente corrette, il bias è stato di +0,382 con limiti da −3,802 a +4,567 sequenze. Per il credito parziale, il bias è stato di +0,018 con limiti da −0,177 a +0,212. Le medie nascondono grandi spostamenti individuali: lo scostamento medio è piccolo, l'intervallo individuale no.
9Analisi di sensibilità e verifiche di validazione
Il risultato centrale non dovrebbe dipendere da una singola implementazione arbitraria del punteggio parziale, quindi abbiamo eseguito le alternative prespecificate: un credito a distanza di edit invece del credito posizionale rigido, e tutte le lunghezze tentate invece delle sole lunghezze comuni.
La linea verticale grigia indica lo zero. Entrambi gli intervalli a lunghezze comuni includono lo zero.
ICC(2,1) con intervalli al 95% da bootstrap sui partecipanti per quattro implementazioni del credito parziale, mostrate accanto alle due regole semplici. Usare tutte le lunghezze tentate quadruplica quasi l'affidabilità del credito parziale, e la variante a distanza di edit è quasi indistinguibile dal credito posizionale rigido — ma nessuna versione a credito parziale si avvicina allo span massimo, e ancor meno al conteggio delle sequenze completamente corrette.
Anche nella sua migliore specificazione, il credito parziale è rimasto molto indietro: credito parziale su tutte le lunghezze tentate meno span massimo è stato pari a −0,327 (IC 95% −0,400 a −0,248). La conclusione non dipende da quale definizione di credito parziale si usi.
- Risposte vuote — le 50 prove con array vuoto sono state escluse nell'analisi primaria. Conservarle invece come autentici tentativi a credito zero ha spostato l'ICC del credito parziale a lunghezze comuni da 0,0498 a 0,0503. La conclusione non cambia, quindi la regola di esclusione non è la causa del risultato nullo.
- Ricalcolo indipendente della correttezza — l'accuratezza esatta ricostruita da stimolo e risposta grezzi ha discordato dall'indicatore fornito dal dataset in 0 prove.
- Bootstrap a cluster di sede — ricampionare interi centri di ricerca invece dei singoli individui ha dato intervalli ICC al 95% di 0,479–0,582 per lo span massimo, 0,572–0,646 per le sequenze completamente corrette e −0,019–0,120 per il credito parziale. L'ordinamento resiste anche rispettando la struttura a cluster del dataset.
- Etichette di gruppo — tutti i punteggi sono stati calcolati indipendentemente dallo status di musicista/non musicista, dalla sede e dal paese, e non è stato effettuato alcun confronto o ordinamento tra gruppi.
10Cosa deve significare un punteggio di span di cifre
La lettura più utile di questi risultati è che un risultato di span di cifre non è semplicemente un fatto sulla memoria di una persona. È prodotto congiuntamente dal partecipante, dalle particolari sequenze presentate, dalla regola di arresto adattiva e dal sistema di punteggio. Cambiando solo l'ultimo di questi, la ripetibilità immediata è passata da 0,611 a 0,050 sulle stesse identiche prove.
Lo span massimo comprime un intero test in una sola soglia. Il credito parziale ha conservato più dettaglio delle prove ma, qui, ha conservato soprattutto dettaglio che non è sopravvissuto a un cambio di insieme di sequenze. Il conteggio delle sequenze completamente corrette è stato il miglior compromesso disponibile in questo dataset: usa l'intero insieme degli esiti successo/insuccesso evitando il comportamento a soglia unica dello span massimo.
L'implicazione comunicativa è tanto importante quanto quella sul punteggio. Un risultato si descrive meglio come prestazione nelle attuali condizioni di test, non come una misura fissa della capacità cognitiva di qualcuno.
11Cosa affermiamo e cosa no
I limiti delle affermazioni sono stati fissati prima che esistessero risultati, in linea con le buone prassi di testing.8 Con i numeri ora disponibili, le affermazioni supportate sono:
- In questo dataset, tre regole di punteggio difendibili applicate a prove identiche hanno prodotto ripetibilità immediate molto diverse.
- Il conteggio delle sequenze completamente corrette è stato il punteggio più ripetibile tra quelli testati (ICC 0,611), in modo modesto ma coerente davanti allo span massimo superato (0,535).
- Il punteggio prespecificato a credito parziale per posizione seriale su lunghezze comuni non è stato più ripetibile dello span massimo; è stato drasticamente peggiore (0,050), e l'ipotesi è stata contraddetta.
- Solo circa un terzo dei partecipanti ha riprodotto lo stesso span massimo in due blocchi consecutivi, con uno spostamento assoluto medio vicino a un livello.
12Limitazioni
- Entrambi i blocchi si sono svolti nella stessa sessione di laboratorio, quindi questo stima la ripetibilità immediata, non la stabilità nell'arco di giorni, settimane o mesi.
- I due blocchi hanno usato insiemi di sequenze fisse diversi e sono stati sempre somministrati nello stesso ordine, quindi l'ordine dei blocchi è confuso con l'insieme degli item.
- L'arresto adattivo crea una mancanza strutturale di dati: le prove più difficili non vengono mai presentate dopo che un partecipante raggiunge il proprio punto di arresto, che è esattamente ciò che la restrizione alle lunghezze comuni ha cercato — imperfettamente — di gestire.
- La restrizione alle lunghezze comuni scarta le lunghezze raggiunte in un solo blocco, e quella scelta è essa stessa parte del motivo per cui il coefficiente primario del credito parziale è così basso; la variante con tutte le lunghezze tentate è riportata accanto.
- Il campione è composto da adulti di 18–30 anni reclutati per un programma di ricerca su musicisti/non musicisti, non da un campione normativo rappresentativo della popolazione, e differenze residue tra sedi possono persistere nonostante il bootstrap a cluster.
- Il compito di origine è uno span di cifre in avanti visivo che parte da due cifre; il test di memoria di lavoro di Altamens differisce per interfaccia, dispositivo e lunghezza iniziale, quindi questi coefficienti non sono stime di affidabilità di Altamens.
- Lo span di cifre in avanti è una componente ristretta della memoria a breve termine e non va equiparato alla memoria di lavoro nel suo insieme né all'abilità cognitiva generale.
- Cinquanta prove con risposta vuota hanno richiesto una regola di gestione; entrambe le regole sono state eseguite e hanno concordato, ma la scelta è rimasta nostra.
- Lo studio è stato guidato da protocollo, con regole di punteggio ed estimandi congelati prima di esaminare gli esiti, ma non è stato preregistrato formalmente in un registro pubblico prima dell'esecuzione.
Riferimenti
- 1.Talamini F, Grassi M, Altoè G, et al. Music Ensemble: a large dataset on musicianship, cognition, and personality in musicians and nonmusicians. Scientific Data 13, 473, 2026. Dataset descriptor, cited for methods only (article is CC BY-NC-ND). https://doi.org/10.1038/s41597-026-06654-0
- 2.Music Ensemble consortium Music Ensemble — Open Science Framework project (trial-level data). OSF · DOI 10.17605/OSF.IO/Y97T3, 2026. CC BY 4.0; digit-span trial file at data/raw-after-selection/digit_span.csv. https://osf.io/y97t3/
- 3.Shrout PE, Fleiss JL Intraclass correlations: uses in assessing rater reliability. Psychological Bulletin 86(2), 420–428, 1979. Definition of the ICC(2,1) form used here. https://doi.org/10.1037/0033-2909.86.2.420
- 4.Koo TK, Li MY A Guideline of Selecting and Reporting Intraclass Correlation Coefficients for Reliability Research. Journal of Chiropractic Medicine 15(2), 155–163, 2016. https://doi.org/10.1016/j.jcm.2016.02.012
- 5.Bland JM, Altman DG Statistical methods for assessing agreement between two methods of clinical measurement. The Lancet 327(8476), 307–310, 1986. https://doi.org/10.1016/S0140-6736(86)90837-8
- 6.Conway ARA, Kane MJ, Bunting MF, Hambrick DZ, Wilhelm O, Engle RW Working memory span tasks: A methodological review and user's guide. Psychonomic Bulletin & Review 12(5), 769–786, 2005. Reviews all-or-nothing versus partial-credit span scoring. https://doi.org/10.3758/BF03196772
- 7.Woods DL, Kishiyama MM, Yund EW, et al. Improving digit span assessment of short-term verbal memory. Journal of Clinical and Experimental Neuropsychology 33(1), 101–111, 2011. https://doi.org/10.1080/13803390903424355
- 8.American Educational Research Association, American Psychological Association, National Council on Measurement in Education Standards for Educational and Psychological Testing. AERA, 2014. https://www.testingstandards.net/