斯特魯普測驗指南:顏色詞任務如何進行
藍色一詞以紅色墨水顯示。你的工作是對墨水顏色——紅色——做出反應,同時忽略這個詞本身。
這個小衝突是斯特魯普任務的基礎。這是一種眾所周知的實驗方法,用於研究當練習的反應(例如閱讀單字)與指令要求的反應競爭時會發生什麼。
本指南解釋了任務如何進行、我們的線上版本記錄了什麼以及解釋應該在哪裡停止。
兩種試驗類型
顏色詞斯特魯普任務通常至少包括兩個條件:
- 一致:文字與墨水顏色匹配,例如藍色墨水中的BLUE。
- 不一致:文字與墨水顏色衝突,例如紅色墨水中的藍色。
在不一致的試驗中,人們通常會變得更慢或更容易出錯。兩種條件之間的表現差異稱為斯特魯普干涉效應。
John Ridley Stroop 在 1935 年的論文《串列言語反應幹擾研究》中記錄了這種幹擾。此後,基本結果已透過許多任務設計、語言和回應方法得以重現。
我們的線上測試記錄是什麼
在線上 Stroop 測試中,選擇墨水顏色,同時嘗試忽略該單字。結果頁面總結了該會話的幾個部分:
- 準確性:正確答案的試驗比例。
- 平均反應時間:有效試驗的反應時間。
- **一致和不一致反應時間:**每個條件的平均值。
- 斯特魯普效應:不一致反應時間減去一致反應時間。
- **條件準確度:**誤差是否集中在一種條件下。
準確性和時機是一體的。如果錯誤較多,則更快的結果不一定會更好。同樣,僅基於幾次正確試驗的干擾估計不如基於完整會話的干擾估計穩定。
結果可以告訴您什麼
結果描述了您此時在此裝置上執行該版本任務的情況。它可以幫助您:
- 查看一致試驗和不一致試驗之間的差異。
- 請注意您自己的回答中的速度與準確性之間的權衡。
- 比較在相似條件下完成的重複會話。
- 在課堂或個人學習活動中表現出認知幹擾。
這些都是有用的觀察結果,但它們比「注意力水平」、「大腦年齡」或「認知健康」等標籤範圍更窄。單一瀏覽器會話無法建立這些更廣泛的特徵。
結果無法告訴您什麼
該網站不是標準化的臨床儀器。其結果不應用於:
- 診斷 ADHD、失智症、學習障礙或任何其他病症;
- 確定兒童或成人是否有註意力問題;
- 將您的分數與未引用的基於年齡的標準進行比較;
- 證明認知訓練改變了一般智力;
- 做出就業、駕駛、醫療或教育安置決定。
實驗任務可以產生很強的平均效果,但對個體進行排名仍然不太可靠。對 Stroop 任務的研究也發現,原始反應時間測量的可靠性可能與幹擾差異評分的可靠性不同。這就是為什麼合格評估使用經過驗證的程序、適當的規範和多種證據來源的原因之一。
為什麼分數會變化
即使這個人沒有發生有意義的改變,表現也會有所不同。常見的影響包括:
- 裝置和瀏覽器:顯示刷新、輸入硬體、作業系統和瀏覽器調度會增加延遲。
- 反應方法:滑鼠、實體鍵盤和觸控螢幕沒有相同的時序。
- 語言和閱讀流暢性:競爭詞反應的強度部分取決於對顯示語言的熟悉程度。
- 練習:學習反應映射可以讓以後的課程變得更容易。
- 環境:中斷、螢幕可見性和背景活動會影響會話。
- **暫時狀態:**疲勞、壓力、動力和警覺性都會影響速度和準確性。
基於瀏覽器的任務對於演示和設備內比較非常有用,但絕對毫秒值不應被視為可以在不同硬體設定之間互換。
更可重複的測試方法
如果您想比較自己的會話,請使用一個簡單的協定:
- 使用相同的設備、瀏覽器、輸入法和測試模式。
- 在相似的環境和一天中的相似時間進行測試。
- 完成整個訓練,而不是在幾次嘗試後停止。
- 在解釋反應時間之前檢查準確性。
- 比較多個會話而不是單一最佳或最差分數。
- 記錄條件的任何明顯變化,例如睡眠不佳或使用不同的設備。
這不會將測試轉變為臨床評估。它只是讓個人比較變得不那麼吵雜。
課堂演示
斯特魯普效應作為一種教學活動也很有效。請參與者在配對清單中命名墨水顏色,然後在衝突清單中命名墨水顏色。比較條件之間的完成時間和錯誤,並討論為什麼不相關的單字會破壞指示的回應。
對於離線活動,請使用可列印的 Stroop 測試 PDF。課堂演示應作為幹擾的說明,而不是作為診斷或對學生進行排名的方式。
實用要點
斯特魯普任務很有價值,因為它使認知衝突易於觀察。它最重要的教訓是條件之間的對比:即使規則很明確,熟悉的單字也會幹擾顏色命名目標。
使用線上結果作為有關一項任務會話的回饋。如果重複,請保持設定一致,注意速度和準確性,並避免將一個小的實驗測量變成對一個人的廣泛主張。
參考文獻
- Stroop, J. R. (1935). Studies of interference in serial verbal reactions. Journal of Experimental Psychology, 18, 643–662. Publication record and original paper
- Hedge, C., Powell, G., & Sumner, P. (2018). The reliability paradox: Why robust cognitive tasks do not produce reliable individual differences. Behavior Research Methods, 50, 1166–1186. Full text
- Strauss, G. P., Allen, D. N., Jorgensen, M. L., & Cramer, S. L. (2005). Test-retest reliability of standard and emotional Stroop tasks. Assessment, 12(3), 330–337. PubMed
- Bridges, D., Pitiot, A., MacAskill, M. R., & Peirce, J. W. (2020). The timing mega-study: Comparing a range of experiment generators, both lab-based and online. PeerJ, 8, e9414. Full text