斯特鲁普测试指南:颜色词任务如何进行
蓝色一词以红色墨水显示。你的工作是对墨水颜色——红色——做出反应,同时忽略这个词本身。
这个小冲突是斯特鲁普任务的基础。这是一种众所周知的实验方法,用于研究当练习的反应(例如阅读单词)与指令要求的反应竞争时会发生什么。
本指南解释了任务如何进行、我们的在线版本记录了什么以及解释应该在哪里停止。
两种试验类型
颜色词斯特鲁普任务通常至少包括两个条件:
- 一致:文字与墨水颜色匹配,例如蓝色墨水中的BLUE。
- 不一致:文字与墨水颜色冲突,例如红色墨水中的蓝色。
在不一致的试验中,人们通常会变得更慢或更容易出错。两种条件之间的性能差异称为斯特鲁普干涉效应。
John Ridley Stroop 在他 1935 年的论文《串行言语反应干扰研究》中记录了这种干扰。此后,基本结果已通过许多任务设计、语言和响应方法得以重现。
我们的在线测试记录是什么
在在线 Stroop 测试中,选择墨水颜色,同时尝试忽略该单词。结果页面总结了该会话的几个部分:
- 准确性:正确回答的试验比例。
- 平均反应时间:有效试验的响应时间。
- **一致和不一致反应时间:**每种条件的平均值。
- 斯特鲁普效应:不一致反应时间减去一致反应时间。
- **条件准确度:**误差是否集中在一种条件下。
准确性和时机是一体的。如果错误较多,则更快的结果并不一定会更好。同样,仅基于几次正确试验的干扰估计不如基于完整会话的干扰估计稳定。
结果可以告诉您什么
结果描述了您此时在此设备上执行该版本任务的情况。它可以帮助您:
- 查看一致试验和不一致试验之间的区别。
- 请注意您自己的回答中的速度与准确性之间的权衡。
- 比较在相似条件下完成的重复会话。
- 在课堂或个人学习活动中表现出认知干扰。
这些都是有用的观察结果,但它们比“注意力水平”、“大脑年龄”或“认知健康”等标签范围更窄。单个浏览器会话无法建立这些更广泛的特征。
结果无法告诉您什么
该网站不是标准化的临床仪器。其结果不应用于:
- 诊断 ADHD、痴呆症、学习障碍或任何其他病症;
- 确定儿童或成人是否有注意力问题;
- 将您的分数与未引用的基于年龄的标准进行比较;
- 证明认知训练改变了一般智力;
- 做出就业、驾驶、医疗或教育安置决定。
实验任务可以产生很强的平均效果,但对个体进行排名仍然不太可靠。对 Stroop 任务的研究还发现,原始响应时间测量的可靠性可能与干扰差异评分的可靠性不同。这就是合格评估使用经过验证的程序、适当的规范和多种证据来源的原因之一。
为什么分数会变化
即使这个人没有发生有意义的改变,表现也会有所不同。常见的影响包括:
- 设备和浏览器:显示刷新、输入硬件、操作系统和浏览器调度会增加延迟。
- 响应方法:鼠标、物理键盘和触摸屏没有相同的时序。
- 语言和阅读流畅性:竞争词反应的强度部分取决于对显示语言的熟悉程度。
- 练习:学习响应映射可以让以后的课程变得更容易。
- 环境:中断、屏幕可见性和后台活动会影响会话。
- **临时状态:**疲劳、压力、动力和警觉性都会影响速度和准确性。
基于浏览器的任务对于演示和设备内比较非常有用,但绝对毫秒值不应被视为可以在不同硬件设置之间互换。
更可重复的测试方法
如果您想比较自己的会话,请使用一个简单的协议:
- 使用相同的设备、浏览器、输入法和测试模式。
- 在相似的环境和一天中的相似时间进行测试。
- 完成整个训练,而不是在几次尝试后停止。
- 在解释反应时间之前检查准确性。
- 比较多个会话而不是单个最佳或最差分数。
- 记录条件的任何明显变化,例如睡眠不佳或使用不同的设备。
这不会将测试转变为临床评估。它只是让个人比较变得不那么嘈杂。
课堂演示
斯特鲁普效应作为一种教学活动也很有效。要求参与者在匹配列表中命名墨水颜色,然后在冲突列表中命名墨水颜色。比较条件之间的完成时间和错误,并讨论为什么不相关的单词会破坏指示的响应。
对于离线活动,请使用可打印的 Stroop 测试 PDF。课堂演示应作为干扰的说明,而不是作为诊断或对学生进行排名的方式。
实用要点
斯特鲁普任务很有价值,因为它使认知冲突易于观察。它最重要的教训是条件之间的对比:即使规则很明确,熟悉的单词也会干扰颜色命名目标。
使用在线结果作为有关一项任务会话的反馈。如果重复,请保持设置一致,注意速度和准确性,并避免将一个小的实验测量变成对一个人的广泛主张。
参考文献
- Stroop, J. R. (1935). Studies of interference in serial verbal reactions. Journal of Experimental Psychology, 18, 643–662. Publication record and original paper
- Hedge, C., Powell, G., & Sumner, P. (2018). The reliability paradox: Why robust cognitive tasks do not produce reliable individual differences. Behavior Research Methods, 50, 1166–1186. Full text
- Strauss, G. P., Allen, D. N., Jorgensen, M. L., & Cramer, S. L. (2005). Test-retest reliability of standard and emotional Stroop tasks. Assessment, 12(3), 330–337. PubMed
- Bridges, D., Pitiot, A., MacAskill, M. R., & Peirce, J. W. (2020). The timing mega-study: Comparing a range of experiment generators, both lab-based and online. PeerJ, 8, e9414. Full text