Basic statistics - 18. Independence Assumption Examples
·
面对来自不同人群的数据,到底以people作为样本还是所有people的samples作为样本?
最近在自己的课题上遇到了很多的参数检验问题,有时候不知道被试间的差异到底应该以什么作为样本
这个问题涉及到统计学上的:独立性假设问题
例如,有9个被试,每个被试有100个Trials,那我是拥有900个独立的samples还是说9个?
统计检验(如 $t$ 检验)有一个基本前提:每一个样本点必须是相互独立的。
- 全部 Trials 放在一起 (n=900n=900n=900):
这种做法假设这 900 个数据点像 900 个互不认识的人提供的一样。但事实是,被试 A 提供的 100 个数据点高度相关——他可能今天咖啡喝多了反应很快,或者他天生在这个任务上比较慢。后果: 这种做法忽略了“人”这个层面的差异。统计学上这叫 “伪重复(Pseudoreplication)” 。 ppp 值会变得异常小(极易显著),但这个显著是虚假的。 - 被试均值放在一起 (n=9n=9n=9):这种做法承认:虽然你测了 900 次,但你其实只有 9 个独立的观察对象(9 个大脑)。后果: 样本量虽然变小了,但每一个点(被试均值)都是独立的,符合统计前提。
推论范围:你想代表“这几个人”还是“人类群体”?
- 如果你用全部 Trials (n=900n=900n=900):你的结论只能是:“在这 9 个特定的被试身上,汉字和拼音有差异。”如果其中一个被试贡献了特别多的 trial,或者某个被试极其离群,他会直接带偏整个 900 个点的结果。你无法把结论推向其他没参加实验的人。
- 如果你用被试均值 (n=9n=9n=9):你的结论是:“在人类这个群体中,汉字和拼音的反应时存在差异。”因为你把“被试”看作是从整个人类群体中随机抽取的样本。
- 一个直观的例子想象
你要研究“某种药物是否能让猫变聪明”:
方法 A: 找 1 只猫,让它做 100 次迷宫,发现给药后比不给药快了。如果你说 n=100n=100n=100,结论显著。但这科学吗?这只能说明这只猫变快了,也许它只是学会了走迷宫。
方法 B: 找 9 只猫,每只做 100 次迷宫。你算出每只猫给药前后的平均速度。如果你发现 9 只猫全都变快了,那么 n=9n=9n=9 的检验会告诉你:这种药对所有的猫都有效。
建议:
对于 Master 论文或常规学术发表,先计算 n=9n=9n=9 的均值进行配对 ttt 检验。
如果 n=9n=9n=9 实在不显著(因为 nnn 太小),再考虑学习使用 线性混合模型 (LMM)。LMM 的神奇之处在于它允许你输入全部 900 个 trials,但它会在模型里加入一个“随机截距(Random Intercept)”,告诉软件:“这 100 个点是属于被试 1 的,那 100 个是属于被试 2 的,请把他们的个体差异扣除掉。”
明明是同一个被试做的实验,为什么“被试内”的试次(trials)比较反而建议用“不配对”的检验?
两种检验方法:
-
mannwhitneyu 是非参数、不配对(独立样本)检验;
-
wilcoxon 是非参数、配对检验。
-
核心区别:到底什么是“配对”?
-
Wilcoxon 符号秩检验 (Paired / Dependent)- 逻辑: 它计算的是每一对数据之间的差值。
- 要求: 两组数据的样本量必须完全相等。
- 场景: 比如你测量了 9 个被试“吃药前”和“吃药后”的血压。被试 A 的“前”只能和被试 A 的“后”减一下。如果你把顺序打乱,这个检验就失效了。
-
Mann-Whitney U 检验 (Unpaired / Independent)
- 逻辑: 它把两组数据混在一起排名(Rank),看哪一组的排名普遍更靠前。
- 要求: 样本量可以不相等。
- 场景: 比如你想比较“男生”和“女生”的反应时。男生的第 1 个数据和女生的第 1 个数据之间没有任何特殊的联系。
总结: 在单个被试内部比较不同条件的 trials 时,由于 trial 之间是独立的随机观测,我们通常把它们看作两堆独立的“采样点”,因此用 Mann-Whitney U。
- 统计学意义上的“差距”假设不同:
- Mann-Whitney 检验的是:两组数据的分布是否有位置偏移(即一组是否普遍比另一组大)。
- Wilcoxon 检验的是:配对差值的中位数是否偏离 0。
- 统计效力 (Power):如果你明明有配对关系(比如 n=9n=9n=9 的组检验),却错误地用了不配对的 Mann-Whitney,你的 ppp 值会变得很大,很难发现显著差异。因为不配对检验会把“被试间的个体差异”误认为是“随机噪音”,参数检验通常比非参数检验更灵敏。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)