为什么样本越多越准确
更多的测量并不会让 R² 上升。点数少时,R² 往往因偶然而更高,随着数据增加反而下降——这不是模型变差,而是侥幸的拟合消失了。
更多数据真正带来的是精度。每个系数的置信区间大致随点数的平方根收窄:数据增加到四倍,宽度约减半。增删几行时预测也不再跳动,并能覆盖更多的工况范围——两端、少见情况、随时间的漂移。
多少才够?这取决于模型中的变量个数,而不是某个固定数字。SenSight 建议至少 10 × (变量数 + 1) 行——单变量模型为 20 行——低于此数时会提示还差多少。噪声大或要检测的效应小时,需要更多。
判断“是否足够”要看系数的区间,而不是 R²:如果区间对你要做的决策来说仍然太宽,就继续收集数据。
更多数据真正带来的是精度。每个系数的置信区间大致随点数的平方根收窄:数据增加到四倍,宽度约减半。增删几行时预测也不再跳动,并能覆盖更多的工况范围——两端、少见情况、随时间的漂移。
多少才够?这取决于模型中的变量个数,而不是某个固定数字。SenSight 建议至少 10 × (变量数 + 1) 行——单变量模型为 20 行——低于此数时会提示还差多少。噪声大或要检测的效应小时,需要更多。
判断“是否足够”要看系数的区间,而不是 R²:如果区间对你要做的决策来说仍然太宽,就继续收集数据。
在应用中试试
试试:运行一次回归,查看系数表中的“标准误”列。增加行后再运行——R² 可能上升也可能下降,但标准误会变小。这种变小正是更多数据带来的。