Почему больше наблюдений повышают точность

Больше измерений не повышает R². При малом числе точек R² часто получается выше случайно и падает по мере добавления данных — это не модель ухудшается, это исчезает удачная подгонка.

На самом деле больше данных дают точность. Доверительный интервал каждого коэффициента сужается примерно как квадратный корень из числа точек: вчетверо больше данных — примерно вдвое уже. Прогнозы перестают скакать при добавлении или удалении нескольких строк, и охватывается большая часть рабочего диапазона — оба края, редкие режимы, дрейф во времени.

Сколько достаточно? Это зависит от числа переменных в модели, а не от одного фиксированного числа. SenSight рекомендует не менее 10 × (число переменных + 1) строк — 20 для модели с одной переменной — и показывает, сколько не хватает. Нужно больше, если шум велик или искомый эффект мал.

Судите о «достаточности» по интервалу коэффициента, а не по R²: если интервал всё ещё слишком широк для вашего решения, соберите больше данных.
Попробовать в приложении
Попробуйте: выполните регрессию и посмотрите столбец «Станд. ошибка» в таблице коэффициентов. Добавьте строки и пересчитайте — R² может вырасти или упасть, но стандартная ошибка уменьшится. Именно это уменьшение и дают дополнительные данные.
Смотрите это на нашем канале YouTube

Проверьте на своих данных

Есть бесплатный тариф, регистрация не нужна. Работает офлайн в браузере.

Открыть приложение