Pourquoi plus d’échantillons améliore la précision

Plus de mesures ne font pas monter le R². Avec peu de points, le R² sort souvent plus élevé par hasard et baisse quand on ajoute des données : ce n’est pas le modèle qui se dégrade, c’est l’ajustement chanceux qui disparaît.

Ce que plus de données apportent vraiment, c’est la précision. L’intervalle de confiance de chaque coefficient se resserre à peu près comme la racine carrée du nombre de points : quatre fois plus de données, environ moitié moins large. Les prédictions cessent aussi de sauter quand on ajoute ou retire quelques lignes, et une plus grande part du domaine de fonctionnement est couverte : les deux extrémités, les conditions rares, la dérive dans le temps.

Combien suffisent ? Cela dépend du nombre de variables du modèle, pas d’un chiffre fixe. SenSight recommande au moins 10 × (nombre de variables + 1) lignes — 20 pour un modèle à une variable — et indique combien il en manque. Il en faut davantage si le bruit est fort ou si l’effet à détecter est faible.

Jugez « suffisant » à l’intervalle du coefficient, pas au R² : si l’intervalle reste trop large pour votre décision, collectez davantage.
Essayer dans l'application
Essayez : lancez une régression et regardez la colonne Erreur type du tableau des coefficients. Ajoutez des lignes et relancez : le R² peut monter ou baisser, mais l’erreur type diminue. C’est cette diminution qu’apportent plus de données.
Regardez-le sur notre chaîne YouTube

Testez sur vos propres données

Offre gratuite, sans inscription. Fonctionne hors ligne dans le navigateur.

Ouvrir l'application