چرا نمونهٔ بیشتر دقت را بالا میبرد
اندازهگیری بیشتر R² را بالا نمیبرد. با نقاط کم، R² اغلب بهطور تصادفی بالاتر درمیآید و با افزودن داده پایین میآید — این بدتر شدن مدل نیست، از بین رفتن برازش خوششانس است.
آنچه داده بیشتر واقعاً میدهد دقت است. بازه اطمینان هر ضریب تقریباً با جذر تعداد نقاط باریک میشود: چهار برابر داده، حدود نصف پهنا. پیشبینیها هم با افزودن یا حذف چند سطر دیگر جهش نمیکنند و بخش بیشتری از محدوده کاری پوشش داده میشود — دو سر بازه، شرایط کمیاب، رانش در طول زمان.
چند تا کافی است؟ به تعداد متغیرهای مدل بستگی دارد، نه به یک عدد ثابت. SenSight دستکم 10 × (تعداد متغیرها + 1) سطر را توصیه میکند — برای مدل تکمتغیره 20 — و اگر کمتر باشد نشان میدهد چند سطر دیگر لازم است. اگر نویز زیاد یا اثر مورد نظر کوچک باشد، بیشتر لازم است.
«کافی بودن» را از بازه ضریب بسنجید، نه از R²: اگر بازه هنوز برای تصمیمی که باید بگیرید بیش از حد پهن است، داده بیشتری جمع کنید.
آنچه داده بیشتر واقعاً میدهد دقت است. بازه اطمینان هر ضریب تقریباً با جذر تعداد نقاط باریک میشود: چهار برابر داده، حدود نصف پهنا. پیشبینیها هم با افزودن یا حذف چند سطر دیگر جهش نمیکنند و بخش بیشتری از محدوده کاری پوشش داده میشود — دو سر بازه، شرایط کمیاب، رانش در طول زمان.
چند تا کافی است؟ به تعداد متغیرهای مدل بستگی دارد، نه به یک عدد ثابت. SenSight دستکم 10 × (تعداد متغیرها + 1) سطر را توصیه میکند — برای مدل تکمتغیره 20 — و اگر کمتر باشد نشان میدهد چند سطر دیگر لازم است. اگر نویز زیاد یا اثر مورد نظر کوچک باشد، بیشتر لازم است.
«کافی بودن» را از بازه ضریب بسنجید، نه از R²: اگر بازه هنوز برای تصمیمی که باید بگیرید بیش از حد پهن است، داده بیشتری جمع کنید.
در برنامه امتحان کنید
امتحان کنید: یک رگرسیون اجرا کنید و به ستون خطای استاندارد در جدول ضرایب نگاه کنید. سطر اضافه کنید و دوباره اجرا کنید — R² ممکن است بالا یا پایین برود، اما خطای استاندارد کوچک میشود. همین کوچک شدن چیزی است که داده بیشتر میدهد.