对应用背后各种方法的简短实用讲解——写给在数据产生现场工作的人。
回归分析通过最小化实际值与预测值之间的平方误差之和,找到从X预测Y的最佳公式。结果是最适合您数据的直线或曲面。
真实的工业数据很少是完全线性的。LOG10、LN、倒数或平方变换可以线性化曲线关系,显著提高R²。如果R²<0.8,尝试变换。
R² = 解释的方差比例(1.0完美,>0.85良好)。每个系数 = X每变化1个单位Y的变化量。p值 = 统计显著。MAE = 原始单位的典型预测误差。
残差 = 实际值 − 预测值。接近零的残差是理想的。大残差揭示测量异常或异常过程条件。残差图中的随机散布 = 健康的模型。
当您的过程在两种状态下行为不同时(如低温vs高温),单一公式可能拟合不好。在阈值处分割 → 两个公式,综合MAE更低。
95%预测区间(PI)显示真实值95%的时间内会落入的范围。绿色 PI 黄色 20–40%。红色 > 40% — 收集更多数据。
当两个X变量高度相关(|r| > 0.9)时,模型无法分离它们的个别效应。这会放大标准误差并使系数不稳定。 症状:X变量之间的高相关性一个变量显著,另一个不显著数据变化时系数大幅变动解决方案:删除相关变量之一将它们合并(比率、差值、指数)收集更多样化的数据
并非所有异常值的影响相同。Cook距离衡量每行对模型的影响程度。 解释:D > 4/n → 有影响力的点有影响力的点可能扭曲系数,降低准确性
回归假设残差服从正态分布。Q-Q图将实际残差与完美正态曲线进行比较。 解释:点靠近对角线 → 残差正态 → 模型假设有效曲线或S形模式 → 非正态 → 考虑变换或混合模型
工业过程因设备磨损、校准漂移、原材料变化或环境条件而随时间变化。 影响:模型精度下降残差增大预测区间扩大解决方案:监控MAE随时间的变化检测到漂移时重新训练模型
预测区间显示真实值预期落入的范围,反映模型的不确定性。 绿色 PI < 20% → 高置信度 黄色 20–40% → 中等置信度 红色 > 40% → 低置信度 → 收集更多数据
某些过程在不同状态下运行(如低温vs高温)。单一公式无法很好地拟合两个区域。 混合建模:自动找到最佳阈值构建两个独立公式降低总体MAE捕捉特定状态行为
连接到实时传感器时,模型可以监控实时误差。MAE或残差增加表明漂移。 使用:将实时MAE与训练MAE进行比较如果实时MAE > 2×训练MAE → 建议重新训练
自相关意味着残差在顺序上呈现规律——每个误差都会影响下一个。这在时间序列或按顺序排列的生产数据中很常见。 DW 统计量:DW ≈ 2.0:理想 — 无自相关DW < 1.5:正自相关(误差朝同一方向漂移)DW > 2.5:负自相关(误差方向交替)影响:自相关会虚高 R²,并使标准误不可靠…
异方差意味着残差的方差不恒定 —— 在某些 X 值上误差很小,在另一些上很大。这违反 OLS 假设,并会虚高标准误。 症状:残差散点呈喇叭形(X 越大越分散)Breusch-Pagan p < 0.05处理办法:对 Y 或取值很大的 X 做对数变换增加或删除预测变量使用加权回归(WLS)
AIC(赤池)与 BIC(贝叶斯)信息准则用于衡量模型质量,并对复杂度施加惩罚以防过拟合。 AIC/BIC 越小 → 模型越好AIC = n·ln(RSS/n) + 2k BIC = n·ln(RSS/n) + k·ln(n)BIC 对额外参数的惩罚比 AIC 更重BIC …
两种区间都在度量不确定性,但回答的问题不同: 置信区间(CI):关于平均预测的不确定性 —— 模型对均值的估计有多准?预测区间(PI):关于单个新观测的不确定性 —— 因为要加上 σ²,所以总是比 CI 更宽公式:CI = ŷ ± t · √(Xₙ(XᵀX)⁻¹Xₙᵀ · σ²)PI = ŷ ± t…
每个 OLS 回归都建立在 6 条核心假设之上。违反任一条都会降低可靠性: 线性:关系是线性的 → 查看偏回归图残差正态性:残差服从正态分布 → 查看 Q-Q 图方差齐性:残差离散程度一致 → Breusch-Pagan 检验独立性:残差之间无自相关 → Durbin-Watson 检验无多重共线性…
工业数据很少是完美线性的。变量变换有助于把弯曲的关系拉直,让模型能够理解它们。 常用变换:LOG10(x) — 压缩大数值,减小偏度LN(x) — 把指数关系拉直SQRT(x) — 缓和陡峭的正向曲线1/x — 把反比关系转为线性x² — 强化较弱的关系Z 分数 — 标准化量纲不同的变量Min-Ma…
并非每个变量都呈线性。许多工业过程天然会产生弯曲的规律,直线模型无法捕捉。 非线性的迹象:散点图呈曲线、弧形或 S 形残差图呈现规律而非随机噪声做了变换之后 R² 明显上升变量取值范围极宽(如 0.1–5000)在不同运行区间过程行为发生变化看到这些迹象时,可尝试 LOG、LN、SQRT 或倒数变换…
离群值是行为与其他数据明显不同的点。它们可能来自传感器噪声、操作失误,或真实的过程异常。 为什么重要:会把回归直线往错误方向拉会降低 R²会扭曲变量重要性(系数值)会产生误导性的预测系统如何处理:自动识别极端的 Z 分数在界面中对相关行加以标记和提示在预测选项卡中显示异常计数离群值并不总是坏事 ——…
混合公式把回归模型与基于规则的阈值调整结合起来,将统计数学与过程工程经验融为一体。 在以下情况使用混合公式:数据有限(少于 50 个样本)过程存在已知的物理极限或拐点在某个阈值以上/以下由单一变量主导行为你希望在噪声环境中获得更稳定的预测混合模型在工业工程中很常见,因为它把数学与领域经验合进同一个公…
运行回归之后,结果选项卡会显示几个关键指标: R² — 模型拟合程度(0 到 1,越高越好)系数 — 每个变量每增加一个单位对输出的影响幅度p 值 — 各变量是否统计显著(p < 0.05 = 显著)残差 — 预测值与实际值之差RMSE — 以原始单位表示的平均预测误差R² 的一般参考:R² …
工业过程本身存在自然波动。样本越多,模型越能学到完整的行为范围: 正常运行区间罕见事件与过程扰动传感器随时间漂移背景噪声形态极端处的非线性区间推荐样本量:最少:30 个样本较好:50 个样本理想:70 个以上(尤其是 6 个以上变量的模型)当数据低于可靠预测所需的最低阈值时,系统会显示提示横幅。
控制图跟踪某个测量值随时间的变化,只问一个问题:过程是否正常,还是有什么发生了改变? I 图(单值图)绘出每个数值,并画三条线:中心线(绿色)=平均值UCL / LCL(红色虚线)=上下控制限,取平均值 ± 3σ落在控制限之内的点属于正常、可预期的波动 —— 不要动它。落在之外的点(或同一侧连续 8…
控制限告诉你过程是否稳定;过程能力告诉你它对你的规格是否足够好。 你输入规格限(LSL = 可接受下限,USL = 可接受上限),SenSight 随即计算:Cp — 规格宽度相对过程散布的容纳程度(不考虑是否居中)Cpk — 同上,但会对偏离中心的过程施加惩罚经验法则:Cpk ≥ 1.33 = 有…
当你有两组数据(两台机器、两个班次、变更前后),想知道它们的均值是否真的不同 —— 而不是碰巧不同 —— 就用 t 检验。 它会给出一个 p 值:p < 0.05 → 差异具有统计显著性(真实存在)p ≥ 0.05 → 证据不足;差距可能只是随机噪声当两列是同一批对象测量了两次时(例如每个零件…
大多数问题只来自少数几个原因。帕累托图把原因按出现频次从高到低排列(柱状),并画出累计线(红色)。 关键在于累计线穿过 80% 的位置:左侧的原因就是你的"关键少数" —— 解决它们,问题的大部分就消失了;右侧那许多小原因可以等一等。 在 SenSight 中,原因清单可以来自你的证据备注原因(你为…
模型的好坏取决于数据。真实测量有时会出问题:样品有缺陷、读数被中断、仪器失准。SenSight 允许你为任意一行附加一条证据记录:状态标记:正常 / 可疑 / 无效原因 + 自由备注照片(用手机相机拍摄)标准样品(CRM)核查,并自动计算偏差标记为无效的行会自动从回归中排除 —— 并且该排除会记录在…
在信任任何数据之前,先问:我的测量可靠吗?Gage R&R(测量系统分析)把总变异拆成两部分:测量变异(Gage R&R)=重复性(同一操作员、同一零件、重复测量)+ 再现性(不同操作员)零件间变异=各个零件之间真实的差异你希望测量部分尽量小。核心指标是 %GRR:低于 10% 为良…
DOE 不是一次只改一个因子,而是让多个因子同时变化(每个取一个低水平和一个高水平),从而高效地了解它们的作用 —— 包括交互作用(两个因子共同产生的效果,是各自单独都做不到的)。 某因子的效应=该因子在高水平下的平均结果减去其在低水平下的平均结果。效应大,说明这个因子强烈驱动结果;效应接近零,说明…
交叉表统计两个标签列的交叉情况:按班次统计缺陷类型、按供应商统计报废原因、按部门统计回答。只看百分比是不够的 —— 检验了 30 件的班次和检验了 300 件的班次,单凭偶然波动幅度就不同。 这正是字母的用处。每一列得到一个字母(A、B、C…),单元格会带上它显著高于的所有列的字母。因此维护部门列中…
1–5 的评分题通常按 top-2-box 汇报:选择最好两个选项的人的比例。这种粗略是有意的 —— 平均分 3.4 说明不了什么,而「54% 满意」是管理者可以着手处理的。bottom-2-box 是同一思路的另一端,往往更有用。 当问卷混用正向与负向表述时(「我很满意」对「我常想离职」),反向计…
自由文本答案和投诉记录在未归类前无法统计。传统做法是由人读上几百条,把它们归入一份简短的类别清单 —— 即编码框架。SenSight 让 AI 模型来完成这一遍,并把结果作为普通列写回,这样帕累托和交叉表可以立即使用。 关键不在 AI,而在框架。留空则由模型提出;粘贴既有框架后,模型只能做归类 ——…
“以下哪些你遇到过?请全部勾选”会让一个单元格同时装下多个答案——噪音;粉尘;高温。这一行仍然是一个人,但这个人现在同时属于三个类别,而不是一个。 只有当你在交叉表或帕累托面板中勾选多选并选定分隔符时,SenSight 才会拆分这样的列。其他一切都不变:数据集、其他分析和导出永远看不到拆开后的值。基…
I-MR 用于单值测量。若每次检验测多个零件(2–8),用 X̄-R — 这是制造业最常用的控制图,因为取均值可抑制测量噪声。子组更大(n > 8)时用 X̄-S。EWMA 与 CUSUM 的存在只有一个理由:休哈特图对小偏移是有意“迟钝”的——半个 sigma 的漂移可能持续数月而没有任何一…
Cp 问"离散是否足够小以装进规格",Cpk 再问"位置是否也对"。Cp/Cpk 用短期离散,Pp/Ppk 用总离散 — Cpk 高而 Ppk 低,说明过程随时间漂移;应查找换型差异或刀具磨损,而不是追求更高精度。 四者都建立在正负 3 sigma 之上,也就是假设数据近似正态。对于有上规格限的右偏…
Best subsets 穷举所有组合,逐步回归每次增删一个变量。请比较调整后 R 方 — 原始 R 方添加变量时永不下降,无法告诉你何时停止。 重要:自动选择给出的是假设,不是证据。我们做了测量:在纯随机数据和 5% 阈值下,前向逐步回归仍有 45% 的概率找到至少一个“显著”变量。而且所交付模型…
计数数据(“这个班次有多少缺陷?”)不能用直线建模:它会预测负计数,并假设离散恒定。泊松回归使用对数连接,效应按比率读取——1.30 表示 X 每增加一个单位,预期事件数增加 30%。 陷阱:泊松假设方差等于均值。真实缺陷数据几乎从不满足;此时标准误偏小,p 值变小,不存在的效应看起来显著。SenS…
两水平设计对每个因子只能拟合一条直线,而直线没有顶点。响应曲面加入中心点(究竟有没有弯曲?)和轴向点(第三、第四个水平),这才使二次项可估计。 要点:驻点不自动等于峰值。由特征值决定:全负为极大,全正为极小,符号混合则是鞍点 —— 此时该区域内根本不存在最优。若驻点落在实际试验范围之外,模型就是在外…
响应曲面只能找到一个响应的峰值。现实中没有哪个工艺只有一个响应。您希望收率上升而废品下降 — 而使前者最大的设定通常会恶化后者。 把不同的东西放到同一尺度上。百分比的收率与公斤的废品无法相加。因此每个响应先被转换为 0(完全不可接受)到 1(达到目标)之间的期望度。 为什么用几何平均值。各项期望度是…
两组机台设定的平均抗拉强度相同。一个每天都给你同样的数字;另一个随湿度、原料批次和班次波动。纸面上打平,生产中只有一个能用。 常规 DOE 遗漏了什么。析因试验估计的是对均值的影响,对波动无话可说,因为噪声被当作“平均掉”的东西。田口把它反过来:噪声才是重点。 正交表。用很少的试验研究很多因子。关键…
混凝土、合金、油漆、饲料:你选的是比例,而比例合计为 1。这一个约束就破坏了常规试验设计的机制。 为什么析因设计不适用。它在固定其他因子时变动一个因子。在配方中做不到:水泥多了就意味着砂子少了。 为什么没有截距。若 x1+x2+x3 恒为 1,则全为 1 的列恰好等于各组分列之和,设计矩阵奇异。Sc…
打开一份工艺导出,你会看到三十个测量值并排,而大多数是一起变化的:同一台炉子上的三支热电偶、同一条管线上的两个压力取点。逐个阅读不仅慢 — 还会重复计数。 主成分做什么。它们把你的各列加权混合成新的坐标轴:第一个尽可能多地捕捉变异,第二个捕捉剩余部分的最大量 — 且彼此独立。 如何读载荷。载荷是变量…
有人问下个月会怎样,你给了一个数字。他们记下来、据此安排,而它错了 — 每个预测都会错。问题从来不在数字,而在于给它时没有区间。 为什么区间会变宽。向前一步,你几乎知道一切相关信息。向前十步,每一步的误差都会嗂入下一步,不确定性不断累积。宽度恒定的带子等于声称第十个月与第一个月一样可知。 指数平滑。…
量具研究问一个简单问题:数字变了,是零件变了还是测量变了?常规做法是让多位操作员将同一批零件各测多次。这很有效 — 直到测量会消耗零件。 拉伸试验的问题。拉断的试样无法再拉一次。“同一零件测两次”根本不存在。 人们改而怎么做,以及为什么错。给每位操作员自己的零件,然后按普通研究计算。软件便以为 A …
多数质量决定背后都有一笔账,而其中三件事几乎总是不算账就定了。不是因为马虎——而是这笔账不熟悉,凭感觉估出来的数看着又挺合理。这三件事各有正确答案,而凭眼睛估算时又都会悄悄出错。 1. 我该抽检多少件?常见的答案是一个比例:批量的百分之十,或者二十件,因为二十是个整数。两者都是随意的。真正决定问题的…
有免费额度,无需注册。在浏览器中离线也能用。