机器人风险评估:FMEA、HAZOP与STPA

机器人风险评估识别应用生命周期中可能对人员造成伤害的方式,并选择控制措施,直到在适用流程下可接受剩余风险为止。它涵盖的不仅仅是机械臂故障:工具、工艺能量、工件、布局、软件、人员和操作模式都处于边界之上。

FMEA、 HAZOP和 STPA 是互补的分析技术。 FMEA 从失效模式开始, HAZOP探讨了设计意图的偏离,并 STPA 考察不安全的控制操作和不足的约束,包括单个组件未失效的情景。

本指南具有教育用途,而非合规性判断。请与 物理人工智能安全层指南运行时安全防护罩指南一起使用。

设置完整的系统和生命周期边界

定义机器人、工具、工件、夹具、工艺能耗、控制、网络、环境及互动人员。涵盖运输、安装、调试、示教、自动运行、清洁、故障恢复、维护和退役。

写明预期使用、合理可预见的滥用、通路、操作员能力及环境限制。仅仅因为生产不应使用该模式而排除该模式,并不会消除可预见的暴露。

工业机器人焊接单元,被金属护罩和焊接帘围护
机器人应用包括防护、工艺能量、夹具、控制、访问和维护模式;照片未显示风险评估的完成。来源:维基共享资源贡献者。许可:CC BY-SA 4.0

首先定义损失、风险和接受规则

列出不可接受的损失,如受伤、暴露、负载下降或失控。在评分前,将其与危险系统状态和可信情景联系起来。

记录风险估算方法和升级规则。数值等级有助于优先排序工作,但不会将不确定性转化为客观事实,也不会通过乘法消除严重危险。

方法起始于发现了单独使用时有盲点
FMEA组件或功能故障失效影响与检测不安全的正常互动
哈佐普偏离设计意图进程和命令偏差复杂的控制结构
STPA损失与控制限制不安全的控制交互详细组件可靠性
事件回顾观察到的事件真实的操作证据未知且未观察到的案例
任务分析人类工作序列暴露与滥用潜在技术故障

使用 FMEA 进行故障效应和诊断

列出功能、故障模式、局部及系统效应、原因、现有控制和检测。通过安全功能跟踪故障,而非仅停留在某个组件症状。

应分别处理共同原因故障和依赖故障。与故障功能共享功率、时序或软件的诊断方法可能无法提供独立覆盖。

使用HAZOP处理意图偏离的情况

对命令和进程变量应用指导词:否、更多、更少、反向、早、晚、其他或部分。对于机器人来说,偏差可能涉及速度、力、位置、身份、顺序、时机和权威。

记录原因、后果、保障和行动。 HAZOP与理解过程物理和控制实施的多学科团队合作效果最佳。

在不安全的控制场景下使用STPA

模型控制器、受控过程、反馈与控制动作。询问某个动作是否未被提供、在不安全时提供、过早或延迟、应用过久或停止过早。

麻省理工STPA手册对该方法进行了解释。在明确的项目中应用并保留证据;使用名称STPA并不保证完整的情景覆盖。

五阶段机器人风险评估验证
风险工作表在每个重大情景都已实施控制、验证案例、所有者和重新评估触发器之前是不完整的。来源:Physical AI Lab。

覆盖 AI 分布偏移与权限冲突

AI机器人危害包括陌生的观察、脆弱的语言基础、推理延迟、陈旧的世界状态以及请求超出验证范围的策略动议。这些问题不总是归结为硬件故障部分。

分析自主性、遥操作、安全PLC、人工干预和恢复控制者之间的冲突。定义谁拥有权威、切换方式以及当渠道不一致时何种状态是安全的。

选择层级中的风险降低

优先通过本质上更安全的设计消除或减少危险,然后是保障措施和补充防护措施,最后是信息和培训。警告无法弥补可避免的夹点或暴露的工艺能量。

验证控制措施在所有相关模式下均有效,且不会产生新的危害。记录必须沟通和管理的残余风险。

将发现转化为可测试的安全要求

每个重要场景应产生包含触发条件、状态、响应时间、最终条件、故障行为和验收证据的自有需求。避免使用诸如系统应安全或人工智能应可靠等声明。

将需求与设计元素和验证案例双向连接。没有追踪危害的实施保障措施和没有验证案例的危害都是漏洞。

谨慎核对现行标准与指南

ISO目录指出, ISO 12100:2010 仍是当前发布的机械风险评估版,替代草案正在开发中。项目适用性和过渡规则必须在决策时核查。

请使用实际的规范文本、 Type-C标准和司法管辖区规则,并由有能力的专业人士指导。本文解释分析结构,不指定必要的风险等级。

包括行动、事件和险些发生的事件

现场观察揭示了设计车间中缺失的捷径、工作量、干扰停靠和恢复措施。将事故、险些发生、干预和维护发现反馈回应场景和控制。

NIOSH维护一个与工作场所证据相关的 机器人安全研究项目。将公共指导视为辅助材料,而非应用评估的替代。

每一次重大变动都要重新评估

在工具、有效载荷、程序、速度、布局、传感器、固件、人工智能模型、数据、网络、操作员角色或操作环境变化后进行触发审查。将变更与危害假设和安全功能验证进行比较。

将新出现的故障与 故障挖掘指南 连接起来,但保护性要求与学习更新保持独立。

追踪链路所需产物审计问题失败
控制危害风险决策为什么要控制无正当设计
控制到需求规格必须发生的事情模糊的意图
测试要求案例与结果如何验证纸张控制
基线测试配置测试内容版本差距
重新评估的变更撞击记录什么变得无效陈旧的安全档案

发布一份生活风险记录

保留界限、假设、参与者、方法、情景、估计、控制、残余风险、需求、测试、配置基线、所有者和重新评估触发条件。保持分歧和不确定证据的可见性。

仔细审查,请进行以下检查。

评估“机器人风险评估:FMEA、HAZOP与STPA”时,还应保存模型版本、机器人配置、标定文件、测试日期和全部试验记录。把成功、失败、恢复与人工介入放在同一份数据中,才能区分模型能力、系统接口和现场流程造成的差异。

成本评估除了设备与算力,还要记录数据采集、工程调试、安全措施、维护、停机和人员培训。只有把这些持续投入与单位成功任务的价值比较,才能判断方案是否适合扩大。

上线后仍要持续检查分布变化、传感器漂移、机械磨损和人工接管原因。监测结果应能触发降级、停止与重新验证流程,并为下一轮数据采集和模型更新留下可追溯记录。

最终结论应明确写出已知限制、尚未验证的场景和下一项可证伪的实验,使后续团队能够沿着证据继续推进。

实际项目还应指定数据、模型、控制器和安全流程的负责人,并预先定义回滚条件。责任边界、审批记录与变更日志越清楚,故障发生后越容易停止扩散、定位原因并安全恢复。

把任务拆成感知、决策、动作执行和结果确认,可以更准确地定位瓶颈。每一阶段都应有独立指标与失败示例,避免用端到端成功率掩盖偶发但严重的风险。

引用的产品规格、论文结果和监管要求需要记录发布日期与适用版本。资料更新后应重新核对关键结论;无法从一手来源确认的内容,应明确标注为待验证信息。

小规模试点的价值在于提前暴露接口、人员协作和异常处理问题。试点结束后应依据预设门槛决定扩大、修改或停止,而不是因为已经投入资源就默认继续。

所有结论都应能够追溯到原始记录,并可复核。

硬件与软件接口应分别记录单位、坐标系、时钟、延迟和允许范围,并通过自动测试检查不一致。接口定义变化时,旧数据和旧控制参数不能在未经验证的情况下直接复用。

  • 涵盖所有生命周期模式及可预见的滥用。
  • 结合分量视图、偏差视图和控制场景视图。
  • 明确处理 AI 分布偏移与权限变化。
  • 将所有物质危害追踪到经过验证的控制中心。
  • 在事件和变更中保持评估。

常见问题

FMEA本身就算是完整的机器人风险评估吗?

不会。它对故障模式有用,但可能会漏掉不安全的交互和正常运行的危险。

低RPN可以被忽略吗?

并非自动;严重性、不确定性、法律要求和方法特定规则仍需判断。

STPA能替代FMEA吗?

不是。它们回答的问题不同,且常常互补。

谁应该参与?

包括设计、控制、流程、安全、运营、维护及受影响的用户专业知识。

AI模型更新会触发重新评估吗?

当行为、分布假设、时序、接口或经过验证的控制可能发生变化时,是的。

危险需求可追溯边界

机器人风险评估的成功在于从危险场景到已实施需求、验证证据和受控变革的可追溯性,而非仅凭某一分析方法的名称或评分。