CMR Versius Plus 與 Cosmos-H-Dreams:預測未來手術場景的界線

手術世界模型最需要先處理的不是畫面是否逼真,而是錯誤預測會不會影響醫師判斷。Versius Plus 提供機器人與場景資料,Cosmos-H-Dreams 產生可能的未來畫面;這條依賴鏈讓研究展示更具體,也讓臨床責任必須更清楚。

環繞手術臺配置的機器人手術設備與監視器
這是美國軍方醫院的真實機器人輔助手術場景,並非 CMR Versius Plus 或 Cosmos-H-Dreams 展示,也不能證明預測安全性或臨床成效。 圖片來源: Wikimedia Commons · 授權條款: Public domain · 署名: https://www.dvidshub.net/image/2569274/wbamc-first-dod-use-robot-surgery

CMR Surgical 官方說明明載,展示功能目前不屬於已核准的 Versius 系統,不能用於臨床決策或病人照護。這句限制應和任何『智慧手術未來』的描述放在同一個視野。

市場要解的是預測,不是宣稱自主手術

研究做法是把目前場景與建議動作交給模型,預測手術環境接下來可能呈現的狀態。這能用於訓練、模擬或研究風險,但沒有證明機器人可以自行選擇手術步驟。自主性還涉及適應症、醫師監督、失效攔截、人因與監管。

『預測未來場景』本身也有不同用途。它可以離線生成教學情境、協助研究者比較候選動作,或成為術前模擬素材;只有在即時影響手術決策時,才進入更高風險的臨床工作流程。每個用途都要另列使用者、輸入、輸出、錯誤處理與禁止用途,不能用同一段展示文字涵蓋。

研究展示若使用預先挑選的片段,也需要說明選取方式、病例數與失敗案例。生成一段合理未來畫面只能支持技術概念,不能回答在連續手術中多久會出錯、錯誤能否及時攔截,或是否改善任何臨床終點。

CMR 提供的是既有機器人平台與研究資料

Versius Plus 是現有機器人輔助手術平台。公告當時,美國 510(k) 範圍是 22 歲以上成人膽囊切除術,部分婦科適應症仍在審查。既有器材核准不能延伸到尚未納入系統的生成式預測功能,也不能從一個適應症推論其他手術。

既有器材的 510(k) 狀態應以官方核准範圍和公告當時日期為準。醫院不能因為同一機器人平台獲准執行特定成人手術,就推論加上的研究軟體也獲准;監管審查會看軟體預定用途、風險控制、資料、版本管理與人因,而不是只看機械臂名稱相同。

病人安全問題不能由生成畫面自行回答

世界模型可能遺漏出血、組織變形、遮擋或器械接觸;看似合理的未來畫面也可能與真實生理狀態不符。研究必須記錄輸入影像、候選動作、生成版本、不確定性、醫師判讀與實際後續畫面,讓錯誤能被定位。

本站的 實體 AI 世界模型可協助理解模型用途;但醫療情境還要加入病人族群、手術階段、器械、術者經驗與臨床終點,不能只評估影像相似度。

評估預測品質時,不宜只用像素相似或畫面逼真度。更重要的是模型是否遺漏臨床上關鍵事件、錯誤發生在什麼手術階段、醫師多久能察覺,以及錯誤提示是否改變注意力。對同一病例可由多位專家盲評,並保存意見分歧,而不是硬做成唯一正解。

替代方案仍是模擬、回放與具名監督

若目標是訓練,可以用去識別化回放、傳統模擬器與專家標註比較;若目標是術中提示,則要證明提示比現有監測更早、更準,且錯誤提示不會增加延遲或認知負擔。任何路徑都需要具名醫師監督與停止權。虛擬試運轉與數位孿生比較可協助把離線驗證和臨床操作區分。

替代驗證也要先處理病人資料與隱私。回放或模擬資料應去識別化、限制存取並記錄用途;若模型或運算服務跨機構,需說明資料是否離院、保存多久、誰可再訓練。研究結果若只來自單一中心或少數術者,也不能當成廣泛臨床適用性。

方法可回答不能自動證明
未來場景生成某動作後的候選視覺結果臨床正確性或安全改善
去識別回放對既有病例的離線比較即時使用有效
傳統模擬固定情境與技能訓練涵蓋所有病人變異
前瞻臨床研究指定族群與流程的結果超出適應症的通用自主手術

模型供應與器材供應形成雙重依賴

NVIDIA 官方資料呈現生成與模擬基礎,CMR 提供手術平台與工作流程。醫療機構還需要知道模型在何處執行、資料是否離院、更新由誰核准、延遲或斷線時如何退回,以及器材與模型日誌能否對齊。同一事件若無法由兩邊重建,風險調查就會中斷。

供應鏈更新是另一個風險。生成模型、驅動程式、手術機器人軟體與醫院網路可能各自更新,任何版本變動都可能改變延遲或輸出。醫療機構需要鎖版、驗證、核准、分階段部署與回復舊版程序,並確保急診或手術中不會因外部服務更新而改變行為。

規模證據應從錯誤分布開始

公開資料沒有臨床效能、病人結果或長期安全數據。後續研究應報告病例數、排除條件、失敗案例、不同術者與不同解剖情境,並把幻覺、遺漏、延遲與錯誤信任分開。只有展示成功畫面,無法估計真正風險。

規模證據還要看負面使用行為,例如醫師過度相信、為了等模型而延遲、忽略提示或被頻繁誤報干擾。這些不是單純模型準確率能捕捉的問題。前瞻研究應把臨床流程、認知負擔、停止與接管時間納入,且事先定義誰有權中止研究功能。

證據層級目前狀態下一個門檻
研究展示已有公開示範完整測試集與錯誤分布
既有器材指定成人膽囊切除 510(k)不得延伸至新功能或新適應症
生成預測功能未納入現行核准系統人因、臨床與軟體生命週期驗證
自主手術未由本公告建立獨立監管與臨床證據

後續公告要問七個未決問題

讀者可依序確認:功能是離線研究還是即時;誰選擇候選動作;模型錯誤如何告警;醫師能否立即忽略或停止;更新是否重跑驗證;適用病人與手術階段;資料與責任如何保存。只要其中一項沒有答案,就不應把展示描述成臨床自主能力。

若後續公告提供病例或效能數字,讀者要確認分母、適應症、比較組、主要終點與不良事件,不要只擷取最亮眼百分比。『協助』、『預測』和『自主』在醫療監管上不是同義詞;每次引用都應保留原文用途與限制,避免媒體標題把研究方向推成已核准能力。

醫療機構若參與下一階段研究,應先完成倫理、資料治理、事件通報與退出機制。病人或醫師拒絕研究功能時,既有 Versius 工作流程仍要可用;研究系統故障也不能影響已核准器材的基本功能與支援。

  • 研究、訓練、術中提示與自主控制分開標示
  • 保留模型版本、輸入、預測與實際後續畫面
  • 報告錯誤預測及被醫師否決的分母
  • 限定器材適應症與病人年齡範圍
  • 在每次更新後重做風險與人因驗證

讀者接著會問

目前有真實病人使用這項生成預測功能嗎?

官方資料將它定位為研究展示,並明確說明不在現行核准系統內,也不供臨床決策或病人照護。不能從展示推論已有臨床客戶或病人使用。

什麼才算足以擴大到臨床的證據?

至少需要指定適應症與病人族群的前瞻驗證、完整錯誤分布、人因與醫師監督流程、更新管理、資料安全及監管審查。影像逼真或單次成功不能替代這些證據。

資料最後查核:2026 年 8 月 25 日