新聞宏觀經濟OpenAI 推出「Health in ChatGPT」功能,免費與付費用戶採分級模型存取

OpenAI 推出「Health in ChatGPT」功能,免費與付費用戶採分級模型存取

作者: The Decoder·

重點速覽

  • OpenAI 的「Health in ChatGPT」功能在自一月起的測試期後,現已向美國 18 歲及以上用戶開放。
  • 該功能採雙層模型系統,免費用戶獲得的健康指引評分低於付費訂閱者所使用的旗艦 GPT-5.6 Sol 模型。
  • 每週已有超過 3 億人向 ChatGPT 提出健康問題,較一月的 2.3 億持續成長。
  • 歐洲上線時程仍不明朗,原因包括 GDPR 對健康數據的要求以及可能依《歐盟 AI 法案》被歸類為高風險。
  • 超過 260 位醫師參與開發 Health 功能,且 OpenAI 表示不會將連接的健康數據用於模型訓練或廣告。
OpenAI 推出「Health in ChatGPT」功能,免費與付費用戶採分級模型存取

OpenAI 正向美國 18 歲及以上用戶推出「Health in ChatGPT」功能,此功能經自一月起的測試期後正式上線。用戶可連接 Apple Health 數據、醫療紀錄與健康應用程式,用於檢視檢驗報告、準備看診以及分析睡眠或活動數據。此舉建立在消費科技多年來向個人健康數據領域擴張的基礎之上——Apple 的 HealthKit 與 Google Fit 自 2014 年起便已整合穿戴裝置與應用程式數據——但 OpenAI 更進一步,嘗試將醫療紀錄、檢驗結果解讀與對話式健康指引整合於單一 AI 助理中,而該助理已被數億人使用。OpenAI 表示不會將連接的健康數據用於模型訓練或廣告用途。在美國,醫療機構與保險公司持有的醫療紀錄受 HIPAA 保護,但透過消費應用程式與 AI 平台傳輸的健康數據可能落入 HIPAA 不適用的監管灰色地帶——美國聯邦貿易委員會在針對健康應用程式開發者的執法行動中已日益強調此一區別。

這項公告詳載於 OpenAI 官方網站,發布之際該公司也公布目前每週已有超過 3 億人向 ChatGPT 提出健康問題——此數字較一月的 2.3 億有所成長。OpenAI 表示超過 260 位醫師參與了 Health 功能的開發。

分級模型存取造成品質落差

該功能採雙層系統運作。免費版 ChatGPT 用戶獲得的健康指引由 GPT-5.5 Instant 提供,其在健康基準測試中的得分低於新旗艦模型 GPT-5.6 Sol,該模型僅提供給付費訂閱者。

OpenAI 預料會以兩個模型在 HealthBench Professional 測試中均優於醫師答案為由,為此一架構辯護。然而,基準測試結果來自旨在衡量知識的人造測試環境。醫師得分較低可能有多種原因,包括時間壓力、疲勞,或在無法取得病歷或同儕意見的情況下進行測試。基準測試也無法重現實際看診時的互動情境——在面對面看診中,醫師可直接檢查患者、觀察非語言線索,並仰賴多年臨床經驗。分級做法同時意味著無法負擔訂閱費用的用戶會獲得品質可量化的較低健康指引——隨著 AI 助理日益成為獲取醫療資訊的第一站,此一現象引發了近用權的疑慮,尤其是在更傾向使用免費版本 的年輕及低收入族群中尤為明顯。

OpenAI 在公告中也多次提醒,ChatGPT 仍可能出錯,無法取代專業醫療建議。

初步測試後的可用性改善

OpenAI 的早期測試發現,超過 70% 的參與者在專屬 Health 區塊之外提出健康問題,因為切換至該區塊過於不便。為此,公司已讓 Health 功能可在任何對話中使用,同時保留獨立的 Health 區塊以管理連接數據及存取過去的健康對話。

歐洲上線時程仍不明朗

該公司尚未表示 Health 功能是否或何時將在歐洲推出。當 OpenAI 於一月首次宣布此功能時,便明確排除歐洲經濟區、瑞士及英國。歐盟更嚴格的數據隱私法規,以及該功能可能依《歐盟 AI 法案》被歸類為高風險,被認為是排除的可能原因。GDPR 第 9 條將健康數據指定為特殊類別,須取得明確同意並適用額外保障措施,而《歐盟 AI 法案》對某些健康相關 AI 系統的高風險分類可能觸發符合性評估及持續合規義務,這些在美國市場並不適用。

AI 健康風險並非假設

AI 在醫療情境中的局限性已有充分記錄。在最新的放射科基準測試 RadLE 2.0 中,受測的 16 個 AI 模型沒有一個能達到人類放射科醫師的水準。研究指出主要問題在於聊天機器人會以高度自信給出錯誤的發現,而非承認自身不確定性——而在這方面,人類放射科醫師的表現顯著更佳。

過度自信、說服力與迎合性——即聊天機器人選擇附和用戶的假設而非挑戰錯誤假設——的綜合效應,也已被認為與嚴重的心理健康危害有關。

另一方面,部分研究顯示 AI 能在健康數據中發現醫療專業人員遺漏的模式,有時結果令人矚目。MIRA 是一套為電子健康紀錄設計的系統,而 AMIE 在模擬問診中的表現均約略相當於基層醫師。一位研究人員將這類 AI 代理比作飛機的自動駕駛系統:「這些系統可以接手常規任務,從而支援並減輕醫療專業人員的負擔,但最終責任永遠在於醫師。」美國 FDA 一直在制定針對 AI 與機器學習「醫療器材軟體」的監管框架,但提供一般健康資訊的消費級聊天機器人可能在該框架之外運作,尤其當它們未被作為診斷工具行銷時——這使得有用指引與未受監管醫療建議之間的界線持續演變。