Aivora
arXivAI 研究進階

臨床診斷 MLLM 提示詞優化:Ranking-PE 解決醫療資料極端不平衡問題

Ranking-PE: Prompt Optimization for Multimodal Clinical Diagnosis under Extreme Class Imbalance

2 分鐘閱讀
臨床診斷 MLLM 提示詞優化:Ranking-PE 解決醫療資料極端不平衡問題
30 秒看懂

在臨床診斷中,由於陽性樣本極稀少,傳統以準確度(Accuracy)為導向的提示詞優化容易因模型偏向預測多數陰性而失真。本文提出 Ranking-PE 框架,將優化機制重構為「成對排序(Pairwise Ordering)」。透過評估候選提示詞對「陽性-陰性」樣本對的排序正確性,使其優化目標直接對齊 AUROC。在 MIMIC 資料集上,此方法在不增加任何額外運算成本下,將 Qwen3-VL-8B 與 MedGemma-4B 的 AUROC 分別顯著提升了 5.8% 與 16.2%。

核心重點

01

以 AUROC 取代準確度

解決罕見疾病診斷中因「盲猜陰性」導致高準確度卻無臨床價值的問題,改為優化對陽性與陰性的排序能力。

02

成對 Pareto 演化

在提示詞搜尋的三個核心層級(演化矩陣、反思回饋、最終篩選)全面引入成對排序,使優化指標等同於最大化 AUROC。

03

零額外運算開銷

直接轉換既有的評估分數矩陣,不需要引入代理損失函數,也不需增加任何額外的模型呼叫次數。

04

醫學影像骨幹為必要前提

消融實驗顯示,提示詞優化無法取代高品質的醫學影像編碼器(如經 SFT 或醫學預訓練之影像模型),兩者為互補關係。

技術圖解

傳統優化方法與 Ranking-PE 比較
傳統提示詞優化 (例如 GEPA)Ranking-PE (本論文提出)
核心優化目標準確度 (Accuracy)排序能力 (AUROC)
評估矩陣基礎單一實例正確性 (1=對, 0=錯)陽性-陰性實例對排序正確性
面對資料極端失衡容易退化、盲目預測多數類別保持穩健、不受類別分佈影響
額外運算開銷無無 (免除代理損失函數)

為什麼重要

這項研究解決了醫療 AI 落地時的一大痛點:真實臨床資料的極度不平衡。過去的提示詞自動優化演算法多為 NLP 設計,盲目追求高準確度,導致模型在篩檢罕見疾病時失效。Ranking-PE 證明了在不重新訓練模型參數的前提下,僅透過優化提示詞的「排序能力」就能大幅提升多模態模型在臨床診斷上的實用價值,為醫療 AI 提供低成本且高效的部署方案。

對誰有影響

  • AI 研究人員
  • AI 開發者
  • 產品經理
  • 企業決策者

可以怎麼使用

  1. 1臨床決策輔助:在不平衡的醫學影像與電子病歷資料中,提升罕見疾病篩檢的敏感度與特異度。
  2. 2醫療 MLLM 提示詞自動調整:自動為特定科別或疾病,產生高 AUROC、符合臨床診斷價值的 Prompt。

限制與注意事項

  • 依賴高品質的基礎視覺編碼器,若 MLLM 的醫學視覺理解能力過低,提示詞優化效果也將受限。
  • 目前僅在 MIMIC 資料集的三種疾病上完成評估,其泛化到其他臨床學科與真實醫療工作流的能力仍需驗證。

延伸閱讀

Imagine3D-LLM:讓多模態大模型在回答前「腦補」出 3D 場景
arXivAI 研究

Imagine3D-LLM:讓多模態大模型在回答前「腦補」出 3D 場景

Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering

受到人類空間推理的啟發,Imagine3D-LLM 讓多模態大模型在回答前,先將多視角影像重建為精簡的 3D 點雲與高斯潑濺(3DGS)表示法,顯著提升其 3D 理解與空間推理能力。

2 分鐘閱讀
區域去噪失效與語意分化的同步:生成模型中的「相變」理論研究
arXivAI 研究

區域去噪失效與語意分化的同步:生成模型中的「相變」理論研究

The Convergence of Local Denoising Breakdown and Semantic Speciation in Generative Models

本研究探討生成模型中「語意分化」(決定生成類別)與「非區域性」(區域去噪失效)高度同步的現象,證明語意資訊是連結兩者的共同因,並定義了系統規模擴大時的相變行為。

2 分鐘閱讀