臨床診斷 MLLM 提示詞優化:Ranking-PE 解決醫療資料極端不平衡問題
Ranking-PE: Prompt Optimization for Multimodal Clinical Diagnosis under Extreme Class Imbalance
在臨床診斷中,由於陽性樣本極稀少,傳統以準確度(Accuracy)為導向的提示詞優化容易因模型偏向預測多數陰性而失真。本文提出 Ranking-PE 框架,將優化機制重構為「成對排序(Pairwise Ordering)」。透過評估候選提示詞對「陽性-陰性」樣本對的排序正確性,使其優化目標直接對齊 AUROC。在 MIMIC 資料集上,此方法在不增加任何額外運算成本下,將 Qwen3-VL-8B 與 MedGemma-4B 的 AUROC 分別顯著提升了 5.8% 與 16.2%。
核心重點
以 AUROC 取代準確度
解決罕見疾病診斷中因「盲猜陰性」導致高準確度卻無臨床價值的問題,改為優化對陽性與陰性的排序能力。
成對 Pareto 演化
在提示詞搜尋的三個核心層級(演化矩陣、反思回饋、最終篩選)全面引入成對排序,使優化指標等同於最大化 AUROC。
零額外運算開銷
直接轉換既有的評估分數矩陣,不需要引入代理損失函數,也不需增加任何額外的模型呼叫次數。
醫學影像骨幹為必要前提
消融實驗顯示,提示詞優化無法取代高品質的醫學影像編碼器(如經 SFT 或醫學預訓練之影像模型),兩者為互補關係。
技術圖解
| 傳統提示詞優化 (例如 GEPA) | Ranking-PE (本論文提出) | |
|---|---|---|
| 核心優化目標 | 準確度 (Accuracy) | 排序能力 (AUROC) |
| 評估矩陣基礎 | 單一實例正確性 (1=對, 0=錯) | 陽性-陰性實例對排序正確性 |
| 面對資料極端失衡 | 容易退化、盲目預測多數類別 | 保持穩健、不受類別分佈影響 |
| 額外運算開銷 | 無 | 無 (免除代理損失函數) |
為什麼重要
這項研究解決了醫療 AI 落地時的一大痛點:真實臨床資料的極度不平衡。過去的提示詞自動優化演算法多為 NLP 設計,盲目追求高準確度,導致模型在篩檢罕見疾病時失效。Ranking-PE 證明了在不重新訓練模型參數的前提下,僅透過優化提示詞的「排序能力」就能大幅提升多模態模型在臨床診斷上的實用價值,為醫療 AI 提供低成本且高效的部署方案。
對誰有影響
- AI 研究人員
- AI 開發者
- 產品經理
- 企業決策者
可以怎麼使用
- 1臨床決策輔助:在不平衡的醫學影像與電子病歷資料中,提升罕見疾病篩檢的敏感度與特異度。
- 2醫療 MLLM 提示詞自動調整:自動為特定科別或疾病,產生高 AUROC、符合臨床診斷價值的 Prompt。
限制與注意事項
- 依賴高品質的基礎視覺編碼器,若 MLLM 的醫學視覺理解能力過低,提示詞優化效果也將受限。
- 目前僅在 MIMIC 資料集的三種疾病上完成評估,其泛化到其他臨床學科與真實醫療工作流的能力仍需驗證。
延伸閱讀

突破生成式推薦延遲瓶頸:NVIDIA Dynamo-Triton 與 PyTorch AOTI 部署 HSTU 模型實戰
Overcoming Generative Recommender Latency: Deploying HSTU Models with NVIDIA Dynamo-Triton and PyTorch AOTI
本文介紹如何透過 NVIDIA Dynamo-Triton、PyTorch AOTI 與 FlexKV 快取技術,將高延遲的 HSTU 生成式推薦模型轉化為低延遲的生產級服務,在 Blackwell GPU 上實現最高 5.93 倍的加速。
Imagine3D-LLM:讓多模態大模型在回答前「腦補」出 3D 場景
Imagine3D-LLM: Teaching MLLMs to Imagine 3D Scenes Before Answering
受到人類空間推理的啟發,Imagine3D-LLM 讓多模態大模型在回答前,先將多視角影像重建為精簡的 3D 點雲與高斯潑濺(3DGS)表示法,顯著提升其 3D 理解與空間推理能力。
區域去噪失效與語意分化的同步:生成模型中的「相變」理論研究
The Convergence of Local Denoising Breakdown and Semantic Speciation in Generative Models
本研究探討生成模型中「語意分化」(決定生成類別)與「非區域性」(區域去噪失效)高度同步的現象,證明語意資訊是連結兩者的共同因,並定義了系統規模擴大時的相變行為。