點陣圖秒變任意比例流程圖!「One Figure, Every Canvas」以 Agent 協同管線自動排版且支援 draw.io 編輯
One Figure, Every Canvas: Editable Flowchart Relayout via Agentic Pipeline
在撰寫學術論文、簡報或社群貼文時,同一個流程圖往往需要放進雙欄 PDF、16:9 簡報或 9:16 手機螢幕中。手動調整非常費時,而傳統 AI 工具不是拉伸變形,就是會產生錯誤連線。本研究提出將流程拆解為「解析(Parse)」、「風格(Style)」與「佈局(Layout)」三階段的 Agent 系統。每個階段皆由執行 Agent 與審查 Critic(結合邏輯檢查與視覺 VLM 反饋)共同把關,確保排版完全正確。在 100 個流程圖的測試中,其內容保真度達 68.6%,遠超現有方法的 11.2-41.4%。
核心重點
三階段 Agent 協同架構
將複雜的重新排版任務拆解為「解析」、「風格提取」與「佈局重新編排」三個獨立階段,降低單一模型推理負擔並提高準確度。
雙重審查機制防止連線中斷
每個階段皆引入結合 VLM 視覺反饋與程式邏輯檢查的 Critic 機制,徹底避免流程圖中關鍵連線「悄悄中斷」或產生資訊幻覺。
輸出原生可編輯格式
不同於以往只輸出靜態圖片的 AI,本系統直接生成 draw.io 相容的 mxGraph XML,方便使用者事後微調。
內容保真度大幅提升
在包含 100 個流程圖、5 種寬高比的基準測試中,內容保真度達到 68.6%,遠勝前人最佳的 41.4%。
技術圖解
為什麼重要
過去科研人員或設計師在將論文插圖轉換為投影片(16:9)、海報或社群媒體貼圖(1:1)時,必須手動重新拉動每個框線與箭頭,極其耗時。這項技術不僅實現了「一圖多用」的自動適應排版,更難能可貴的是它克服了生成式 AI 常見的「關係幻覺」問題,並提供可再次手動編輯的向量格式,是 AI 輔助學術與商務繪圖的一大突破。
對誰有影響
- AI 開發者
- AI 研究人員
- 產品經理
- 內容創作者
可以怎麼使用
- 1學術論文插圖跨平台適應:將論文中的雙欄流程圖一鍵轉換為 16:9 的報告簡報或 9:16 的手機預覽圖。
- 2系統架構圖快速重排與微調:匯入舊有的架構圖點陣圖片,重新排版後直接在 draw.io 中進行細部文字與節點修改。
限制與注意事項
- 對於結構極度複雜或非標準形狀(如手繪、多重重疊)的流程圖,解析與連線識別可能仍會出現微小誤差。
- 由於每個階段都需要 Agent 與 Critic 的多輪互動,處理時間與 API 呼叫成本可能高於傳統的單次推理模型。
延伸閱讀

為什麼 Agent 的對話會騙人?微軟與 HF 推出 ThinkingBox 評測真實資料庫狀態
The Agent Said It Was Done, the Database Disagreed: Introducing ThinkingBox
傳統評測只看對話和工具呼叫,微軟與 Hugging Face 推出的 ThinkingBox 則改用「資料庫最終狀態」與「副作用」來檢驗 Agent 的真實可靠度。

AutoSynthData:以企業 Agent 的失敗為師,自動生成高規格微調訓練資料
AutoSynthData: Generating Targeted Training Data from Enterprise Agent Failures
AutoSynthData 是 ServiceNow 開發的框架,透過分析企業 Agent 的失敗案例與強大導師模型的成功軌跡,自動生成具備可行性、真實性與挑戰性的微調資料,顯著提升 Agent 在特定企業環境中的任務達成率。
KaliBench:首個 Kali Linux 資安工具指令生成基準測試,助 8B 模型直逼 685B 巨獸
KaliBench: Evaluating and Boosting LLM Command Generation on Kali Linux
KaliBench 是一個專為 Kali Linux 設計的細粒度指令生成基準測試。研究發現,現有開源模型在無提示下的 CLI 指令準確度皆低於 42%,但透過其獨創的「免執行期可驗證獎勵」進行強化學習,能讓 8B 微型模型達到媲美 685B MoE 模型的表現。