全部場數

019 · 用 Docling 把非結構化文件變好用

紅帽工程師示範用開源工具 Docling,把 PDF、圖片、表格轉成 Markdown 與 JSON,讓 RAG 與 agent 能穩定讀懂企業文件。

2026-06-2820:40Cedric Clyburn(Red Hat)Agent開發工具開源看原片

原標題:Structuring the Unstructured - Cedric Clyburn, Red Hat

重點摘要

  • 非結構化資料難以直接餵給 LLMPDF、簡報、合約、技術文件、掃描件、圖表與表格等資料型態,若沒有先轉換成結構化格式,AI 系統很難正確理解與運用。
  • 解析錯誤會造成實際傷害一份掃描 PDF 因為跨欄合併文字,讓 AI 誤讀出一個不存在的詞,結果被二十篇科學論文引用。
  • 陽春解析器與昂貴模型都有各自的問題簡單的 PDF 解析器會把表格拆散、遺漏圖片內容;改用大型模型雖然品質較好,但成本高,不同版本輸出也不穩定。
  • Docling 是免費、可在本機跑的開源轉換工具這是 Linux Foundation 底下的專案,能把 PDF 等格式轉成 Markdown、JSON 或 Pydantic 資料型態,不需要 GPU 也能跑。
  • 用 CPU 跑就能大幅降低成本Hugging Face 的案例顯示,用 CPU 跑 Docling 處理 PDF,比起直接用 VLM 或 OCR,成本可以省下五十倍。
  • 不用向量資料庫也能做 RAG,還能接上 AI agent講者示範「chunkless RAG」直接在文件大綱裡搜尋答案,也展示了 Docling Serve 與 Docling MCP Server,讓 agent 能透過 API 或 MCP 呼叫文件處理功能。

時間軸

時碼點下去會跳到影片的那一段。

時碼段落重點
00:00開場Cedric Clyburn(Red Hat)自我介紹,說明這場要講如何從企業文件裡萃取結構、餵給 RAG 與 agent 使用。
00:54問題背景引用 NVIDIA 的 Jensen 在主題演講裡的說法,指出非結構化資料正成為 AI 的新內容層,而企業的 PDF 常散落在各個系統裡。
01:42介紹 Docling說明這場要用開源工具 Docling,把文件轉成 Markdown、JSON,並講解擷取、解析、切塊等流程。
03:01案例:解析錯誤釀成的論文烏龍一份掃描 PDF 因跨欄合併文字,讓 AI 誤讀出一個不存在的詞,結果被二十篇科學論文引用。
04:08陽春解析器的問題展示一個簡單 PDF 解析器的輸出,表格被拆散、文字被截斷合併,圖片內容也完全遺失。
05:16大型模型的成本與不穩定送去給前沿模型解析雖然品質較好,但費用不低,而且不同版本之間的輸出常常不一致。
07:28案例:CPU 成本省五十倍Hugging Face 的 Leandro 用 Docling 清理 Common Crawl 的 PDF,CPU 處理成本比直接用 VLM 或 OCR 省五十倍。
09:14結構化輸出:從發票抽欄位示範直接從發票抽出帳單編號、總金額、寄件人等欄位,輸出成 Pydantic 格式而不是整份文字。
10:44Demo:PDF 轉 Markdown 與表格擷取用 Docling 的 Document Converter 把一份研究論文 PDF 轉成 Markdown,並成功擷取出其中八個表格。
14:07Chunkless RAG不建向量資料庫,直接讓 LLM 在 Docling 產生的文件大綱裡搜尋段落來回答問題,並示範對 IBM 2025 年報(418 個段落)提問營收成長。
17:24Docling MCP Server說明 Docling MCP Server 讓 Claude Code 等 AI agent 能透過 MCP 直接呼叫文件轉換與擷取功能。
19:28總結總結 Docling 能在本機、不需 GPU 的情況下把文件轉成好用的格式,並感謝主辦單位。

值得記的話

名詞與人物

Docling講者展示的開源文件轉換工具,屬於 Linux Foundation 旗下專案,能把 PDF 等格式轉成 Markdown、JSON 或 Pydantic 資料型態。
RAG先檢索相關資料再交給 LLM 生成答案的架構,這場用來示範企業文件問答。
Chunkless RAG不使用 chunker、embedding model 或向量資料庫,改成直接在文件大綱裡搜尋最相關段落來回答問題的做法。
Docling Serve把 Docling 包成 REST API 服務,可以用容器或 Kubernetes 部署,一次處理大量文件。
Docling MCP Server讓 AI agent 透過 Model Context Protocol 呼叫 Docling 的文件處理功能。
Ollama講者用來在本機跑視覺語言模型、替圖片產生描述的工具。

延伸

  • 講者提到 Cursor 與 Continue 這類開發工具,也能透過 Docling MCP Server 呼叫文件處理功能,但沒有展開示範。
  • 版面視覺化功能可以標出可能含有個人識別資訊(PII)的區塊,方便先做去識別化,講者只帶過一句,沒有細講實際做法。
  • 講者提到 Docling 有 hybrid chunker 可以把文件切塊用在其他應用,但這場沒有進一步說明。