019 · 用 Docling 把非結構化文件變好用
紅帽工程師示範用開源工具 Docling,把 PDF、圖片、表格轉成 Markdown 與 JSON,讓 RAG 與 agent 能穩定讀懂企業文件。
原標題:Structuring the Unstructured - Cedric Clyburn, Red Hat
重點摘要
- 非結構化資料難以直接餵給 LLMPDF、簡報、合約、技術文件、掃描件、圖表與表格等資料型態,若沒有先轉換成結構化格式,AI 系統很難正確理解與運用。
- 解析錯誤會造成實際傷害一份掃描 PDF 因為跨欄合併文字,讓 AI 誤讀出一個不存在的詞,結果被二十篇科學論文引用。
- 陽春解析器與昂貴模型都有各自的問題簡單的 PDF 解析器會把表格拆散、遺漏圖片內容;改用大型模型雖然品質較好,但成本高,不同版本輸出也不穩定。
- Docling 是免費、可在本機跑的開源轉換工具這是 Linux Foundation 底下的專案,能把 PDF 等格式轉成 Markdown、JSON 或 Pydantic 資料型態,不需要 GPU 也能跑。
- 用 CPU 跑就能大幅降低成本Hugging Face 的案例顯示,用 CPU 跑 Docling 處理 PDF,比起直接用 VLM 或 OCR,成本可以省下五十倍。
- 不用向量資料庫也能做 RAG,還能接上 AI agent講者示範「chunkless RAG」直接在文件大綱裡搜尋答案,也展示了 Docling Serve 與 Docling MCP Server,讓 agent 能透過 API 或 MCP 呼叫文件處理功能。
時間軸
時碼點下去會跳到影片的那一段。
| 時碼 | 段落 | 重點 |
|---|---|---|
| 00:00 | 開場 | Cedric Clyburn(Red Hat)自我介紹,說明這場要講如何從企業文件裡萃取結構、餵給 RAG 與 agent 使用。 |
| 00:54 | 問題背景 | 引用 NVIDIA 的 Jensen 在主題演講裡的說法,指出非結構化資料正成為 AI 的新內容層,而企業的 PDF 常散落在各個系統裡。 |
| 01:42 | 介紹 Docling | 說明這場要用開源工具 Docling,把文件轉成 Markdown、JSON,並講解擷取、解析、切塊等流程。 |
| 03:01 | 案例:解析錯誤釀成的論文烏龍 | 一份掃描 PDF 因跨欄合併文字,讓 AI 誤讀出一個不存在的詞,結果被二十篇科學論文引用。 |
| 04:08 | 陽春解析器的問題 | 展示一個簡單 PDF 解析器的輸出,表格被拆散、文字被截斷合併,圖片內容也完全遺失。 |
| 05:16 | 大型模型的成本與不穩定 | 送去給前沿模型解析雖然品質較好,但費用不低,而且不同版本之間的輸出常常不一致。 |
| 07:28 | 案例:CPU 成本省五十倍 | Hugging Face 的 Leandro 用 Docling 清理 Common Crawl 的 PDF,CPU 處理成本比直接用 VLM 或 OCR 省五十倍。 |
| 09:14 | 結構化輸出:從發票抽欄位 | 示範直接從發票抽出帳單編號、總金額、寄件人等欄位,輸出成 Pydantic 格式而不是整份文字。 |
| 10:44 | Demo:PDF 轉 Markdown 與表格擷取 | 用 Docling 的 Document Converter 把一份研究論文 PDF 轉成 Markdown,並成功擷取出其中八個表格。 |
| 14:07 | Chunkless RAG | 不建向量資料庫,直接讓 LLM 在 Docling 產生的文件大綱裡搜尋段落來回答問題,並示範對 IBM 2025 年報(418 個段落)提問營收成長。 |
| 17:24 | Docling MCP Server | 說明 Docling MCP Server 讓 Claude Code 等 AI agent 能透過 MCP 直接呼叫文件轉換與擷取功能。 |
| 19:28 | 總結 | 總結 Docling 能在本機、不需 GPU 的情況下把文件轉成好用的格式,並感謝主辦單位。 |
值得記的話
名詞與人物
| Docling | 講者展示的開源文件轉換工具,屬於 Linux Foundation 旗下專案,能把 PDF 等格式轉成 Markdown、JSON 或 Pydantic 資料型態。 |
|---|---|
| RAG | 先檢索相關資料再交給 LLM 生成答案的架構,這場用來示範企業文件問答。 |
| Chunkless RAG | 不使用 chunker、embedding model 或向量資料庫,改成直接在文件大綱裡搜尋最相關段落來回答問題的做法。 |
| Docling Serve | 把 Docling 包成 REST API 服務,可以用容器或 Kubernetes 部署,一次處理大量文件。 |
| Docling MCP Server | 讓 AI agent 透過 Model Context Protocol 呼叫 Docling 的文件處理功能。 |
| Ollama | 講者用來在本機跑視覺語言模型、替圖片產生描述的工具。 |
延伸
- 講者提到 Cursor 與 Continue 這類開發工具,也能透過 Docling MCP Server 呼叫文件處理功能,但沒有展開示範。
- 版面視覺化功能可以標出可能含有個人識別資訊(PII)的區塊,方便先做去識別化,講者只帶過一句,沒有細講實際做法。
- 講者提到 Docling 有 hybrid chunker 可以把文件切塊用在其他應用,但這場沒有進一步說明。