MarkItDown
把多種文件內容轉成結構清楚的 Markdown,方便 Agent 閱讀、摘要與整理。
查看官方 GitHub →讓 AI Agent 能夠讀懂文件、精準分析 PDF,並辨識掃描資料。

把多種文件內容轉成結構清楚的 Markdown,方便 Agent 閱讀、摘要與整理。
查看官方 GitHub →處理 PDF 的文字、頁碼、座標、圖片與頁面資訊,適合需要精準定位的任務。
查看官方 GitHub →辨識掃描文件與影像型 PDF,將圖片中的文字轉成可搜尋、可分析的內容。
查看 Tesseract →| 文件狀況 | 建議 Skill | 主要用途 |
|---|---|---|
| 一般辦公文件與 PDF | MarkItDown | 轉換與內容整理 |
| 需要頁面細節或圖片 | PyMuPDF | 精準擷取與版面分析 |
| 掃描或無法選取文字 | PDF OCR | 文字辨識 |
MarkItDown 與 PyMuPDF 可依 Python 專案需求安裝;OCR 另需 Tesseract 與語言資料。
處理結果輸出到新的資料夾,避免直接覆蓋原始教材或行政文件。
姓名、日期、數字、表格與正式發布內容,都要由使用者審閱。