DOCUMENT PROCESSING SKILLS

三個核心文件處理 Skill

讓 AI Agent 能夠讀懂文件、精準分析 PDF,並辨識掃描資料。

三個核心文件處理 Skill 示意圖

這三個 Skill 各自負責什麼?

1

MarkItDown

把多種文件內容轉成結構清楚的 Markdown,方便 Agent 閱讀、摘要與整理。

查看官方 GitHub →
2

PyMuPDF

處理 PDF 的文字、頁碼、座標、圖片與頁面資訊,適合需要精準定位的任務。

查看官方 GitHub →
3

PDF OCR

辨識掃描文件與影像型 PDF,將圖片中的文字轉成可搜尋、可分析的內容。

查看 Tesseract →

Agent 的選擇方式

文件狀況建議 Skill主要用途
一般辦公文件與 PDFMarkItDown轉換與內容整理
需要頁面細節或圖片PyMuPDF精準擷取與版面分析
掃描或無法選取文字PDF OCR文字辨識
建議先檢查文件是否已有可選取文字,再選擇工具;不要對所有文件一律使用 OCR。

安裝與使用提醒

先安裝需要的能力

MarkItDown 與 PyMuPDF 可依 Python 專案需求安裝;OCR 另需 Tesseract 與語言資料。

保留原始檔

處理結果輸出到新的資料夾,避免直接覆蓋原始教材或行政文件。

人工最後確認

姓名、日期、數字、表格與正式發布內容,都要由使用者審閱。