← 返回
未分类 Key 中文

Extract Tables From Pdf

Extract tables from PDF documents using MinerU's table detection engine. Identifies and extracts structured table data from both native and scanned PDFs. Fea...
使用MinerU表格检测引擎从PDF文档中提取表格。能够从原生PDF和扫描PDF中识别并提取结构化表格数据。
mzlzyca
未分类 clawhub v0.4.0 1 版本 100000 Key: 需要
★ 0
Stars
📥 641
下载
💾 1
安装
1
版本
#latest

概述

Extract Tables From Pdf

Convert and extract content from .pdf using MinerU (mineru-open-api).

Install

npm install -g mineru-open-api
# or via Go (macOS/Linux):
go install github.com/opendatalab/MinerU-Ecosystem/cli/mineru-open-api@latest

Quick Start

# Extract tables from PDF (requires token)
mineru-open-api extract report.pdf -o ./out/

# With explicit table flag and OCR for scanned docs
mineru-open-api extract scanned.pdf --ocr --table -o ./out/

Authentication

Token required for extract and crawl:

mineru-open-api auth            # Interactive token setup
export MINERU_TOKEN="your-token" # Or via environment variable

Create token at: https://mineru.net/apiManage/token

Capabilities

  • Supports local files and URLs
  • Requires token (mineru-open-api auth or MINERU_TOKEN env)
  • Supported input: .pdf
  • Language hint with --language (default: ch, use en for English)
  • Page range with --pages (where applicable)

Notes

  • Table recognition requires extract with token. flash-extract does NOT support tables. Use --table flag (enabled by default).
  • Output goes to stdout by default; use -o to save to file
  • Binary formats (docx) require -o flag (cannot stream to stdout)
  • All progress/status messages go to stderr
  • MinerU is an open-source project by OpenDataLab (Shanghai AI Lab): https://github.com/opendatalab/MinerU

版本历史

共 1 个版本

  • v0.4.0 当前
    2026-05-03 04:47 安全 安全

安全检测

腾讯云安全 (Keen)

安全,无风险
查看报告

腾讯云安全 (Sanbu)

安全,无风险
查看报告

🔗 相关推荐

Doc Parse

mzlzyca
使用MinerU从Word文档(.doc、.docx)中解析提取结构化内容,转换为格式规范的Markdown。保留完整文档层级结构(标题、段落等)
★ 0 📥 836

Ocr Pro

mzlzyca
使用MinerU实现专业级PDF和图像OCR。先进文本识别,搭载VLM(视觉语言模型),支持复杂排版、混合内容...
★ 0 📥 786

PDF to DOCX

mzlzyca
使用 MinerU 将 PDF 文档转换为 Word(.docx)格式,保持布局、文本、表格和格式,实现可编辑的 Word 文档。
★ 0 📥 690