Back to Topics Directory
Topic Hub

#pdf-extraction (5 Repositories)

Ranked open-source repositories tagged with #pdf-extraction, scored by pull request acceptance likelihood and maintainer engagement velocity.

Topic Avg Merge Rate

64.9%

Avg Review Latency

48.0h

Filter by language

5 repositories tagged #pdf-extraction

A TierPython 7.2k

Zipstack/unstract

LLM-Driven Extraction of Unstructured Data — Built for API Deployments & ETL Pipeline Workflows

84.2%
Merge Rate
3d
First Review
85%
1st-Timers
11
Maintainers
B TierRust 9.2k 1 GFIs

xberg-io/xberg

Polyglot document intelligence with a Rust core: extract text, metadata, images, tables, and structured data from 106 formats across 140 file extensions, plus code intelligence for 371 languages. Fifteen bindings, with CLI, REST API, and MCP server.

76.5%
Merge Rate
6d
First Review
75%
1st-Timers
10
Maintainers
B TierRust 16.9k

firecrawl/pdf-inspector

Fast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.

63.8%
Merge Rate
17h
First Review
31%
1st-Timers
22
Maintainers
B TierPython 146

appautomaton/document-SKILLs

Claude Code and Codex SKILLs for PDF, Excel, Word, and PowerPoint manipulation — extraction, forms, formulas, tracked changes, adapted from Anthropic skills.

100.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
D TierC++ 1.0k

aiptimizer/TurboOCR

TurboOCR, >200 img/s OmnidocBench. TensorRT FP16, PP-OCRv6, HTTP + gRPC

0.0%
Merge Rate
-
First Review
0%
1st-Timers
0
Maintainers
Best Pdf-extraction Open Source Repositories & C-Rank™ | GetMerged