example.py Python 3.12
import pdftomarkdown
# 1. Single Document Conversion with Options
markdown = pdftomarkdown.convert(
"financial_report_2025.pdf",
extract_tables=True, # GFM pipe tables
math_delimiters="dollar", # LaTeX $ / $$ delimiters
deinterleave_columns=True, # 2-column academic layout fix
clean_headers=True # Strip running header/footer noise
)
with open("output.md", "w", encoding="utf-8") as f:
f.write(markdown)
# 2. High-Throughput Batch Processing with Multithreading
results = pdftomarkdown.batch_convert(
input_dir="./data/raw_pdfs",
output_dir="./data/clean_markdown",
threads=8 # Parallel CPU workers
)
print(f"Successfully processed {len(results)} documents!")