pdf-parser-case-study

Projects

{"content":"---\ntitle: "Building a PDF Parser"\ndescription: "A case study on building a custom PDF parser in Rust"\ntags: [rust, pdf, case-study]\nupdated: "2024-04-10"\n---\n\n# Building a PDF Parser\n\n## Why I Built It\n\nI needed to extract structured data from thousands of PDF invoices.\nExisting tools were either too expensive or too slow.\n\n## Architecture\n\nThe parser is built in three layers:\n\n1. Lexer - Tokenizes raw PDF bytes\n2. Parser - Builds an AST from tokens\n3. Extractor - Extracts structured data from the AST\n\n## Performance\n\nProcessing 10,000 PDFs dropped from 45 minutes to 90 seconds.\n","path":"projects/pdf-parser-case-study.mdx"}

pdf-parser-case-study — CodeDoz