Input: sample-scientific-2.pdf
pdfinfo
pdfinfo "sample-scientific-2.pdf" >"sample-scientific-2--poppler-cpp--pdfinfo.txt"Output: sample-scientific-2--poppler-cpp--pdfinfo.txt
Loading preview…
pdftotext
pdftotext -layout -eol unix "sample-scientific-2.pdf" "sample-scientific-2--poppler-cpp--pdftotext.txt"Output: sample-scientific-2--poppler-cpp--pdftotext.txt
Loading preview…
-raw: keep strings in content-stream order instead of reading order — useful comparison point against -layout's reconstructed reading order.
pdftotext -raw -eol unix "sample-scientific-2.pdf" "sample-scientific-2--poppler-cpp--pdftotext--raw.txt"Output: sample-scientific-2--poppler-cpp--pdftotext--raw.txt
Loading preview…
-i (ignore images) is required even with -stdout: pdftohtml still extracts embedded images to `<input-basename>-<page>_<n>.png` files written next to the INPUT PDF (not to our output path — images can't go to stdout) unless told not to. Confirmed the hard way: this wrote stray PNGs into pdf-inputs/ on PDFs with embedded images before -i was added.
pdftohtml -xml -i -stdout "sample-scientific-2.pdf" >"sample-scientific-2--poppler-cpp--pdftohtml.xml"Output: sample-scientific-2--poppler-cpp--pdftohtml.xml
Loading preview…