PDF 转 HTML
把 PDF 的文字层转成 HTML:可按原坐标还原版式,也可输出纯文本。扫描件没有文字层,转出来会是空白。
只能提取文字层:扫描件(图片型 PDF)转出来会是空白,图片、表格边框、矢量图形也都不会出现。 文字位置按原文件的文本对象坐标还原,复杂排版(多栏、旋转文字)可能与原版有差异;需要 「只是把文字拿出来」的时候,选纯文本模式更省事。
本工具在你的浏览器内运行,输入的内容与文件不会上传到任何服务器。
常见问题
- 为什么转出来的 HTML 是空的?
- 多半是因为这份 PDF 是扫描件——扫描件里只有一张张图片,没有可提取的文字层。可以这样验证:用 PDF 阅读器打开它,试着用鼠标选中一段文字,如果选不中,就说明它没有文字层。需要处理扫描件,得先做文字识别(OCR),本站不做这件事。
- 图片和表格会一起转过来吗?
- 不会。本站只做文字层,图片、表格框线、矢量图形都不会出现在结果里,页面上也如实标注了这一点。需要把版面整体搬过去的场合,用「PDF 转图片」更合适。
- 文字的位置和原文件对不上?
- 版式模式按原文件里每个文本对象的坐标定位,坐标与字号都做了点(pt)到像素的换算。常见的单栏文档——合同、报告、论文——通常对得很准;多栏排版、旋转文字、艺术字可能与原版有差异。如果你只需要文字内容,选纯文本模式更稳妥。