METHODS & SOURCES

方法与来源

从 PDF 扫描到数字展览,每一步都保留对原书页的回查路径,并明确自动化与人工审核的边界。

工作流程概览

1 · PDF 转文字

扫描页先经本地 OCR,随后进行文本清理、页码映射和章节边界识别。原始 OCR 作为历史证据保留,但不进入公共包。

2 · 章节重建

逻辑段落优先于 PDF 页边界。原书十二章被映射为十二个展厅,展览叙述仍保留章节和 PDF 页来源。

3 · 策展重组

事件、人物、地点、机构、作品、引文和图像被重新组织为阅读入口;不补入《庞薰琹传》以外的事实。

4 · 来源页机制

展厅、事件、引文与影像旁的“查看来源页”打开本地扫描图,供读者核对展览叙述与原页。

5 · 自动化检查

内容构建、页码存在性、检索回归、浏览器交互、移动端溢出和分发包完整性均由本地自动测试覆盖。

6 · 人工审核边界

自动化通过不等于逐字人工校订完成。未闭合的人工作业会在版本状态中持续披露。

第十二章恢复状态

COMPUTER-ASSISTED RECOVERY · AUTOMATED VALIDATION PASSED · HUMAN QA DEFERRED 第十二章对应 PDF p280–295、书内页 264–279,共 16 页、139 个逻辑段落;未解决字符为 0,自动回归通过。最终人工发布审核延期,本预览不声称逐字人工校订完成。

第十二章正文由原书扫描页经本地 OCR、章节重建和来源校验恢复。自动化质量检查已通过,最终人工 QA 尚未全部收口。本版本作为展览预览使用。

公共版与本地研究版

公共预览版不含数据库、用户笔记、收藏、反馈、标注、correction、本地 Python API 或模型文件。完整自然语言证据检索与研究笔记功能仅在本地研究版提供。