1 · PDF 转文字
扫描页先经本地 OCR,随后进行文本清理、页码映射和章节边界识别。原始 OCR 作为历史证据保留,但不进入公共包。
METHODS & SOURCES
从 PDF 扫描到数字展览,每一步都保留对原书页的回查路径,并明确自动化与人工审核的边界。
扫描页先经本地 OCR,随后进行文本清理、页码映射和章节边界识别。原始 OCR 作为历史证据保留,但不进入公共包。
逻辑段落优先于 PDF 页边界。原书十二章被映射为十二个展厅,展览叙述仍保留章节和 PDF 页来源。
事件、人物、地点、机构、作品、引文和图像被重新组织为阅读入口;不补入《庞薰琹传》以外的事实。
展厅、事件、引文与影像旁的“查看来源页”打开本地扫描图,供读者核对展览叙述与原页。
内容构建、页码存在性、检索回归、浏览器交互、移动端溢出和分发包完整性均由本地自动测试覆盖。
自动化通过不等于逐字人工校订完成。未闭合的人工作业会在版本状态中持续披露。
第十二章正文由原书扫描页经本地 OCR、章节重建和来源校验恢复。自动化质量检查已通过,最终人工 QA 尚未全部收口。本版本作为展览预览使用。
公共预览版不含数据库、用户笔记、收藏、反馈、标注、correction、本地 Python API 或模型文件。完整自然语言证据检索与研究笔记功能仅在本地研究版提供。