
Optophone
用光敏元件扫描印刷文字,并转换为声音。
OCR × Document Intelligence × Clinical Records
从“识字”到“读懂病历”
Clinical document layers
From rules to learning

用光敏元件扫描印刷文字,并转换为声音。

Kurzweil 系统将扫描、OCR 与语音合成结合。

文档采集普及,OCR 转向统计模型与流水线。

识别文字,同时解析版面、结构与语义。
图片:Optophone;Kurzweil Reader;SpectraSCAN;Transkribus Dashboard。来源:Wikimedia Commons。
Document intelligence tasks
字符与文本行
版面、表格与顺序
字段、值与证据
提问、推理与拒答
代表论文:TrOCR (2021);LayoutLMv3 (2022);Donut (ECCV 2022);UDOP (CVPR 2023)。
Layout is clinical meaning
LayoutLMv3:文字 + 图像 + 坐标
Donut / Nougat:页面图像直接生成结构化文档
Huang et al., LayoutLMv3, ACM MM 2022;Kim et al., Donut, ECCV 2022;Blecher et al., Nougat, ICLR 2024.
Key information extraction
Document visual question answering
Question
“患者最近一次肌酐值是多少?”
Retrieve + read
跨页检索文字、表格和版面证据
Answer with evidence
第 2 页 · 检验报告
证据框已定位
DocVQA (WACV 2021) → MP-DocVQA (2022) → MMLongBench-Doc (NeurIPS 2024)。
Medical document question answering
2,000 张真实中文医疗报告图像
图像内容、表格数值与临床推理仍有明显性能差距
Jin et al., RJUA-MedDQA, 2024, Table 3.
Chinese medical report benchmark
1,925 份去标识化中文检验与检查报告
OCR 辅助输入在多数模型和字段上提高召回率
Shang et al., MedRepBench, 2025/2026 revision, Table 1.
Local workflow

点击系统对应的下载按钮,按安装向导完成安装。

打开模型列表,点击 qwen3-vl:2b;首次使用会自动下载。

打开 Settings,拖动 Context length 滑杆设置上下文长度。

点击 + 添加去标识化病历图片,确认模型后点击发送。
模糊、倾斜、遮挡、反光与压缩噪声,决定识别能力的上限。
小数点、单位、阴阳性和表格关系,可能在低质量输入中失真。
保留原图与证据坐标,高风险字段必须由专业人员确认。