
Optophone
用光敏元件扫描印刷文字,并转换为声音。
OCR × Document Intelligence × Clinical Records
从“识字”到“读懂病历”
Clinical document layers
From rules to learning

用光敏元件扫描印刷文字,并转换为声音。

Kurzweil 系统将扫描、OCR 与语音合成结合。

文档采集普及,OCR 转向统计模型与流水线。

识别文字,同时解析版面、结构与语义。
图片:Optophone;Kurzweil Reader;SpectraSCAN;Transkribus Dashboard。来源:Wikimedia Commons。
Document intelligence tasks
字符与文本行
版面、表格与顺序
字段、值与证据
提问、推理与拒答
Li et al.,TrOCR,AAAI,2023;Huang et al.,LayoutLMv3,ACM MM,2022;Kim et al.,Donut,ECCV,2022;Tang et al.,UDOP,CVPR,2023。
Layout is clinical meaning
LayoutLMv3:文字 + 图像 + 坐标
Donut / Nougat:页面图像直接生成结构化文档
Huang et al.,LayoutLMv3,ACM MM,2022;Kim et al.,Donut,ECCV,2022;Blecher et al.,Nougat,ICLR,2024。
Key information extraction
Huang et al.,LayoutLMv3,ACM MM,2022;Kim et al.,Donut,ECCV,2022;Tang et al.,UDOP,CVPR,2023。
Document visual question answering
Question
“患者最近一次肌酐值是多少?”
Retrieve + read
跨页检索文字、表格和版面证据
Answer with evidence
第 2 页 · 检验报告
证据框已定位
Mathew et al.,DocVQA,WACV,2021;Tito et al.,MP-DocVQA,Pattern Recognition,2023;Ma et al.,MMLongBench-Doc,NeurIPS,2024。
Medical document question answering
2,000 张真实中文医疗报告图像
Jin et al.,RJUA-MedDQA,arXiv,2024。
Chinese medical report benchmark
1,925 份去标识化中文检验与检查报告
Shang et al.,MedRepBench,ECCV,2026。
Local workflow

点击系统对应的下载按钮,按安装向导完成安装。

打开模型列表,点击 qwen3-vl:2b;首次使用会自动下载。

打开 Settings,拖动 Context length 滑杆设置上下文长度。

点击 + 添加去标识化病历图片,确认模型后点击发送。
Cloud workflow
进入 Agent 对话工作区
选择已去标识化的图片
由 Agent 启动 GPU 与指定模型
选择 RTX PRO 6000 或更高配置显卡