OCR × Document Intelligence × Clinical Records

实操工作坊:
上手病例图片 OCR 智能结构化

从“识字”到“读懂病历”

OCR 技术简史、文档智能前沿与本地实操
02 / 14

Clinical document layers

一页病历包含三类机器任务

多种去标识化医疗文档及证据框
看见字符文字、数字、单位
还原结构标题、表格、阅读顺序
理解语义字段、关系、问题答案
03 / 14

From rules to learning

OCR 从规则设备走向端到端学习

1913 年 Optophone 光学阅读装置
1913

Optophone

用光敏元件扫描印刷文字,并转换为声音。

Kurzweil 阅读机
1970s

多字体阅读机

Kurzweil 系统将扫描、OCR 与语音合成结合。

1986 年 SpectraSCAN 彩色平板扫描仪
1980s–2000s

扫描仪 + 软件

文档采集普及,OCR 转向统计模型与流水线。

现代 Transkribus OCR 平台界面
2010s–NOW

深度学习与 VLM

识别文字,同时解析版面、结构与语义。

图片:Optophone;Kurzweil Reader;SpectraSCAN;Transkribus Dashboard。来源:Wikimedia Commons。

04 / 14

Deep learning demo

神经网络如何识别一个手写数字?

像素输入28 × 28
展平输入784维输入
深度神经网络10个输出节点
分类结果0–9 概率
读取 28×28 像素
05 / 14

Document intelligence tasks

文档智能形成四类前沿任务

文字识别

字符与文本行

TrOCR

文档解析

版面、表格与顺序

LayoutLMv3 / Donut

信息抽取

字段、值与证据

FormNet / UDOP

文档问答

提问、推理与拒答

DocVQA

Li et al.,TrOCR,AAAI,2023;Huang et al.,LayoutLMv3,ACM MM,2022;Kim et al.,Donut,ECCV,2022;Tang et al.,UDOP,CVPR,2023。

06 / 14

Layout is clinical meaning

文档解析必须保留位置与关系

检验项目结果单位
空腹血糖5.6mmol/L
血肌酐126μmol/L
尿素氮7.1mmol/L
血红蛋白132g/L
bbox (42, 214, 860, 292)
布局 layout

血肌酐126μmol/L

LayoutLMv3:文字 + 图像 + 坐标

Donut / Nougat:页面图像直接生成结构化文档

Huang et al.,LayoutLMv3,ACM MM,2022;Kim et al.,Donut,ECCV,2022;Blecher et al.,Nougat,ICLR,2024。

07 / 14

Key information extraction

信息抽取把报告转成可核验字段

病历图像文字 + 版面 + 表格
Schema字段定义与约束
JSON值 + 原文 + 坐标
就诊日期2026-08-06
过敏史未记录
检验项目血肌酐
结果 / 单位126 μmol/L
证据页Page 01
证据坐标(42,214…)

Huang et al.,LayoutLMv3,ACM MM,2022;Kim et al.,Donut,ECCV,2022;Tang et al.,UDOP,CVPR,2023。

08 / 14

Document visual question answering

文档问答正在走向跨页与证据定位

Question

“患者最近一次肌酐值是多少?”

Retrieve + read

P.02

跨页检索文字、表格和版面证据

Answer with evidence

126 μmol/L

第 2 页 · 检验报告
证据框已定位

可回看

Mathew et al.,DocVQA,WACV,2021;Tito et al.,MP-DocVQA,Pattern Recognition,2023;Ma et al.,MMLongBench-Doc,NeurIPS,2024。

09 / 14

Medical document question answering

RJUA-MedDQA:医疗文档问答与临床推理

RJUA-MedDQA 论文表 3:基线模型在文档问答任务上的实验结果

2,000 张真实中文医疗报告图像

实体问答表格问答数值推理临床推理

Jin et al.,RJUA-MedDQA,arXiv,2024。

10 / 14

Chinese medical report benchmark

MedRepBench:中文医疗报告结构化理解

MedRepBench 论文表 1:不同视觉语言模型在结构化字段上的召回率

1,925 份去标识化中文检验与检查报告

结构化字段抽取患者友好解释

Shang et al.,MedRepBench,ECCV,2026。

11 / 14

Local workflow

本地运行:Ollama App + Qwen3-VL 2B

1

下载安装

Ollama 官网 Download for macOS 按钮

点击系统对应的下载按钮,按安装向导完成安装。

2

选择模型

Ollama App 中选择 qwen3-vl:2b 模型

打开模型列表,点击 qwen3-vl:2b;首次使用会自动下载。

3

设置上下文

Ollama App 设置中的 Context length 滑杆

打开 Settings,拖动 Context length 滑杆设置上下文长度。

4

添加并发送

Ollama App 的添加图片、模型选择和发送按钮

点击 + 添加去标识化病历图片,确认模型后点击发送。

来源:Ollama AppQwen3-VL 2B

12 / 14

Cloud workflow

切问学术运行:满血版 Qwen3-VL 32B

1打开切问学术 Agent

进入 Agent 对话工作区

2上传病例图片

选择已去标识化的图片

3输入任务并运行

由 Agent 启动 GPU 与指定模型

4选择 GPU 配置

选择 RTX PRO 6000 或更高配置显卡

输入指令启动一台 GPU,使用 Qwen3-VL 32B 模型。提取图片中的病例信息,输出为结构化文档。
切问学术 Agent 上传病例图片并请求 Qwen3-VL 32B 进行结构化提取的真实界面
13 / 14

Clinical safety

VLM 显著提高了 OCR 质量,但仍需谨慎

INPUT

图片质量

模糊、倾斜、遮挡、反光与压缩噪声,决定识别能力的上限。

MODEL

错误会被传递

小数点、单位、阴阳性和表格关系,可能在低质量输入中失真。

REVIEW

谨慎复核

保留原图与证据坐标,高风险字段必须由专业人员确认。

清晰采集质量检测OCR / VLM证据复核
14 / 14

Thank you

感谢聆听

问题与讨论