OCR × Document Intelligence × Clinical Records

大语言模型在
医学文本识别中的应用

从“识字”到“读懂病历”

OCR 技术简史、文档智能前沿与本地实操
02 / 16

Clinical document layers

一页病历包含三类机器任务

多种去标识化医疗文档及证据框
看见字符文字、数字、单位
还原结构标题、表格、阅读顺序
理解语义字段、关系、问题答案
03 / 16

From rules to learning

OCR 从规则设备走向端到端学习

1913 年 Optophone 光学阅读装置
1913

Optophone

用光敏元件扫描印刷文字,并转换为声音。

Kurzweil 阅读机
1970s

多字体阅读机

Kurzweil 系统将扫描、OCR 与语音合成结合。

1986 年 SpectraSCAN 彩色平板扫描仪
1980s–2000s

扫描仪 + 软件

文档采集普及,OCR 转向统计模型与流水线。

现代 Transkribus OCR 平台界面
2010s–NOW

深度学习与 VLM

识别文字,同时解析版面、结构与语义。

图片:Optophone;Kurzweil Reader;SpectraSCAN;Transkribus Dashboard。来源:Wikimedia Commons。

04 / 16

Deep learning demo

神经网络如何识别一个手写数字?

像素输入28 × 28
展平输入784维输入
深度神经网络10个输出节点
分类结果0–9 概率
读取 28×28 像素
05 / 16

Document intelligence tasks

文档智能形成四类前沿任务

文字识别

字符与文本行

TrOCR

文档解析

版面、表格与顺序

LayoutLMv3 / Donut

信息抽取

字段、值与证据

FormNet / UDOP

文档问答

提问、推理与拒答

DocVQA

Li et al.,TrOCR,AAAI,2023;Huang et al.,LayoutLMv3,ACM MM,2022;Kim et al.,Donut,ECCV,2022;Tang et al.,UDOP,CVPR,2023。

06 / 16

Layout is clinical meaning

文档解析必须保留位置与关系

检验项目结果单位
空腹血糖5.6mmol/L
血肌酐126μmol/L
尿素氮7.1mmol/L
血红蛋白132g/L
bbox (42, 214, 860, 292)
布局 layout

血肌酐126μmol/L

LayoutLMv3:文字 + 图像 + 坐标

Donut / Nougat:页面图像直接生成结构化文档

Huang et al.,LayoutLMv3,ACM MM,2022;Kim et al.,Donut,ECCV,2022;Blecher et al.,Nougat,ICLR,2024。

07 / 16

Key information extraction

信息抽取把报告转成可核验字段

病历图像文字 + 版面 + 表格
Schema字段定义与约束
JSON值 + 原文 + 坐标
就诊日期2026-08-06
过敏史未记录
检验项目血肌酐
结果 / 单位126 μmol/L
证据页Page 01
证据坐标(42,214…)

Huang et al.,LayoutLMv3,ACM MM,2022;Kim et al.,Donut,ECCV,2022;Tang et al.,UDOP,CVPR,2023。

08 / 16

Document visual question answering

文档问答正在走向跨页与证据定位

Question

“患者最近一次肌酐值是多少?”

Retrieve + read

P.02

跨页检索文字、表格和版面证据

Answer with evidence

126 μmol/L

第 2 页 · 检验报告
证据框已定位

可回看

Mathew et al.,DocVQA,WACV,2021;Tito et al.,MP-DocVQA,Pattern Recognition,2023;Ma et al.,MMLongBench-Doc,NeurIPS,2024。

09 / 16

Medical document question answering

RJUA-MedDQA:医疗文档问答与临床推理

RJUA-MedDQA 论文表 3:基线模型在文档问答任务上的实验结果

2,000 张真实中文医疗报告图像

实体问答表格问答数值推理临床推理

Jin et al.,RJUA-MedDQA,arXiv,2024。

10 / 16

Chinese medical report benchmark

MedRepBench:中文医疗报告结构化理解

MedRepBench 论文表 1:不同视觉语言模型在结构化字段上的召回率

1,925 份去标识化中文检验与检查报告

结构化字段抽取患者友好解释

Shang et al.,MedRepBench,ECCV,2026。

11 / 16

Traditional OCR workflow

PaddleOCR:安装并识别一张病历图片

1

安装 CPU 推理引擎

python -m pip install paddlepaddle==3.2.0
-i https://www.paddlepaddle.org.cn/packages/stable/cpu/
2

安装 PaddleOCR

python -m pip install paddleocr
3

运行通用 OCR

paddleocr ocr -i ./medical-record.jpg
--save_path ./output --device cpu
无需 DockerCPU 可运行首次自动下载模型
识别文字血肌酐 126 μmol/L输出内容文字 · 坐标 · 置信度

来源:PaddleOCR 3.x 安装文档通用 OCR 产线

12 / 16

Desktop installer

安装 PaddleOCR 桌面版

PaddleOCR Desktop
PaddleOCR Desktop完整离线运行环境
拖动安装
ApplicationsmacOS 应用程序
1

下载构建产物

进入仓库 Actions,打开最新成功的 build-installers,下载对应系统的 Artifact。

2

完成安装

macOS · DMGWindows · Setup.exe

Mac 将应用拖到 Applications;Windows 双击安装器并按向导完成。

3

未签名 App 首次打开

先双击 App 并关闭警告;打开“系统设置 → 隐私与安全性”,在“安全性”中点“仍要打开”,再确认“打开”。

GitHubgithub.com/yuezh000/paddleocr-desktop

项目与安装包构建:yuezh000 / paddleocr-desktop;未签名 App 打开方式:Apple 支持

13 / 16

Local workflow

本地运行:Ollama App + Qwen3-VL 2B

1

下载安装

Ollama 官网 Download for macOS 按钮

点击系统对应的下载按钮,按安装向导完成安装。

2

选择模型

Ollama App 中选择 qwen3-vl:2b 模型

打开模型列表,点击 qwen3-vl:2b;首次使用会自动下载。

3

设置上下文

Ollama App 设置中的 Context length 滑杆

打开 Settings,拖动 Context length 滑杆设置上下文长度。

4

添加并发送

Ollama App 的添加图片、模型选择和发送按钮

点击 + 添加去标识化病历图片,确认模型后点击发送。

来源:Ollama AppQwen3-VL 2B

14 / 16

Cloud workflow

切问学术运行:满血版 Qwen3-VL 32B

1打开切问学术 Agent

进入 Agent 对话工作区

2上传病例图片

选择已去标识化的图片

3输入任务并运行

由 Agent 启动 GPU 与指定模型

4选择 GPU 配置

选择 RTX PRO 6000 或更高配置显卡

输入指令启动一台 GPU,使用 Qwen3-VL 32B 模型。提取图片中的病例信息,输出为结构化文档。
切问学术 Agent 上传病例图片并请求 Qwen3-VL 32B 进行结构化提取的真实界面
15 / 16

Clinical safety

VLM 显著提高了 OCR 质量,但仍需谨慎

INPUT

图片质量

模糊、倾斜、遮挡、反光与压缩噪声,决定识别能力的上限。

MODEL

错误会被传递

小数点、单位、阴阳性和表格关系,可能在低质量输入中失真。

REVIEW

谨慎复核

保留原图与证据坐标,高风险字段必须由专业人员确认。

清晰采集质量检测OCR / VLM证据复核
16 / 16

Thank you

感谢聆听

问题与讨论