首页/ 资讯/ TeleOCR 中国电信星辰实验室开源的文档解析模型

TeleOCR 中国电信星辰实验室开源的文档解析模型

拆宝 2026-09-24 7 阅读

TeleOCR是什么

TeleOCR 是中国电信星辰实验室开源的文档解析模型,采用约 1.2B 参数轻量级视觉语言架构,在单一框架内统一处理数字文档与相机拍摄文档,可将文字、版面、表格、公式和科学图表解析为 Markdown、JSON 等结构化结果。TeleOCR 登顶 OmniDocBench v1.6 榜单,获 PureDocBench 榜首和 ICDAR-2026 科学图解析冠军,支持本地 GPU 部署,适用合同、论文、档案等结构化提取场景。

TeleOCR

TeleOCR的主要功能

  • 文字识别 :高精度提取文档中的文本内容,数字文档识别准确率达 97.22。

  • 版面分析 :定位文字、表格、公式等元素在页面中的位置与层级关系。

  • 表格解析 :精确还原跨行跨列、单元格合并的复杂表格结构,TEDS 达 97.05。

  • 公式解析 :结构化解析公式语义与语法,实现符号级准确恢复,CDM 达 96.36。

  • 科学图表解析 :识别图表元素并提取数据,可转换论文柱状图为结构化表格(ICDAR-2026 冠军能力)。

  • 拍摄文档处理 :直接处理透视畸变、页面弯曲、阴影模糊等真实拍摄退化文档,无需独立去畸变模型。

  • 结构化输出 :结果可生成为 Markdown、JSON、表格、公式等格式,便于接入知识检索与业务系统。

TeleOCR的技术原理

  • 统一视觉语言架构 :TeleOCR 采用约 1.2B 参数的轻量级视觉语言模型,将数字文档与相机拍摄文档放入同一框架,端到端完成版面与内容解析,替代传统版面检测→图像校正→识别的串联流水线,避免误差累积。

  • 几何感知建模 :针对不规则页面形变,引入几何感知建模与曲率引导的 Douglas-Peucker 采样,显式学习文档边界与空间结构,使模型能直接处理弯曲、折叠和透视畸变页面。

  • 数据工程闭环 :数据体系覆盖生成、清洗、评估与优化:通过多节点共识投票筛选高置信伪标签;几何感知数据合成围绕旋转、畸变、弯曲构造样本;图像到图像自验证将解析结果重新渲染比对以自动纠错;渐进式清洗让高一致性样本进训练集、高分歧样本作难例优化,形成投票筛选—模型自训练闭环。

  • 渐进式四阶段训练 :训练按视觉语言对齐→几何感知文档解析→内容-结构解耦学习→强化学习推进,目标从基础感知过渡到精细理解。表格任务用 Structure-only强化行列结构理解,再用 Structure+Content 完成联合对齐;公式任务同样通过解耦学习语义与语法组织。

如何使用TeleOCR

  • 环境准备 :安装 Python 3.10+ 并确保有支持 CUDA 的 GPU 环境。

  • 拉取代码 :执行 git clone https://github.com/caipeng328/TeleOCR.git 并进入目录。

  • 创建环境 :用 conda 创建名为 teleocr 的虚拟环境并激活。

  • 安装依赖 :运行 pip install -e . 安装项目依赖。

  • 下载模型 :通过 pip install modelscope 后用 modelscope 命令下载权重到本地 ./models/TeleOCR 目录。

  • 准备目录 :设置输入图片目录 IMAGE_SUB_PATH 和结果输出目录 RESULT_SAVE_PATH 。

  • 运行推理 :执行 python infer.py ,传入图片路径、结果路径、 --use_async 、 --override 、模型路径及后端参数。

  • 选择后端 :常规使用 vllm-engine ,高并发批量处理可切换 vllm-async-engine 。

  • 设置版面模式 :数字文档用 LAYOUT_MODE="Detection" ,弯曲/退化拍摄页面切换为 "Segmentation" 。

  • 调优参数 :按需调整 MAX_MODEL_LEN (上下文长度)、 GPU_MEMORY_UTILIZATION (显存占用)、 PDF_TOOLS (PDF 后端)和 MAX_PIXELS (单页最大像素数)。

  • 获取结果 :从输出目录读取解析后的 Markdown/JSON/表格等结构化结果,接入下游系统。

TeleOCR的核心优势

  • 榜单成绩领先 :OmniDocBench v1.6 总分 96.87 登顶,超越 MinerU2.5-Pro、PaddleOCR-VL-1.6、OvisOCR2 等专业模型。

  • 参数轻量 :仅约 1.2B 参数,降低本地部署门槛,适合私有化场景。

  • 统一框架 :数字文档与相机拍摄文档在同一模型内解析,无需为不同来源文档部署多套系统。

  • 免前置去畸变 :几何感知建模可直接处理弯曲、折叠、透视畸变页面,减少独立校正模块的误差累积。

  • 结构化输出 :直接输出 Markdown、JSON、表格、公式等可计算结果,便于接入知识检索与业务自动化。

  • 复杂表格能力强 :跨行跨列、单元格合并的复杂表格行列表系不乱、不串位,TEDS 达 97.05。

  • 科学图解析夺冠 :具备图表元素识别与数据提取能力,获 ICDAR-2026 科学图解析挑战赛冠军。

  • 数据闭环高效 :多节点共识投票与自验证机制构建千万级训练数据池,大部分生成数据无需人工标注。

TeleOCR的项目地址

  • GitHub仓库 :https://github.com/caipeng328/TeleOCR

  • HuggingFace模型库 :https://www.modelscope.cn/models/XingChen-AGI/TeleOCR

  • arXiv技术论文 :https://arxiv.org/pdf/2608.12898

TeleOCR的同类竞品对比

对比维度 | TeleOCR | PaddleOCR-VL-1.6

对比维度

TeleOCR

PaddleOCR-VL-1.6

模型规模

约 1.2B 参数,轻量级

0.9B 参数

OmniDocBench v1.6 总分

96.87,登顶榜单

未登顶

文本识别

97.22

96.7

表格解析 TEDS

97.05

94.76

拍摄文档表格 TEDS(Wild)

89.05

81.31

拍摄文档处理

几何感知建模,免独立去畸变模块

文档未说明同类机制

科学图解析

ICDAR-2026 挑战赛冠军(41.81 分)

文档未提及参赛成绩

结构化输出

Markdown / JSON / 表格 / 公式

支持结构化输出

TeleOCR的应用场景

合同与档案数字化 :解析合同、档案中的跨行跨列表格与版面结构,转为可检索的结构化数据。

相关工具
与本文相关的 AI 工具
AI 智能推荐 ×
输入关键词,AI 从 1000+ 工具中精准匹配推荐