编辑|Clio 回顾一下 2026 年的 AI 圈热词:Memory、Skills、Harness、Agentic RL、Latent Reasoning、World Action Model、Self-Evolving……越来越多研究开始把注意力放在模型如何记住信息、调用能力、完成长期任务,以及怎样以更低的计算成本稳定工作。 作为现实信息进入 AI 系统的重要入口,OCR 同样正在经历这样的变化:从识别文字、理解版面,到处理拍摄形变、复杂表格、公式和科学图表,模型需要解决的问题越来越细,也越来越贴近真实场景。 最近,中国电信星辰通用人工智能实验室推出的文档解析模型 TeleOCR 引发关注。它只有约 1.2B 参数,却在多个公开文档解析评测中取得领先成绩:OmniDocBench v1.6 综合得分 96.87,Wild-OmniDocBench 得分 88.53,PureDocBench 三个赛道综合均值 78.41;在 ICDAR 2026 Sci-ImageMiner 科学图表转表格挑战赛中,TeleOCR 还拿下了第一名。 模型目前已经开源, 开发者可以通过 GitHub、Hugging Face 获取相关资源,也可以通过天翼 AI 开放平台直接体验文档解析能力。 近日,TeleOCR 登上 HuggingFace 趋势榜前五。连 HuggingFace 官方也亲自下场,主动给 TeleOCR 搭了个 ZeroGPU 在线Demo,还补贴了免费算力。 模型调用地址: https://github.com/caipeng328/TeleOCR https://huggingface.co/StarDoc-AI/TeleOCR 模型在线体验: https://www.teleai.com.cn/docparse/documentParsing 这些成绩背后,TeleOCR 面对的已经远远超出「把一页纸上的字认出来」这么简单。真实文档既有规整的电子 PDF,也有存在弯曲、折痕、透视、阴影等问题的拍摄件,页面中还可能同时包含多栏正文、复杂表格、公式和科学图表。 也正是在这些更复杂的场景里,OCR 正在经历新一轮能力升级。 TeleOCR 为什么能以约 1.2B 的体量,在多个文档解析评测中取得领先?它又是怎样处理一张弯曲、折叠甚至被斜着拍下来的纸? 答案,要从 OCR 今天面对的「新考题」说起。 一页文档,几代OCR在解决不同的问题 想象这样一张普通的文档:一页打印出来的双栏论文,被手机随手斜着拍了一张。页面上有公式、有跨栏表格,右下角还配了一幅折线图。更糟的是,靠近装订线的地方纸张微微卷起,侧面打来的灯光还留下了一块阴影。 人扫一眼就知道怎么看:标题在上面,正文从左栏读到右栏,表格行对应的数字,公式有结构,折线图的走向也一目了然。 但交给机器,过去二十多年里,为了看懂这张纸,OCR 经历了好几轮「考题升级」。 第一题:这里写了什么字? 最早的一代 OCR,解题思路很简洁:先找文字区域,再把字符一个个认出来。对于扫描件和规则版面,这套方法已经相当成熟,今天的身份证识别、票据录入、书籍数字化,都建立在这一能力之上。 第二题:这些字是怎么组织的? 就算每个字都认对,机器还得知道左栏读完该跳到右栏、表格里的数字属于哪行哪列、数学符号还原成什么 LaTeX、图下方的文字是正文还是图注。页面里出现了大量二维关系,文档逐渐从「很多字」变成了有空间结构的信息载体。 于是,文档解析逐渐进化成了一条完整流水线:先通过版面分析(Layout Analysis)把标题、正文、图片、表格、公式区域找出来;文字交给 OCR,表格给专门模型,公式进公式模块;最后按阅读顺序拼回一份文档。这套工程思路至今支撑着大量成熟产品,让机器真正理解「什么东西在什么位置」。 第三题:纸张变形了怎么办? 电子版 PDF 中,文字块和表格往往规整地排列在矩形区域里。但到了真实拍摄环境,情况完全不同:纸张卷曲会把文本行拉成弧线,折痕会造成局部扭曲,斜拍带来透视畸变,光照还可能留下阴影和反光。 这时,模型需要先搞清楚这块内容原本应该在哪里,它和周围内容是什么关系。 也是在这一阶段,视觉语言模型(VLM)开始大举进入文档解析,把文字、图像、版面和结构放进同一套表征里学习。 如果我们把市面上最热的 DeepSeek-OCR、MinerU、PaddleOCR-VL 和 TeleOCR 横向对比,会发现它们在「轻量化」上保持着某种默契,但解题思路又各不相同: • DeepSeek-OCR (3B)锁定「视觉 Token」,重点研究如何压缩海量视觉信息,并优化 Token 处理顺序,让模型更经济、灵活地保留文字和结构;后续的 DeepSeek-OCR 2 更是玩起了 Token 的处理