OCR MLLM Evaluation
为什么需要评测体系?——背景与矛盾
- 能干的事: 看清楚发票、身份证上的字(准确率>90%),速度飞快(眨眼间完成)。
- 干不了的事: 碰到复杂表格(合并单元格)、跨页合同(前后条款关联)、模糊发票(猜意思)就懵圈了。
传统OCR的瓶颈
-
优势:
- 文字识别准确率 >90%
- 响应快(毫秒级)
- 广泛应用于票据、合同等场景
-
短板:
- 难以处理复杂结构,如合并单元格表格、跨页合同逻辑、模糊发票语义推断
多模态大模型(MLLMs)的崛起
-
能力:
- 视觉问答、图文推理、信息提取
- 展现强大泛化能力
-
现实挑战:
- 在 OCRBench v2 测试中,22个主流模型有20个得分低于50分(满分100)
-
暴露问题:
- 找不准字的位置(文本定位差)。
- 看不懂手写的字(手写识别弱)。
- 理解不了文字背后的逻辑(推理不行)。
- 在专业领域(金融、医疗)容易出错。
核心矛盾
- MLLMs 宣称“全能”,但在关键行业(金融/医疗/政务)仍不可靠。
- 评测体系成为筛选可靠模型的“照妖镜”。
评测体系全景图——19个关键基准解析
按任务类型分类速览
评测方向 | 代表基准 | 核心任务 | 发现的问题 |
---|---|---|---|
文字识别(OCR) | OCRBench v2、CC-OCR | 多语言文本、复杂排版、手写体识别 | 对生僻字、模糊文本、多方向文字识别率低 |
图表理解 | ChartX、ChartY、MMC | 数据提取、趋势分析、图表转表格 | 常误读坐标轴、混淆数据关系 |
表格解析 | TableVQA-Bench、ComTQA | 表格结构识别、跨单元格推理、数学计算 | 图像表格识别精度远低于纯文本表格 |
文档理解 | Fox、ConTextual | 跨页合同关联、区域聚焦翻译、上下文推理 | 难以定位细粒度信息 |
视频推理 | Video-MME | 长视频事件链理解、跨模态分析 | >1小时视频理解准确率骤降 |
专业领域 | DesignQA | 工程图纸合规判断、规则文档关联 | 专业术语和图纸符号理解错误率高 |
基础感知 | BLINK | 相对深度判断、图像篡改检测 | 人类秒懂的任务,模型正确率仅50%左右 |
典型案例
- GPT-4V 在医疗图表分析中误读数据,导致诊断建议错误
- Gemini 在金融合同跨页条款关联中漏判关键信息
评测体系揭示的行业真相
MLLMs 尚未颠覆传统OCR
- 简单场景:传统OCR仍占优(速度快、成本低)
- 复杂场景:MLLMs有潜力但需针对性优化(如金融表格用Fox基准调优)
模型能力严重不均衡
- 图文描述能力强 ≠ 专业推理能力强(e.g. 能写诗但算错财务报表)
- 英文表现好 ≠ 中文表现好(CC-OCR 显示中文OCR准确率低15%+)
幻觉问题无处不在
- 在模糊图像中“脑补”错误文本(ConTextual 基准中错误率 ↑30%)
- 专业领域“一本正经胡说八道”(DesignQA 中合规判断错误率超40%)
- 大模型容易“幻觉”瞎编: 看不清或看不懂时,它们倾向于自信地胡说八道(比如编造发票号码、误读图表数据),这在要求零错误的金融、医疗场景非常危险!评测就是用来暴露这些毛病的。
建议
选模型先看评测
- 金融场景:关注 Fox(文档)、ComTQA(表格)
- 医疗场景:优先 ChartX(医学图表)、MMC(报告理解)
- 多语言需求:验证 CC-OCR、Omni AI OCR 成绩
选模型要看“考分”: 如果你的需求是:
- 理解复杂合同/跨页文档 → 重点看 Fox 成绩。
- 解析财务报表图片 → 重点看 ComTQA、TableVQA-Bench 成绩。
- 看懂医学影像报告图表 → 重点看 ChartX、MMC 成绩。
- 需要多语言识别 → 重点看 CC-OCR、Omni AI OCR 成绩。
警惕“通用模型”宣传
- 即使 GPT-4V/Gemini 也在专业场景翻车,垂直领域仍需微调
- 开源模型(如 Table-LLaVA)在表格任务已接近 GPT-4V,成本更低
- 没有哪个模型真能在所有方面都拿高分。它们在特定任务上可能很强,但在另一些任务(尤其是需要精准、逻辑、专业知识的)上很弱。
- 别急着扔掉“认字高手”: 对于只要求看清标准票据、身份证上字的应用,又快又准又便宜的传统OCR还是首选!大模型在这上面没优势还更贵更慢。
未来方向
- 评测体系本身在进化:从单任务 → 多任务耦合(如 MMT-Bench)考题越来越难,越来越贴近真实复杂场景。
- 模型优化新思路:
- 增加“感知验证层”(如 ChartVLM 先解析结构再推理)
- 注入领域知识(DesignQA 证明专业数据提升合规判断准确率20%+)
- 针对特定短板(比如表格)训练专用模型效果更好(如 Table-LLaVA)
- 融合是趋势: 最佳方案可能是让“认字高手”(传统OCR)先提取准确文字,再让“学霸”(大模型)去理解推理,各司其职。
“OCR 与多模态大模型不是替代关系,而是协作进化——评测体系如同导航仪,在技术爆发期帮企业绕过陷阱,驶向真正可靠的落地场景。”
相关文章:
OCR MLLM Evaluation
为什么需要评测体系?——背景与矛盾 能干的事: 看清楚发票、身份证上的字(准确率>90%),速度飞快(眨眼间完成)。干不了的事: 碰到复杂表格(合并单元…...
React从基础入门到高级实战:React 实战项目 - 项目五:微前端与模块化架构
React 实战项目:微前端与模块化架构 欢迎来到 React 开发教程专栏 的第 30 篇!在前 29 篇文章中,我们从 React 的基础概念逐步深入到高级技巧,涵盖了组件设计、状态管理、路由配置、性能优化和企业级应用等核心内容。这一次&…...

uni-app学习笔记三十五--扩展组件的安装和使用
由于内置组件不能满足日常开发需要,uniapp官方也提供了众多的扩展组件供我们使用。由于不是内置组件,需要安装才能使用。 一、安装扩展插件 安装方法: 1.访问uniapp官方文档组件部分:组件使用的入门教程 | uni-app官网 点击左侧…...

6.9-QT模拟计算器
源码: 头文件: widget.h #ifndef WIDGET_H #define WIDGET_H#include <QWidget> #include <QMouseEvent>QT_BEGIN_NAMESPACE namespace Ui { class Widget; } QT_END_NAMESPACEclass Widget : public QWidget {Q_OBJECTpublic:Widget(QWidget *parent nullptr);…...
[USACO23FEB] Bakery S
题目描述 Bessie 开了一家面包店! 在她的面包店里,Bessie 有一个烤箱,可以在 t C t_C tC 的时间内生产一块饼干或在 t M t_M tM 单位时间内生产一块松糕。 ( 1 ≤ t C , t M ≤ 10 9 ) (1 \le t_C,t_M \le 10^9) (1≤tC,tM≤109)。由于空间…...
【HarmonyOS 5】鸿蒙中Stage模型与FA模型详解
一、前言 在HarmonyOS 5的应用开发模型中,featureAbility是旧版FA模型(Feature Ability)的用法,Stage模型已采用全新的应用架构,推荐使用组件化的上下文获取方式,而非依赖featureAbility。 FA大概是API7之…...
土建施工员考试:建筑施工技术重点知识有哪些?
《管理实务》是土建施工员考试中侧重实操应用与管理能力的科目,核心考查施工组织、质量安全、进度成本等现场管理要点。以下是结合考试大纲与高频考点整理的重点内容,附学习方向和应试技巧: 一、施工组织与进度管理 核心目标: 规…...

java高级——高阶函数、如何定义一个函数式接口类似stream流的filter
java高级——高阶函数、stream流 前情提要文章介绍一、函数伊始1.1 合格的函数1.2 有形的函数2. 函数对象2.1 函数对象——行为参数化2.2 函数对象——延迟执行 二、 函数编程语法1. 函数对象表现形式1.1 Lambda表达式1.2 方法引用(Math::max) 2 函数接口…...
Java 与 MySQL 性能优化:MySQL 慢 SQL 诊断与分析方法详解
文章目录 一、开启慢查询日志,定位耗时SQL1.1 查看慢查询日志是否开启1.2 临时开启慢查询日志1.3 永久开启慢查询日志1.4 分析慢查询日志 二、使用EXPLAIN分析SQL执行计划2.1 EXPLAIN的基本使用2.2 EXPLAIN分析案例2.3 根据EXPLAIN结果优化SQL 三、使用SHOW PROFILE…...
Linux安全加固:从攻防视角构建系统免疫
Linux安全加固:从攻防视角构建系统免疫 构建坚不可摧的数字堡垒 引言:攻防对抗的新纪元 在日益复杂的网络威胁环境中,Linux系统安全已从被动防御转向主动免疫。2023年全球网络安全报告显示,高级持续性威胁(APT)攻击同比增长65%,平均入侵停留时间缩短至48小时。本章将从…...

数据结构第5章:树和二叉树完全指南(自整理详细图文笔记)
名人说:莫道桑榆晚,为霞尚满天。——刘禹锡(刘梦得,诗豪) 原创笔记:Code_流苏(CSDN)(一个喜欢古诗词和编程的Coder😊) 上一篇:《数据结构第4章 数组和广义表》…...

Windows电脑能装鸿蒙吗_Windows电脑体验鸿蒙电脑操作系统教程
鸿蒙电脑版操作系统来了,很多小伙伴想体验鸿蒙电脑版操作系统,可惜,鸿蒙系统并不支持你正在使用的传统的电脑来安装。不过可以通过可以使用华为官方提供的虚拟机,来体验大家心心念念的鸿蒙系统啦!注意:虚拟…...
CppCon 2015 学习:Time Programming Fundamentals
Civil Time 公历时间 特点: 共 6 个字段: Year(年)Month(月)Day(日)Hour(小时)Minute(分钟)Second(秒) 表示…...

基于江科大stm32屏幕驱动,实现OLED多级菜单(动画效果),结构体链表实现(独创源码)
引言 在嵌入式系统中,用户界面的设计往往直接影响到用户体验。本文将以STM32微控制器和OLED显示屏为例,介绍如何实现一个多级菜单系统。该系统支持用户通过按键导航菜单,执行相应操作,并提供平滑的滚动动画效果。 本文设计了一个…...

yaml读取写入常见错误 (‘cannot represent an object‘, 117)
错误一:yaml.representer.RepresenterError: (‘cannot represent an object’, 117) 出现这个问题一直没找到原因,后面把yaml.safe_dump直接替换成yaml.dump,确实能保存,但出现乱码: 放弃yaml.dump,又切…...

WebRTC调研
WebRTC是什么,为什么,如何使用 WebRTC有什么优势 WebRTC Architecture Amazon KVS WebRTC 其它厂商WebRTC 海康门禁WebRTC 海康门禁其他界面整理 威视通WebRTC 局域网 Google浏览器 Microsoft Edge 公网 RTSP RTMP NVR ONVIF SIP SRT WebRTC协…...

针对药品仓库的效期管理问题,如何利用WMS系统“破局”
案例: 某医药分销企业,主要经营各类药品的批发与零售。由于药品的特殊性,效期管理至关重要,但该企业一直面临效期问题的困扰。在未使用WMS系统之前,其药品入库、存储、出库等环节的效期管理主要依赖人工记录与检查。库…...

从零开始了解数据采集(二十八)——制造业数字孪生
近年来,我国的工业领域正经历一场前所未有的数字化变革,从“双碳目标”到工业互联网平台的推广,国家政策和市场需求共同推动了制造业的升级。在这场变革中,数字孪生技术成为备受关注的关键工具,它不仅让企业“看见”设…...

AD学习(3)
1 PCB封装元素组成及简单的PCB封装创建 封装的组成部分: (1)PCB焊盘:表层的铜 ,top层的铜 (2)管脚序号:用来关联原理图中的管脚的序号,原理图的序号需要和PCB封装一一…...

JDK 17 序列化是怎么回事
如何序列化?其实很简单,就是根据每个类型,用工厂类调用。逐个完成。 没什么漂亮的代码,只有有效、稳定的代码。 代码中调用toJson toJson 代码 mapper.writeValueAsString ObjectMapper DefaultSerializerProvider 一堆实…...
Vue 3 + WebSocket 实战:公司通知实时推送功能详解
📢 Vue 3 WebSocket 实战:公司通知实时推送功能详解 📌 收藏 点赞 关注,项目中要用到推送功能时就不怕找不到了! 实时通知是企业系统中常见的功能,比如:管理员发布通知后,所有用户…...

倒装芯片凸点成型工艺
UBM(Under Bump Metallization)与Bump(焊球)形成工艺流程。我们可以将整张流程图分为三大阶段来理解: 🔧 一、UBM(Under Bump Metallization)工艺流程(黄色区域ÿ…...

2.3 物理层设备
在这个视频中,我们要学习工作在物理层的两种网络设备,分别是中继器和集线器。首先来看中继器。在计算机网络中两个节点之间,需要通过物理传输媒体或者说物理传输介质进行连接。像同轴电缆、双绞线就是典型的传输介质,假设A节点要给…...

Qt的学习(一)
1.什么是Qt Qt特指用来进行桌面应用开发(电脑上写的程序)涉及到的一套技术Qt无法开发网页前端,也不能开发移动应用。 客户端开发的重要任务:编写和用户交互的界面。一般来说和用户交互的界面,有两种典型风格&…...
鸿蒙HarmonyOS 5军旗小游戏实现指南
1. 项目概述 本军旗小游戏基于鸿蒙HarmonyOS 5开发,采用DevEco Studio实现,包含完整的游戏逻辑和UI界面。 2. 项目结构 /src/main/java/com/example/militarychess/├── MainAbilitySlice.java // 主界面├── GameView.java // 游戏核…...
Python常用模块:time、os、shutil与flask初探
一、Flask初探 & PyCharm终端配置 目的: 快速搭建小型Web服务器以提供数据。 工具: 第三方Web框架 Flask (需 pip install flask 安装)。 安装 Flask: 建议: 使用 PyCharm 内置的 Terminal (模拟命令行) 进行安装,避免频繁切换。 PyCharm Terminal 配置建议: 打开 Py…...

Spring AOP代理对象生成原理
代理对象生成的关键类是【AnnotationAwareAspectJAutoProxyCreator】,这个类继承了【BeanPostProcessor】是一个后置处理器 在bean对象生命周期中初始化时执行【org.springframework.beans.factory.config.BeanPostProcessor#postProcessAfterInitialization】方法时…...
【把数组变成一棵树】有序数组秒变平衡BST,原来可以这么优雅!
【把数组变成一棵树】有序数组秒变平衡BST,原来可以这么优雅! 🌱 前言:一棵树的浪漫,从数组开始说起 程序员的世界里,数组是最常见的基本结构之一,几乎每种语言、每种算法都少不了它。可你有没有想过,一组看似“线性排列”的有序数组,竟然可以**“长”成一棵平衡的二…...
在RK3588上搭建ROS1环境:创建节点与数据可视化实战指南
在RK3588上搭建ROS1环境:创建节点与数据可视化实战指南 背景介绍完整操作步骤1. 创建Docker容器环境2. 验证GUI显示功能3. 安装ROS Noetic4. 配置环境变量5. 创建ROS节点(小球运动模拟)6. 配置RVIZ默认视图7. 创建启动脚本8. 运行可视化系统效果展示与交互技术解析ROS节点通…...

密码学基础——SM4算法
博客主页:christine-rr-CSDN博客 专栏主页:密码学 📌 【今日更新】📌 对称密码算法——SM4 目录 一、国密SM系列算法概述 二、SM4算法 2.1算法背景 2.2算法特点 2.3 基本部件 2.3.1 S盒 2.3.2 非线性变换 编辑…...