大学难度多模态题库

面向 GPT-5 / Claude Opus / Gemini / Qwen / DeepSeek 等 SOTA 多模态大模型预训练与评测

30%
健康与医学
25%
技术与工程
25%
自然科学
20%
数学
≤40%
模型通过率

数据集概览

STEM 多模态题库是由长沙朗慧信息科技有限公司面向 SOTA 多模态大模型打造的大学难度图像推理评测数据集。100% 强图像依赖,通过率 ≤40% 严格入库标准,覆盖健康与医学 / 技术与工程 / 自然科学 / 数学 4 大学科 32+ 子领域。

题目类型选择题 / 填空题 / 简答题 / 证明题 / 计算题 / 图像分析题
图像依赖100% 强图像依赖(无图像则题目不可作答)
题目难度大学本科至研究生水平,对标 QS Top 100 院校课程标准
题目语言中文(题干 + 解析),专业术语保留英文原词
测评模型GPT-5 / Claude Opus / Gemini / Qwen / DeepSeek
测评方法五模型 × 五次推理取平均通过率,阈值 ≤40%
入库阈值SOTA 模型平均通过率 ≤ 40% 方可入库
滚动复评每季度用最新 SOTA 模型重新评测,通过率 >50% 自动降级淘汰
合规隔离与所有公开评测集零重叠,确保 benchmark 独立性
去重策略MinHash LSH + 语义向量双重去重,相似度阈值 0.92

学科覆盖

健康与医学 30%

临床诊断图像解读、病理切片、医学影像(CT/MRI/X-ray)、解剖图谱、心电/脑电图判读

影像诊断 病理分析 解剖识别 药理机制 心电图判读 分子生物学 流行病学 临床决策

技术与工程 25%

工程图纸识读、电路图分析、机械结构、建筑平面图、材料微观结构、控制系统框图

电路分析 机械设计 结构力学 工程制图 热力学 材料科学 信号处理 控制系统

自然科学 25%

物理实验装置图、化学反应机理、元素光谱、生物显微结构、地质构造图、天文观测数据图

量子力学 电磁学 有机化学 分子遗传 天体物理 地球科学 生态学 光谱分析

数学 20%

函数图像、几何图形、拓扑结构、概率分布图、微分方程相图、数值分析可视化

微积分 线性代数 概率统计 拓扑学 微分方程 数值分析 图论 复变函数

测评流水线

1

专家出题

QS Top 100 院校相关专业硕博团队命题,100% 图像依赖

2

双人审校

A/B 角交叉审校,确保图像清晰度、题干严谨性、答案唯一性

3

五模型调用

GPT-5 / Claude Opus / Gemini / Qwen / DeepSeek 同步评测

4

五次推理

每模型对每道题独立推理 5 次,取平均通过率消除随机波动

5

阈值筛选

五模型平均通过率 ≤40% 方可入库,确保题目区分度

6

滚动复评

每季度用最新 SOTA 模型复评,通过率 >50% 自动降级淘汰

合规与质量红线

公开评测集零重叠

MMLU GSM8K MATH GPQA MMMU ScienceQA ARC HellaSwag

禁止数据类型

  • ·涉及患者隐私的未经脱敏的真实医疗数据
  • ·涉及国防、军工、核能等受管制领域图像
  • ·直接爬取自公开评测集的题目或变体
  • ·包含可识别个人身份信息(PII)的图像

数据交付

JSON Lines 格式

每行一条完整题目 JSON,含题干、图像 Base64、选项、答案、解析、元数据标注字段

API 批量拉取

RESTful API 按学科 / 难度 / 题型分页拉取,支持断点续传,Access Token 鉴权

元数据标注

每道题附完整元数据:学科标签、子领域、Bloom 认知层级、图像类型、难度系数、入库时间戳

面向 AGI 的数据基础设施

STEM 多模态题库不仅是评测基准,更是面向通用人工智能(AGI)时代的基础数据设施。我们相信,真正的多模态推理能力必须建立在「看图思考」之上——图像不是辅助信息,而是解题的必要条件。这一设计理念确保题库能够真实衡量模型的多模态理解能力,而非仅依赖语言先验。

看图推理
100% 强图像依赖,图像即题干
32+
子领域深度覆盖,持续扩展
季度滚动
过时题目自动淘汰,保持难度梯度
全球实验室
服务全球顶级 AI 研究机构与评测平台