日前国家数据局正在组织开展高质量数据集典型案例征集,为高质量数据集的加速建设注入了一剂强心针。重点面向科学研究、工业制造、农业农村、智慧能源、交通运输、金融服务、医疗卫生、教育教学、商务领域、人力资源、文化旅游、应急管理、气象服务、绿色低碳、公共安全、城市治理、低空经济、具身智能、智能驾驶、智慧海洋等20多个行业和领域开展征集。
本报告通过对已公开发布的高质量数据集名单、数据交易所上架的数据集产品、开源数据集等内容梳理,从供给角度和应用领域角度分析高质量数据集的应用情况。
从供给角度来看,高质量数据集大多集中于开源社区、数据交易所、数据服务企业以及数据标注基地。魔搭、飞桨、天池、帕依提提、超神经、智源、和鲸、启智、聚数力等社区平台提供多类型公开数据集,适用于基础的人工智能模型任务。北京、深圳、贵阳等大数据交易所陆续建立高质量数据集专区,汇聚多模态优质训练数据。以海天瑞声、数据堂等为代表的数据服务商在原有业务的基础上进一步拓展丰富高质量数据集产品。四川成都、辽宁沈阳等7个标注基地目前也已形成高质量数据集上百个。
从应用领域来看,高质量数据集应用当前在工业制造、医疗卫生、交通运输领域较为集中。其次,低空经济、具身智能等创新应用也因产业发展驱动陆续涌现。下面以部分场景实践案例对高质量数据集的建设过程进行简要阐述,为业界提供参考。
随着人工智能技术在应急管理、文化旅游、金融服务、自动驾驶等场景的应用深入,高质量数据集的建设需求也逐渐凸显。
案例背景:
中国铁塔视联网业务飞速发展,超22万座“通信塔”升级为“数字塔”,在铁塔上搭载摄像头、无人机等设备与算法为应急管理、农业农村等10多个行业注智赋能。视联网应急管理数据集围绕综合风险监测预警能、指挥调度能力、自然灾害数据汇聚能力,实现数据全生命周期的管理,为应急行业大模型与小模型算法优化训练提供强有力的数据支撑。
实践方案:
中国铁塔采用标准引领,汇聚多源样本数据,构建AI数据处理工具链,以高价值业务场景与需求为导向,构建了视联网应急管理数据集。
样本数据采集与汇聚,汇聚全国中高点位视频监控样本数据。通过标准化的回传通道实现全国分布式视联平台样本数据的自动汇聚,不断提高样本数量;通过定制化采集上传稀缺性的样本,提供样本的丰富度。
需求分析与规划,基于算法训练优化需求检索数据,构建初步数据集。根据森林防火监控、自然灾害防治等应急管理关键业务场景和算法训练需求建立了300多个标签对样本数据进行自动化打标,通过语义检索、以图搜图和标签精细化检索等方式按需筛选所需样本数据,形成初步数据集。
数据多维度处理,提高数据集质量。在多环节对数据进行去重、去模糊等清洗操作,去除无效样本数据,提高有效样本数据的占比,支持对清洗后的数据进行恢复操作。按需通过数据增强,增加样本的丰富度。通过多模态数据对齐,建立“图像+拍摄时间+位置+PTZ+影像内外参数”等多维信息关联关系,形成图文数据对,实现应急管理中基于视频监控与算法告警的精准应急调度指挥。
数据智能标注与审核,形成高质量数据集。依托铁塔样本库的智能标注工具快速完成数据标注,标注准确性超过80%,自主设置抽检比例对标注结果进行人工审核和修正,形成算法训练所需的高质量数据集。
数据质量检测与评估,算法优化训练验证数据集质量,按需调整数据集。通过算法模型效果对数据集进行综合评价和反馈,并对数据集进行适当调整以符合模型预期。对数据集的调整包括重新评估数据需求,调整数据处理策略,增加特定类别样本的采集比例等方式。
数据集运营,实现数据复利效应。洞察数据集规模、分布等构成,依托样本库系统实现数据集的可视、可管、可用、可追溯,维护数据集版本与上下架,实现数据集的全生命周期管理。根据算法训练优化需求灵活复用不同数据集,实现一次治理多方使用。
数据安全管控,贯穿数据集建设全过程。根据国家和公司数据安全管控办法,在技术上主要采用授权访问安全等级、数据沙箱安全审计、网络安全策略、数据加密与脱敏处理等手段;对于内外部使用数据制定规范制度,保证数据合法合规使用。
应用效果:
中国铁塔样本库以汇聚4.86亿中高点视频监控高质量视图样本数据,形成超过25亿个有效标签,为应急行业大模型构建超过500万的标注图文对,构建了一批服务于应急管理的烟火监控、火点识别等小模型算法的数据集。其中,自研应急行业大模型的35个下游任务在实际应用场景中准确率超过96%;应用于中高点位复杂场景的烟火监控算法泛化能力显著增强,有效规避云雾、扬尘、灯光等目标干扰,准确率超过95%,对应急管理事件实现了及时发现、准确告警。应急管理数据集除了应用于中国铁塔算法自主研发,通过安全管控手段还用于算法生态合作伙伴的AI算法研发,服务于与北京大学、清华大学、中国科学院等高校的产学研合作项目,实现了样本数据的有效复用。
案例背景:
如何高效精准地对国际航班旅客量预测是目前民航亟待解决的技术问题,在进行不同航线旅客流量预测时,需要大量历史数据和先验知识构建预测模型,但受数据隐私保护政策约束,不同国家、区域航司之间记录的旅客流量数据无法实时共享,训练样本缺失,导致难以精准预测全市场航线旅客量。基于此,中航信数智建立了针对民航旅客流量预测的高质量数据集管理流程,对应用于旅客流量预测模型数据集进行修复、增补,并运用规则匹配、交叉验证和模型检测等一致性校验方式提升数据集质量,显著提升了模型预测准确性。
实践方案:
随着航空运输需求对旅客量预测的不断重视,需求预测理论与方法层出不穷,包括回归模型、重力模型、时间序列模型、神经网络、灰色模型等。在现有技术中,通过获取待预测日的历史旅客量特征数据和在待预测日的日期特征数据,计算间隔日,并将特征数据和归一化处理后的日期特征数据输入到训练好的旅客量预测模型,得到特定时间特征的旅客量预测值。
中航信数智基于特定航线航班及旅客三年历史样本数据建立民航旅客流量预测模型,用于航线及机场维度的全市场旅客量的预测。并建立高质量数据集管理流程,重点解决不同国家地区航司跨区域旅客量数据采集、共享不足,用于模型训练数据匮乏的问题;并基于数据全生命周期管理理念,在不同阶段都设置了数据质量提升计划。

在数据预处理阶段,针对训练数据不足的问题,利用航班历史承运旅客量、历史旅客量特征和时间特征等参数,对航班的历史承运旅客总量进行补充和推断,解决现有技术中跨系统隐私限制造成的预测准确性较差的问题。针对旅客流量数据中的非随机缺失,采用主动学习标注策略筛选高价值样本,通过标注变量标记人工修正记录,增强模型对数据可信度的识别能力,融合多任务学习的标注系统,自动化算法初筛疑似异常数据,人工标注复核后反馈至神经网络调整时序特征权重,最终实现对机场出入境国际航班旅客量进行预测。
在模型训练和验证阶段,根据质量保障流程重点关注数据集的一致性检查,即主要关注数据格式、数据结构和标签信息的一致性,通过规则匹配、交叉验证和模型检测等方式实现,确保数据不会因格式或内容不匹配影响模型训练和推理,并利用自动化检测与人工验证相结合的方式实施数据集的全面质量把控。
针对数据质量问题的后续管理,建立了分级处理机制,系统自动标记问题样本后,根据问题严重程度分别采取自动校正、人工复核或整批拒收等处理措施,并建立专门的不一致案例库用于质量分析。整个过程需完整记录检查日志、问题样本报告、修正措施等文档资料。
应用效果:
民航旅客流量预测模型的显著效果是将先验知识以数据标注的方式添加进数据补全过程,数据标注的方式完成样本缺失值处理,并通过平衡自动标注与人工标注比例,实现数据质量与模型性能的双重提升。
实践显示,通过该模型测算可以有效降低机场旅客流量预测失误率,对标注补全后的旅客流量数据采用策略回归与时间序列加权组合预测,某测试航线平均绝对误差较单一模型降低21%,在大数据加处理的主动学习标注使百万级数据补全效率提升3倍。
此类高质量数据集管理流程可以应用于机场流量预测,旅游目的地民航旅客客流量、旅客价值分类预测等场景,并通过自动化标注算法有效降低民航数据治理成本。
案例背景:
随着人工智能技术在金融场景中的深入应用,如何在保障合规性与安全性的前提下,提升模型的智能推理能力,已成为行业发展的关键命题。在此背景下,构建高质量、可解释性强的金融领域专用数据集,尤其是金融思维链(Chain-of-Thought, CoT)推理数据集,逐渐成为推动AI金融应用升级的核心支撑。金融CoT锻造工程旨在通过数据引导模型生成具有逻辑性和透明度的输出,在风险控制、监管审查和决策溯源等方面发挥重要作用。
实践方案:
蚂蚁数科打造了CoT锻造车间用以支撑金融行业高质量推理数据集的高效建设,整体沿着数据收集、数据合成、数据入库三大流程进行。

多资产类别覆盖:包括股票数据、债券数据、基金数据、衍生品数据、其他数据等5大类目。
多金融任务覆盖:金融场景涉及多种复杂推理任务,蚂蚁数科基于行业认知将金融场景专有任务拆分为金融认知、金融知识、金融逻辑、安全合规与内容生成五大类,具体细分任务与任务描述如下表所示。
任务大类 | 任务名称 | 任务描述 |
金融认知 | 保险意图理解 | 文本意图理解 |
保险槽位识别 | 保险实体识别 | |
研判观点提取 | 投资意图分类 | |
金融情绪识别 | 金融情绪分类 | |
金融意图理解 | 金融意图分类 | |
金融槽位识别 | 金融实体识别 | |
金融知识 | 会计从业资格考试 | 资格考试试题 |
保险从业资格考试 | 资格考试试题 | |
保险知识解读 | 名词解释 | |
基金从业资格考试 | 资格考试试题 | |
审计师考试 | 资格考试试题 | |
执业医师资格考试 | 资格考试试题 | |
执业药师资格考试 | 资格考试试题 | |
期货从业资格考试 | 资格考试试题 | |
注册税务师 | 资格考试试题 | |
理财知识解读 | QA选择 | |
证券从业资格考试 | 资格考试试题 | |
金融术语解释 | 名词解释 | |
银行从业资格考试 | 资格考试试题 | |
金融逻辑 | 保险属性抽取 | 属性抽取任务 |
保险条款解读 | 保险推理题 | |
金融事件解读 | 金融事件分析 | |
金融产品分析 | 金融推理 | |
金融数值计算 | 金融数值计算 | |
安全合规 | 信息安全合规 | 安全拒答检测 |
金融事实性 | 事实性风险检测 | |
金融合规性 | 金融合规性Q检测 | |
金融问题识别 | 是否属于金融问题检测 | |
内容生成 | 投教话术生成 | 文本生成 |
文本总结归纳 | 文本总结 | |
营销文案生成 | 营销文案分类 | |
资讯标题生成 | 标题生成 |
全自动数据清洗链路:原始金融数据往往来源多样、格式各异,并夹杂噪声、错误与冗余信息。因此,构建一套全面、高效、自动化的数据清洗链路,对于提升合成数据的质量、增强模型性能、确保最终投资决策的可靠性至关重要。该模块包括数据清洗与预处理、低质数据过滤、数据清洗与标准化、数据去重等几大核心模块。
数据合成与标注:通过数据合成有效提升数据全面性进而对金融数据进行高效且专业的扩充已经成为行业共识。
基于因果推断的数据合成技术:反事实因果推断是提升模型稳健性与泛化能力的关键技术,尤其是在应对金融市场中的黑天鹅事件和极端情景时。通过构建反事实数据,训练模型在假设前提改变的情况下,依然能够进行准确的因果推断和风险评估,其效果在实际应用中表现显著。
思维链构建:金融场景下的 CoT 数据链路构建将专注于在CoT过程中构建模型的体系化思考能力,通过自然语言的输出增强模型思考过程的可解释性,增强人类用户对其的信任,同时融入实时动态数据与用户上下文信息,以确保模型输出的时效性与个性化。
自反思检测改写:在CoT合成过程中,由于问题难度与模型自身能力的问题,会导致部分的数据CoT合成失败,具体体现为:CoT合成过程中的答案与真实答案不一致。为保证数据在采样过程中不因为结果错误被丢弃,而导致的数据量不足问题,在思维链构建过程后引入自反思检测改写机制,以确保更高的数据留存率。
人工标注与质检:对金融行业数据集进行人工标注,包括数据合理性、CoT过程合理性、是否涉及个人隐私等;
数据入库从4个层面对数据集进行评估,包括基础质检:异常符号识别、长度检测、敏感词检测、去重等;难度检测:对数据进行难度分类分级;多样性:对数据进行细分领域标签确认;消融验证:通过下游SFT、RL实验并在评测集上与基线版本进行对比验证数据有效性。
应用效果:
高质量金融推理数据集- Ant-DeepFinance-1000K能够有效模型在金融垂域场景能力。通过引入反事实因果推断技术,不仅成功扩充了50%的问答对,还有效提升了模型对难例问题的处理能力,其中43%的难例问题得到了精准检测与改写,大幅优化了模型在边界情况下的表现。在模型监督微调阶段,通过对齐真实业务需求和高质量数据,模型的回答准确率在多个权威评测集(如Fineval)上均实现了3%-10%以上的显著提升,尤其做到了金融合规任务、金融推理任务的有效提升,进一步验证了方案的技术优势。这些改进直接转化为实际应用中的效果提升:一方面,用户在智能投顾服务中获得了更精准、可靠的投资建议,显著提升了用户体验与信任度;另一方面,金融机构得以降低运营风险,提高服务效率,为业务增长提供了有力支持。
案例背景:
随着自动驾驶技术向 L3 及以上级别迈进,复杂路况与极端环境(如暴雨、隧道强光、夜间无路灯场景)下的感知精度成为技术瓶颈。传统数据集存在场景覆盖不足、标注标准不统一等问题,难以支撑模型应对长尾场景。因此,亟需构建具备多模态、高保真、标注精准的数据集,以提升自动驾驶模型在复杂环境下的决策可靠性。
实践方案:
柏川数据通过与多家车企和算法公司合作,构建了多模态自动驾驶高质量数据集,并在数据采集规划、数据清洗流程、标注流程执行等方面形成了一套完整的实践方案。
(1) 数据采集规划:
确立需求目标:训练恶劣天气正常行驶能力。
确定采集场景:涵盖城市道路、高速路段、乡村小道等多种路况。
确定采集环境:区分晴天、阴天、风沙天、雨雪天、雾霾天、黑夜、逆光等不同环境条件。
确定采集装置:使用配备多种传感器(激光雷达、摄像头、毫米波雷达)的专业采集车辆,确保采集数据的多模态性。
规划采集所需各数据标签:将场景、环境进行组合搭配,确保满足各场景条件及corner case的需求。
规划所需数据量:针对各模型的训练需求,综合历史数据分析有效率,向上追加cover量,对不同场景定制采集数据量。当前模型确认雨天白天智能规避障碍物的水平较高,历史数据有效率85%,采集量在需求基础上向上追加20%,再结合各天气实际采集难度,最终输出如同下表的采集数量需求。
(2)数据清洗流程:
确认数据质量标准:根据实际需求,商定数据清洗质量标准。单包数据至少连续抽取60帧,特殊天气场景中,单包需超过45帧拥有明显恶劣天气特征;常规天气场景,平均每帧车数量≥15,特殊天气场景,平均每帧车数量≥5。
制定清洗流程:运用自动化脚本与人工审核结合的方式,基于数据质量标准清洗数据。
1)通过自动化脚本,从采集数据中按照每秒抽1帧的频率,抽取出对应帧的各传感器数据,并对人脸、车牌等敏感数据进行脱敏处理
2)通过自动化脚本,智能识别过滤相机花屏错误、点云大片缺失数据
3)通过自动化处理,检测并修正数据格式问题,将不同传感器数据的时间戳处理统一
4)人工审核排查异常值,如激光雷达点云中的大片缺失,摄像头图像中的模糊、花屏,点云投影至图片时产生明显偏差等,确保数据的完整性与准确性
5)人工审核打标:筛选符合单帧目标物体量的数据,容差接受帧均3目标物;对场景中的指定特征进行标记,如分合流、路口、急转弯、信号灯、施工路段、天气时间、交通情况等,以便根据标签进行分类。
4. 标注流程执行:
制定标注规范:根据训练需求,对图像中的车辆、行人、路障等目标进行精确框选标注,对激光雷达点云数据进行三维目标检测和跟踪标注,设定标注精度、参考尺寸,将规范量化、标准化,便于预标注可遵循指定规则预标、标注员批量生产。
适配预标注算法:根据训练需求,对预标注算法进行调整适配,匹配当前需求类型与生成规则,提升预标注准确率,降低人工修正成本。
人工修正:预标注技术自动识别常见目标,达到95%的识别准确率与80%的贴合精度,标注员对预标注结果进行复核、修正。
人工质检:实行多人交叉质检制度,对标注结果进行两轮~三轮审核,确保标注准确性与一致性。前期少量快速与训练需求拉齐,确立标准无误后,人员提效量产,达到大批量高质量交付的产出能力。
应用效果:
基于该高质量数据集训练的自动驾驶模型,在复杂场景下的目标检测与识别准确率显著提升。
在雨天夜晚场景中,对行人的综合检测准确率从 60% 提升至 82%,对车辆的综合检测准确率从70% 提升至87%,测试场景下极大降低碰撞概率。
在雪天场景中,基于采集难度较高、场景较难扩展的前提下,对行人的综合检测准确率从 40% 提升至 68%,对车辆的综合检测准确率从 65% 提升至 84%,有明显改善,且可持续优化。
在风沙、雾霾天场景中,对行人的综合检测准确率从 65% 提升至77%,对车辆的综合检测准确率从 75% 提升至 85%。
模型泛化能力增强,能够更好地适应不同路况、不同天气的驾驶环境。并且,该数据集为预标注结果算法提供了丰富多样的数据样本,优化了预标注模型,使其在新数据上的预标注准确率提高了8%,为后续标注工作节省了大量时间与人力成本。
本文节选自大数据技术标准推进委员会在“2025数据智能大会”上发布的《高质量数据集实践指南(1.0)》。
报告介绍及全文下载链接如下:
中国信通院云计算与大数据研究所深入开展高质量数据集的质量评估、数据集建设、人工智能数据工程、数据标注平台、合成数据等相关的理论研究、标准规范、评估测试等工作,提供全面的建设咨询规划服务。愿会同行业各方凝聚共识、形成合力,共同推进高质量数据集建设,推动数据要素更好赋能经济社会高质量发展。

联系方式:
中国信通院云大所
白玉真
18810275013(微信同号)
baiyuzhen@caict.ac.cn

证券行业首家|中信建投证券财富管理平台基金AI Agent系统通过信通院数据智能体专项测试
2025数据资产管理大会——数据资产论坛亮点解析
中国通信标准化协会大数据技术标准推进委员会(CCSA TC601,简称:数标委/BDC),旨在凝聚产业链各个环节,识别和解决大数据发展面临的重大问题,开展大数据技术、数据资产管理、数据共享与流通、数据安全等共性基础标准研究,以标准推进工作为纽带,推动大数据与实体经济深度融合。欢迎加入我们的行列!
入会咨询:白老师 13520285502
baizhimeng@caict.ac.cn





