交融Datasets服务(高质量数据集建设)
约 4533 字大约 15 分钟
2025-04-24
交融大模型提供高质量数据集的建设服务,即高质量数据集(Datasets)服务。辅助各单位开展内部数据集梳理、数据采集与标准化转换、文本规范化、质量过滤、多层次去重、数据混合与随机等服务,建立各单位内部高质量数据集,并辅助开展各数据局、部委等管理单位的示范项目申报。

一、 概述
交通行业基础数据集
在数据集建设方面,开展了全域数据资源目录建设,涵盖了“试验检测、交通桥梁施工、水运工程、工业制造、物流运输、城市治理、科学研究”多个行业领域的数据资源。构建了覆盖预训练与后训练的全流程数据建设体系,初步梳理和收集总规模达 158TB 原始数据资源,通过清洗加工形成 400 亿 Token 高质量行业文本和 200 万图像文本对语料库,进行增量预训练;构建了 60 万余条专业问答及 30 万条交通基建专属 CoT 思维链数据,进行对齐训练优化,显著提升了模型在垂直领域的专业精度与复杂指令遵循能力。这些数据直接驱动了包括蓝翼大模型、蓝翼·潜龙、蓝翼·穿岳、蓝翼·飞虹在内的多个核心模型的研发与性能跃升,形成了从技术研发到业务应用的全链条支撑。此外,正联合中交集团内部 20 多二级单位紧密协作打造 10+交通基建领域垂域大模型,外部联合了移动、润和、百行数据等多家行业领先公司,实现了内外部优势资源的深度整合与共享。
在技术能力建设方面,一是针对高质量数据集建设中跨模态对齐技术的建设难题,通过构建一体化平台,围绕跨模态表征对齐,攻关图文表征对齐和点云-图文对齐算法两项关键技术。二是建设行业高质量数据集构建运营平台,研发涵盖从采集、处理、到运营管理全流程的六大工具,提供了统一而专业的数据基石。三是针对图像标注、文本标注、智能数据采样与质量检测场景,研发了十项自动化工具算子,构建端到端的自动化数据处理流水线,实现了高质量数据集的规模化、自动化生产。 在应用场景支撑方面,基于高质量数据集已发布蓝翼语言大模型、蓝翼病害视觉检测模型、蓝翼多模态大模型等多个大模型,并应用至中交集团 BIM 设计软件助手、工程方案撰写等 30 余项生产场景和 10 余项管理场景,推广 50 余家企业。 在标准研制验证方面,参与并主导了《交通工程大模型技术应用规范》《高质量数据集 建设指南》《高质量数据集 格式要求》《高质量数据集 分类指南》《高质量数据集 质量评测规范》《信息技术 大数据 数据资产价值评估》等一系列数据集相关标准,累积参编国际标准 1 项、国家标准 5 项、行业及团体标准 8 项,将自身在高质量数据集建设中的先进实践经验转化为行业通用规范。
交融高质量数据集
提供高质量数据集建设服务,助力企业高效完成数据建设、模型训练与场景落地,提供中国电子技术标准化研究院高质量数据集备案指导服务,实现数据资产规范化管理与业务降本增效的双重价值。

交融大模型行业知识训练语料集
包括 400 亿 Token 预训练语料集,10 万对行业精调数据集;针对港口设计,桥梁施工和公路养护等具体场景,形成专业场景精调语料集。

二、 建设方案

1. 数据采集与格式化
数据采集是构建高质量数据集的第一步,也是整个流程的基础。这一步的目标是从多样化的数据源获取数据,并将其转换为统一的标准格式,以便后续处理。数据源可能包括公共爬取档案(如 Common Crawl)、专业文献库(如 PubMed、ArXiv)或机构内部的私有数据集。这些数据通常以压缩格式(如.warc.gz、.tar.gz、.zip)存储,需要先解压并解析。随后,将数据转换为统一的存储格式,例如 JSONL(JSON Lines)或 Parquet(列式存储格式)。选择合适的存储格式至关重要,因为它直接影响后续处理的效率和数据的可访问性。例如,JSONL 格式便于逐行读取和处理,而 Parquet 格式则适合大规模分布式计算。在这一阶段,还需要确保数据的完整性和一致性,例如验证文件是否损坏、记录元数据(如来源、时间戳)等。通过这一过程,我们为后续的数据处理奠定了坚实的基础。
2. 初步文本规范化
初步文本规范化是数据处理的关键步骤,旨在解决文本中的基础问题,例如字符编码错误和多语言混杂。这一步的目标是确保文本以正确的编码清晰呈现,并被准确标注其语言。首先,需要修复 Unicode 字符编码错误,例如将因编码问题导致的乱码(如“café”)修正为正确的字符(如“café”)。这种错误通常源于数据采集过程中不一致的编码方式或编解码循环问题。其次,进行语言识别与分离,确保单语数据集的纯净性。对于多语言数据集,需要对不同语言的内容进行分离和标注,以便后续处理。此外,还需要统一字符编码(如 UTF-8),确保所有文本在后续步骤中能够被正确处理。这一步虽然看似基础,但却是整个数据处理流程的基石,任何编码或语言识别的错误都会对后续步骤产生连锁反应。
3. 基于规则的质量过滤(启发式过滤)
基于规则的质量过滤是数据清洗的重要环节,通过一系列预设的规则识别并移除低质量文本。这一步的目标是剔除不符合质量标准的文档,从而提升数据集的整体质量。主要的过滤规则包括文档长度过滤、模板化内容过滤和 N-gram 重复过滤。文档长度过滤器会剔除过短(缺乏信息量)或过长(可能包含冗余或异常内容)的文本片段。模板化内容过滤器则识别并移除那些包含过多固定模板化语句或格式的文档,这类文档通常信息密度低,对模型训练帮助不大。N-gram 重复过滤器检测文本中是否存在过度重复的短语(如连续出现的短句),移除那些重复模式异常的文档,这通常指示内容质量低下或可能由机器生成。为了提升效率,推荐采用级联方法(cascaded approach),按顺序应用一系列过滤器,允许更精细化的质量控制,同时保持透明度和可解释性。
4. 多层次去重处理
多层次去重处理是数据治理的核心步骤之一,旨在消除重复数据,提升训练效率和数据多样性。这一步的目标是通过精确去重、模糊去重和语义去重三种方法,全面处理不同类型的重复内容。精确去重通过为每个文档生成哈希签名(如 MD5 或 SHA)来识别完全相同的文档,这种方法计算效率高,但只能检测完全一致的匹配。模糊去重则采用基于文档签名的技术(如 MinHash)结合局部敏感哈希(LSH)算法,识别“近乎重复”的文档,例如内容稍作修改或格式不同的文档。语义去重是最复杂的部分,利用文本嵌入模型将文档映射到高维向量空间,结合聚类技术(如 k-means)识别语义相似的文档。通过这三种方法的结合,可以有效处理从完全相同到概念上相似的重复内容,确保数据集的多样性和训练效率。
5. 模型辅助质量评估
模型辅助质量评估是数据处理流程中的高级环节,利用机器学习模型对文本内容进行质量评估和筛选。这一步的目标是通过不同类型的模型,进一步提升数据集的质量。常用的模型包括基于 N-gram 的统计分类器、基于 Transformer 架构的分类器、大型语言模型(LLMs)和专用评估模型(如奖励模型)。基于 N-gram 的分类器简单高效,适用于大规模数据集的初步筛选。基于 Transformer 的分类器则能捕捉更复杂的语言模式,适用于更精细的质量评估。LLMs 本身可以提供对内容质量的深刻洞察,但计算成本较高,适合高质量要求的场景。专用评估模型(如奖励模型)可以同时评估多个质量维度(如相关性、准确性、流畅性)。在实际应用中,通常采用组合策略,先用轻量级模型进行初步筛选,再用更高级的模型进行最终的质量把关,以在效率和效果之间取得最佳平衡。
6. 敏感数据处理(PII 编辑)
敏感数据处理是数据治理流程中的关键安全措施,旨在保护个人隐私并确保数据处理活动符合相关法律法规。这一步的目标是识别并移除或脱敏处理敏感信息,例如姓名、身份证号、地址等直接标识符,以及那些单独看可能不敏感但与其他信息结合后可识别个人的间接标识符。现代 PII 编辑技术包括替换、假名化和移除三种方法。替换是将敏感信息替换为通用占位符(如将社会安全号码替换为 XXX-XX-1234),同时保持原始数据的格式和结构。假名化/令牌化是将敏感数据替换为非敏感的等价物(如令牌),以便在不暴露原始信息的情况下进行分析。移除则是在下游任务明确不需要相关敏感信息时,直接将其从数据中删除。有效的 PII 编辑不仅有助于维护数据隐私和合规性,还能最大限度地保留数据集的实用价值。
7. 自动化数据分类与安全筛选
自动化数据分类与安全筛选是数据治理的重要环节,通过领域分类和安全筛选提升数据的组织性和安全性。这一步的目标是依据领域(如新闻、科技、医疗)、质量等级或安全风险等属性对数据进行组织和归类。领域分类通过识别内容主题,帮助模型理解输入文本的上下文和特定领域的知识。例如,可以利用专门的分类模型将内容划分到预定义的领域中,从而构建主题更多样化的训练数据集。此外,安全分类模型可以识别并过滤不良内容(如仇恨言论、暴力内容等),确保数据集的安全性。在处理大规模数据集时,对每个文档运行分类模型的推理过程会变得计算密集且耗时,因此采用分布式数据分类技术至关重要。通过将大型数据集切分成多个数据块,并在多个计算节点(如 GPU 集群)上并行执行分类任务,可以显著加速整个分类过程。
8. 评估集去污染
评估集去污染是确保模型评估结果真实可靠的重要步骤,旨在防止训练数据污染测试集。这一步的目标是识别并移除训练数据中与测试集高度重叠的部分,从而避免模型评估结果虚高。首先,需要明确下游任务的测试数据集,并将其转换为可比较的表示形式(如 n-gram 集合)。然后,在训练数据中高效搜索是否存在与测试集样本高度重叠的片段。对于检测到的受污染部分,可以采取移除或修改(如掩码关键信息)等措施,同时尽可能保持原文的连贯性和整体质量。这种系统化的方法有助于确保去污染操作的有效性,同时最小化对数据质量的意外损害,为更可靠的模型评估和开发提供保障。
9. 最终数据集混合与随机化
最终数据集混合与随机化是数据治理流程的最后一步,旨在将多个经过处理的数据集合并,并确保其内部顺序的随机性。这一步的目标是构建一个多样化、均衡分布的训练数据集,以提升模型的泛化能力和整体性能。数据混合可以通过在线混合或离线混合两种方式实现。在线混合是在模型训练过程中动态地从多个数据源采样和组合数据批次,适合需要实时调整数据分布的场景。离线混合则是在训练开始之前,预先将所有处理好的数据集按照一定的比例或策略合并成一个大的静态数据集,适合大规模预训练任务。完成混合后,通常还需要对整个数据集进行充分的随机化(Shuffling),打乱样本顺序,以避免模型在训练时受到数据原始顺序的影响。
通过以上步骤,系统性地构建高质量的数据集,为大型语言模型(LLMs)的训练提供坚实的基础。这一数据集建设流程不仅提升了数据的质量和多样性,还优化了数据集构建效率和模型训练效率,为 AI 应用的成功落地提供了保障。
三、 高质量数据集优秀成果案例
由中交 AI 中心提交的“交通基础设施多模态三维构件数据集”提报国资委高质量数据集优秀成果 已在第八届数字中国建设峰会上正式发布,入选行业高质量数据集建设成果。 此次入选不仅代表了国资委对信科集团在数据集建设方面的工作质量认可,也为未来进一步推动行业发展树立了良好示范。

本次发布的 《交通基础设施多模态三维构件数据集》 产生于中交数字化构件资源库系统,属于基建行业(建筑、水运、机场、公路、市政、轨道交通),聚焦于设计、施工、运维阶段,涵盖图片、三维点云、文本等多模态数据,总量约 11.8 TB,该数据集支撑了多项算法研究、数据规模大、数据多样性好,是具有交通领域特色的高质量数据集。
当前,该数据集已成功支持两项研究中的算法训练,在 《基于视觉特征分析的交通基础设施 BIM 构件库资源自动审查技术》 中,识别构件缩略图和截图一致性方面,准确率达到 96.76%;在 《基于 PointLLM 的 BIM 构件智能 3D 分类系统》 中,达到 90%+的分类准确率。目前本数据集正在推进《基于扩散模型的文生点云和图生成云的生成式大模型算法》的研究,研究基于扩散模型的生成式大模型算法,实现文本描述与多视图图像生成高精度三维点云的跨模态生成技术。
本数据集授权国家发明专利 2 项、受理国际发明专利 1 项、发表高质量学术论文 1 篇。该数据集同时入选湖北省高质量数据集典型成果名单。
该数据集具有样本多样性、规模完整性、标注准确性、模型适配性的高质量特性。
中交 AI 中心目前正在支撑多家二级单位开展高质量数据集建设,包括工程设计图纸高质量数据集、遥感影像高质量数据集等。
