暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

面向高速公路结构健康监测数据应用的节省成本响应调度器

时空实验室 2026-01-09
157

DSE精选文章
A Cost-Saving Response Scheduler for Highway Structural Health Monitoring Data Applications


Data Science and Engineering (DSE)是由中国计算机学会(CCF)主办,数据库专业委员会承办,施普林格·自然(Springer Nature)集团出版的开放获取(OA)期刊。本篇文章精选自DSE第2025年近期发文


文章介绍


随着高速公路基础设施规模的持续扩大,结构健康监测(Structural Health Monitoring,SHM)系统在保障道路安全与辅助运维决策中发挥着关键作用。受高频采样机制影响,SHM数据规模呈爆炸式增长,网络I/O传输成本成为数据共享平台进行数据调度的主要瓶颈。本文系统研究了高速公路SHM数据应用的节省成本响应调度问题,发现主要挑战在于:用户请求的数据规模大且高度重叠,存储资源受限,且在响应顺序选择上需要在全局I/O成本最小化与计算效率之间取得平衡。因此,本文提出了一种基于数据重叠度的贪心响应调度方法,通过刻画用户请求数据与本地存储数据之间的重叠关系,在每一步优先响应重叠度最大的应用请求,从而有效减少冗余数据传输。实验结果表明,该方法与多种常用调度策略相比,可将网络I/O传输成本平均降低42.16%,同时具备良好的运行效率与稳定性,填补了目前的研究都没有考虑SHM数据的传输成本这一空白。



方法框架


1. 问题定义

(1)高速公路SHM数据应用的节省成本响应调度问题:给定一组按时间到达的用户数据申请,每个申请对应若干具有类型标签和时间范围的数据集合,且本地硬盘存储空间受限。由于部分用户请求数据已存在于本地存储中,不同申请之间存在数据重叠关系,响应不同申请所产生的网络I/O传输成本存在显著差异。问题以最小化整个响应过程中的网络I/O传输成本为优化目标,确定合理的申请响应顺序。本文进一步证明该问题为NP-hard,表明在实际规模下难以获得最优解。

(2)数据重叠:直观来讲,用户申请的数据中,与当前本地硬盘已存数据在“数据类型 + 时间范围”两个维度上重合的部分所占的数据量。换句话说,它衡量的是无需额外网络传输即可直接使用的数据规模。如下图1所示,蓝色矩形为用户申请数据,阴影矩形为本地硬盘已存数据,那么两者重叠形成的红色矩形区域则为数据重叠。如果某个用户申请的数据已经(部分或全部)存在于本地硬盘中,那么该申请在响应时产生的新增网络I/O成本就会显著降低。

1. 数据重叠定义示例

2. 整体流程

在此基础上,本文设计了一种基于数据重叠度的贪心响应调度算法,伪代码如下算法1所示。整体流程包括以下几个步骤:

(1)数据建模与标注:对用户申请的数据进行统一建模,为每个数据片段赋予数据类型标签和时间范围标签,以刻画SHM数据在语义与时间维度上的差异。

(2)数据重叠度计算:基于当前本地硬盘中的已存数据,计算每个用户申请与本地数据之间的重叠度,用以衡量该申请在当前状态下可能产生的新增网络I/O传输量。

(3)贪心响应决策:在每一轮调度中,优先选择与本地存储数据重叠度最大的用户申请进行响应,从而最大化已命中数据比例,减少远端数据调取。

(4)存储状态更新与迭代调度:在完成一次响应后,根据数据替换策略更新本地存储状态,并在新的存储状态下重新计算剩余申请的数据重叠度,重复上述过程直至所有申请被处理完成。

(5)理论分析与复杂度控制:通过证明优化目标函数的单调次模性,给出了所提贪心算法的(1+1/(e−1))近似比,同时分析了算法的时间与空间复杂度,验证其在实际平台中的可行性。

算法1. 贪心算法



实验结果


实验在合成数据集和真实高速公路SHM数据集上进行,如下表1所示。

1. 数据集信息

(1)有效性实验

本文将所提方法(Ours)与 8 种常见响应调度策略进行对比,包括:按申请顺序响应(Order)、随机响应(Random)、按数据规模升序/降序(AscSize/DesSize)、按时间戳升序/降序(AscTime/DesTime)、基于相似度的贪心方法(Similar)和基于强化学习的方法(Q-Learn)。在总体I/O成本对比中,如图2所示,Ours 在合成数据集和真实数据集上均表现最优,平均可降低42.16%的网络I/O成本。

2. 响应调度方法的总I/O传输大小

2)效率实验

如图3所示,运行时间随申请数量增加而平稳上升,增长趋势符合算法的理论复杂度分析。在实际平台中,由于同时等待处理的申请数量有限,算法开销可忽略。

3. 应用程序数量的变化带来的效率结果

3)替换策略分析

在从存储服务器拉取数据后,需要替换本地磁盘中的部分数据,不同替换策略可能影响整体效果。本文将8种常见替换策略进行对比,包括:Random(随机替换)、SameType(同类型优先)、OldTime(最旧时间优先)、SameType & OldTime(同类型的旧时间优先)和LRU(最近最少使用)。如图4所示,在所有策略下,本文方法均保持下降趋势,表明其对替换策略不敏感;其中,Random替换在多数情况下表现最好。


4. 不同替换策略的比较结果



结语


本文首次从系统与算法优化视角研究了高速公路SHM数据平台中的应用响应调度问题,提出了一种具有理论近似保证且工程可落地的贪心调度方案。研究结果表明,合理利用用户申请数据之间的重叠关系,可以显著降低网络I/O开销,为大规模SHM数据共享平台的高效运行提供了新的优化思路,也为后续数据服务调度与系统设计研究奠定了基础。



作者简介




齐志鑫,哈尔滨工业大学交通科学与工程学院副研究员,硕士生导师。主要研究方向为路域数据挖掘,低空边缘计算等。


汪雨林,哈尔滨工业大学交通科学与工程学院2023级硕士。主要研究方向为路域数据分析挖掘。


巢泽敏,哈尔滨工业大学计算学部副研究员,硕士生导师,CCF数据库专委会执行委员。主要研究方向为时序数据查询挖掘,数据库系统开发等。


董泽蛟,哈尔滨工业大学交通科学与工程学院院长,教授,博士生导师。主要研究领域为铺面计算力学,铺面结构智能化,铺面材料可持续化,车路协同感知等。


王宏志,哈尔滨工业大学计算学部教授,博士生导师。中国计算机学会杰出会员,IEEE Senior member。主要研究方向为数据库,大数据管理与分析,大数据治理等。




期刊简介




Data Science and Engineering(DSE)是由中国计算机学会(CCF)主办,数据库专业委员会承办,施普林格·自然(Springer Nature)出版的开放获取(Open Access)期刊。DSE致力于发表与数据科学与工程领域相关的关键科学问题与前沿研究热点,以大数据为研究重点,建设国际学术交流的重要平台,推动学术界和企业界的深度融合。征稿范畴主要包括:数据库系统、大数据管理与分析、大数据治理等相关基础理论、关键技术与系统实践。现任主编(Editors-in-Chief)为数据科学与工程领域的知名专家北京大学崔斌教授和意大利英苏布里亚大学Elena Ferrari教授,现任执行主编(Managing Editor)为数据库专业委员会主任、华东师范大学周傲英教授和浙江大学高云君教授。

目前期刊已被EI、ESCI与SCOPUS收录,2024年影响因子(Impact Factor)为4.6,CiteScore为11.9,在计算机科学应用领域排名前8.87%(84/947)、计算机软件领域排名前9.6%(47/490)、信息系统领域排名前9.7%(46/474),人工智能领域排名前12.7%(57/450)。欢迎大家免费下载阅读期刊全文,并积极投稿。


原文链接:

https://link.springer.com/article/10.1007/s41019-025-00314-w



文稿:朱明辉
校稿:李瑞远
排版:刘苧锐
审核:高云君




文章转载自时空实验室,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论