国内刊号:11-2865/X
国际刊号:1003-3033
发布日期:
作者:王喆, 黄海辰, 李瑞钦, 魏永长
单位:1 武汉理工大学 安全科学与应急管理学院,湖北 武汉 430070;2 武汉理工大学 中国应急管理研究中心,湖北 武汉 430070;3 中南财经政法大学 工商管理学院,湖北 武汉 430073
关键词:视觉语言,多模态,建筑施工安全,安全隐患,智能问答模型,矩阵低秩分解
基金:教育部人文社会科学研究青年基金资助(21YJA630094); 教育部人文社会科学研究青年基金资助(20YJC630154); 中央高校基本科研业务费专项资金项目(104972024DZB0003)
为提升建筑施工复杂环境下安全问题的智能化诊断水平,提出一种基于视觉语言多模态的建筑施工安全智能问答模型,构建建筑施工安全隐患图文对数据集,采用视觉编码器完成安全隐患图像的视觉编码,利用语言模型实现安全隐患问答文本的编码,通过多模态特征融合模块达成图像与文本信息的有效交互;构建适配建筑施工安全隐患场景视觉问答的特定提示模板,基于矩阵低秩分解对模型微调训练,并通过多轮提示词引导模型生成精确答案。结果表明:相较于现有对比模型,建筑施工安全智能问答模型在自动评估指标、GPT-4评价和专家评价中均表现更优,生成文本的流畅性与语义相关性显著提升;消融试验进一步验证了各子模块的有效性,证实矩阵低秩分解微调和多轮推理的协同作用是模型达成最优性能的关键,且合理设置低秩矩阵的秩参数可有效避免过拟合问题。
来源:2025年第10期
《中国安全科学学报》期刊编辑部