新闻动态 / 科研成果

我中心在智能制造领域取得新进展,相关成果发表于RCIM

近日,我中心刘祥根副教授课题组发表了一篇关于人工智能驱动制造工艺规划的研究论文。相关研究成果“ProcessMM: An OCR-enhanced domain-specific multimodal model for manufacturing process planning”被智能制造领域国际期刊 Robotics and Computer-Integrated Manufacturing 接收。刘祥根副教授为该论文通讯作者,2026级硕士研究生张入夕为第一作者。

背景:制造工艺规划(Manufacturing Process Planning)是连接产品设计与实际制造的重要环节,传统方法高度依赖工艺人员对零件几何结构及各类工程标注的专业分析,具有较高的专业门槛和人工成本。近年来,视觉-语言模型的快速发展为直接理解工程图纸并自动生成工艺方案提供了新的技术路径。然而,与自然图像不同,制造工程图纸通常具有高分辨率、几何结构复杂、工程标注密集以及领域知识依赖程度高等特点,单纯依赖视觉编码难以准确识别和理解图中以文字、数字和工程符号等形式呈现的尺寸、公差和技术要求等关键信息。因此,如何有效融合工程图纸中的视觉几何信息与工程标注信息,生成专业、可靠的制造工艺方案,是当前智能工艺规划面临的重要挑战。

方法:论文提出了一种OCR增强的领域专用多模态模型 ProcessMM。如图1所示,ProcessMM主要由双通道特征提取、层次化多模态对齐以及句子级注意力归因三个部分组成。

图1:本文提出的ProcessMM框架示意图

其中,双通道特征提取模块分别通过视觉编码器和OCR技术获取工程图纸中的视觉几何特征与工程标注信息;层次化多模态对齐模块利用OCR信息引导视觉特征学习,并进一步与语言模型对齐,实现工艺文本生成;句子级注意力归因方法则分析生成的工艺语句与图纸区域之间的关联,直观展示不同加工工序所关注的关键视觉区域,为理解模型的工艺生成过程提供视觉依据。

实验:论文在多个真实制造工程图纸数据上对ProcessMM进行了系统实验,并与多种具有代表性的视觉-语言模型进行了比较。实验从工序名称预测、工艺文本生成、工序顺序一致性以及工艺参数预测等多个维度对生成结果进行评价。结果表明,ProcessMM在多项核心指标上展现出良好的综合性能,验证了该方法在制造工艺规划任务中的有效性。

图2:ProcessMM在部分数据集上的实验结果

图3:句子级注意力归因方法可视化结果

该研究针对制造工程图纸视觉结构复杂、工程标注信息丰富等特点,通过融合视觉与OCR信息提升模型对工程图纸的理解与工艺生成能力,并通过句子级注意力归因方法分析模型生成不同工艺语句时所关注的关键视觉区域,为理解模型的工艺生成过程提供视觉依据。相关研究为多模态人工智能技术在制造工艺规划中的应用提供了新的研究思路。

上一篇: