煤炭工程 ›› 2026, Vol. 58 ›› Issue (1): 184-191.doi: 10.11799/ce202601023
吴徐燕,杨超宇
摘要:
针对煤矿“三违”文本分类数据存在专业性强、语义易混淆、样本比例失衡3种问题,提出cBert-GCN煤矿“三违”文本分类模型。考虑到存在除专业领域信息外,煤矿“三违”文本数据简短,同时具有上下文关联紧密以及固有二义性,引入拼音、字形向量以增强表达煤矿“三违”文本数据。文章将GCN用于煤矿“三违”文本分类中,构建文本共现图以捕获文本中的结构信息和依赖关系,采用中文预训练模型和图卷积神经网络结合的方式进行特征学习,融合字符级和词级,设置二者权重以实现对煤矿“三违”数据的准确分类。结果表明“cBert-GCN模型在训练样本上的准确率高于其他模型达到97.03%,且在测试样本中准确率达到93.17%,具备良好泛化能力。因此,cBert-GCN模型在煤矿“三违”文本数据方面具有比较明显的应用优势。
中图分类号: