2. 湖北省地震局, 武汉 430071;
3. 武汉理工大学, 安全科学与应急管理学院, 武汉 430070;
4. 云南大学, 数学与统计学院, 昆明 650500
2. Hubei Earthquake Agency, Wuhan 430071, China;
3. School of Safety Science and Emergency Management, Wuhan University of Technology, Wuhan 430070, China;
4. School of Mathematics and Statistics, Yunnan University, Kunming 650500, China
近年来,随着移动互联网广泛、迅速地普及应用,微博、微信、抖音、快手、小红书等移动互联网社交软件逐步成为主流的社交媒体媒介(李志恒等,2020;王玉婷等,2019;薄涛等,2016)。与传统媒体媒介相比,移动互联网的发展改变了人们接收和传播信息的方式,由被动接收信息转化为主动搜索信息,使得人人成为信息接收、发布和传播的独立媒介。目前,在众多新型媒体媒介中,微博已成为人们沟通交流、发表事件观点态度的最重要中文网络社交平台之一(闫尚义等,2023)。
地震作为自然界常见的自然灾害之一,具有突发性强、破坏性大、预测性低的特点。地震一旦发生,尤其是人口密度较大地区,不仅对当地的基础设施、经济生产等造成一定影响,还会引发人民群众的恐慌。在特定地震事件下,众多网友通过微博平台发表个人评论、态度、观点等内容,与震情相关的文本数据迅速在平台内传播,形成大规模舆情数据。这些数据包含多元灾情信息,对灾情快速研判定位与处置具有支撑作用。但混杂的负面错误舆情会快速扩散,误导舆论走向,引发不必要恐慌并扰乱社会秩序。因此,对特定地震事件期间的舆情数据进行分析处理,及时掌握社会舆情发展趋势,对于政府高效开展舆情监测、引导及处置工作发挥着至关重要的作用。本文以地震舆情数据情感分析识别为方向,设计了一种基于长短期记忆网络(Long Short-Term Memory,LSTM)的地震舆情情感分析模型,构建相应的情感识别三分类器(积极、中性、消极),为自动识别地震舆情数据的情感倾向提供技术支撑。首先,设计相应的Python爬虫程序,在微博平台中采集特定震情期间的用户评论数据并进行预处理,建立相应的数据集。然后,使用Word2vec模型训练数据集,将数据样本中的词语转化为计算机可识别的稠密向量,从而捕捉词语间的语义关联。最后,基于LSTM搭建地震舆情情感分析模型,使用数据集对其进行训练与验证。通过一系列实验,验证本文模型在地震舆情情感识别方面的可行性和有效性。
1 相关工作目前,国内外学者主要基于社交媒体数据,开展特定事件全过程的舆情时空变化和情感识别分析等方面研究,常见的情感分析研究方法主要包含基于情感字典、传统机器学习和深度学习的方法(赵嵩正等,2024)。
基于情感字典的情感分析,其主要任务是计算情感词汇的情感倾向,将多种类词汇根据情感倾向分类为积极、中性和消极,从而构建出合适的情感字典,通过情感字典识别语句的感情倾向(李寿山等,2013)。通常所构建的情感字典丰富程度越高、词汇颗粒度越丰富,其依靠该字典的情感分析效果越好。蒋翠清等(2019)利用PMI和Word2Vec算法识别网络社交媒体用户发表内容中的未知情感词,进一步构建情感字典,开展汽车评论情感分析。郗亚辉(2016)基于情感词间的点互信息和上下文约束,采用标签传播算法,设计了一种二阶段的产品评论领域情感词典构建策略,进一步提升情感分析精度。周知等(2021)基于规格组合改进点互信息的情感词级性识别策略,设计了一种有效合理的图书领域情感词典构建方法。但是,基于情感字典的情感分析方法,其构建优质的情感字典难度高、耗时多,且识别准确率和领域适应性较差。
以往基于机器学习的情感分析是广泛采用的研究策略,一般使用支持决策树、支持向量机等传统机器学习模型和算法,以实现对自然语言情感倾向的分类识别功能。戚天梅等(2020)基于情感强度特征词,结合权重策略,并采用朴素贝叶斯、逻辑回归、回归森林等构建了一种计算外汇新闻文本情感倾向和强度的方法。郑志伟等(2018)采用人工标注文本情感类别,经过分词、特征词权重和选择等步骤,基于随机森林建立公共卫生领域的情感分析模型。刘继等(2022)针对舆情中非平衡数据对舆情文本情感分析的干扰问题,构建了一种BERT与BiLSTM的混合情感识别模型,进一步提升网络舆情识别精度。基于机器学习的情感分析方法,情感分析识别精准度得到一定提升,但其人工和时间成本依旧较高。
随着计算机算力逐步提升,基于深度学习模型的情感分析研究成为主流。基于深度学习的情感分析,其主要通过卷积神经网络(Convolutional Neural Networks,CNN)、循环神经网络(Recurrent Neural Network,RNN)等模型以及相关融合模型自动学习文本语义特征,实现语句的情感识别分析。孟佳娜等(2022)融合CNN和门控单元构建了跨领域情感分类模型,并使用小量数据集对模型进行迁移学习,实现了跨领域英文文本的情感分类。潘列等(2022)将广义自回归预训练语言模型(XLNet)与RNN相结合构建文本情感分类模型,通过片段递归等机制充分利用文本预警信息,进一步提升了文本情感分类的综合性能。
与其他常见情感分析策略相比,基于深度学习模型的情感分析具有精度高、领域适应度强、处理速度快等优点,更适合开展情感分析工作。而以往学者的研究工作主要集中在金融、新闻等领域,地震舆情领域则相对较少。为此,本文基于LSTM构建地震舆情分析模型,开展相关情感识别研究。
2 模型构建本文基于LSTM和Word2Vec搭建地震舆情情感分析模型,通过四阶段的数据预处理(数据采集、裁剪、清洗和分词操作)和词向量转换等操作,实现地震舆情数据的三分类识别功能(即积极、中性和消极),最后对搭建的舆情情感分析模型进行训练验证,模型结构如 图 1所示。
|
图 1 地震舆情情感分析模型结构 |
高质量数据集是训练神经网络模型的基础,也是模型取得精准识别效果的关键。由于文本数据无法被LSTM直接识别,需通过相关的数据预处理操作,去除数据中无效冗余内容,以提升数据集整体质量。数据预处理共包含四部分,即数据采集、数据裁剪、数据清洗和数据分词。
(1) 数据采集。该阶段基于Python开发了相应的网络爬虫脚本程序,以新浪微博为数据源,爬取特定地震事件期间主流媒体微博的评论内容作为数据集。同时,采用人工标注的方式,对数据集中所有评论内容手动标注其情感类别(积极、中性和消极)。数据采集程序和采集的评论数据样例如 图 2和表 1所示。
|
图 2 地震舆情数据采集程序示例 |
| 表 1 地震舆情数据样例 |
(2) 数据裁剪。由于LSTM模型仅可输入固定长度的语句,需对数据样本进行裁剪操作。适宜的裁剪长度,既能减少重要情感词汇遗失,确保语句的情感倾向,又能提升模型训练速度和效果,降低不必要时间成本。一般对数据集中所有数据样本长度进行统计分析,将裁剪长度设定为等于或略大于所有样本长度的中位数。
(3) 数据清洗。由于微博用户发表的评论内容无统一格式,其中掺杂着许多无效冗余内容,需对数据集进行逐条清洗,删除语句中自动回复、表情符号、重复内容等,以提升数据集质量。
(4) 数据分词。按照一定规则和顺序,将连续的评论文本语句切分为单独的词(字)序列,实现数据分词功能。同时,对数据进行去停用词处理,去除分词中无效的词字,保证数据样本的有效性。本文采用jieba分词库(邢玲等,2023),对文本数据实现分词、去停用词处理。
2.2 建立词向量字典Word2Vec(柴源,2022;Kolesnikova et al,2020)是谷歌在2013年发布的一种神经网络模型,其可根据语句的共现信息,通过多次训练将每个词语由高维词向量转换为低维空间向量,且保留了词向量间顺序关系,解决了数据属性和语义缺失等问题。Word2Vec包含两种训练模式,即通过跳字模型(Skip-gram,SG)和连续词包模型(Continuous bag of word,CBOW)开展词/字向量的训练和转换。
CBOW模型通过上下文和周边词汇预测当前位置词语w(t)的概率,SG模型为逆序版的CBOW模型,通过当前位置词汇w(t)预测上下文概率(图 3)。
|
图 3 Word2Vec训练模型 |
LSTM是循环神经网络的改良型,其主要在RNN基础上添加其他类型门结构(如忘记门、输入门等),通过对神经元状态增加或删除相关信息,促使RNN网络更加深层次利用长距离的时序信息,有效解决了训练过程中存在的梯度消失等问题(柴源,2022;Sun et al,2023;王晓湘等,2022)。
LSTM模型训练流程为:首先,向输入层输入t时刻的数据特征,经激活函数计算结果;然后,将计算结果与t-1时刻隐藏层输出数据、t-1时刻cell单元存储的信息作为输入数据,全部传输至LSTM结构的节点中,通过门和单元协同处理输出计算结果,并传输至下一隐藏层或输出层,计算反向传播误差,更新各个权值。LSTM模型网络结构和流程如 图 4所示。
|
图 4 LSTM神经网络模型结构 |
(1) Ct为cell单元,代表神经元状态的记忆,其使得LSTM的神经元具有保存、读取、重置和更新长距离历史信息的能力。
(2) ft为遗忘门(Forget Gate),表示要从cell单元中删除哪些信息,其主要由sigmoid层决定。ht-1和xt为遗忘门ft的输入数据,在Ct-1单元输出[0,1]之间的数值,1代表完全遗忘,0代表完全保留,即
| $ f_t=\operatorname{sigmoid}\left(W_f\left[h_{t-1}, x_t\right]+b_f\right) $ | (1) |
其中,ft代表在时间步长t的遗忘状态;Wf、bf分别代表时间步长t的遗忘状态的权重和偏差。
(3) 输入门(Input Gate)决定单元中需要存储哪种信息,主要由输入门sigmoid层和tanh层构成。其中,sigmoid层决定更新哪些数值,tanh层创建候选向量
| $ i_t=\operatorname{sigmoid}\left(W_i\left[h_{t-1}, x_t\right]+b_i\right) $ | (2) |
| $ \tilde{c}=\tan h \left(W_c\left[h_{t-1}, x_t\right]+b_c\right) $ | (3) |
其中,xt代表t时刻的输入数据;ht-1代表在t-1时刻的隐藏状态;it代表输入层在t时刻的输入;
因此,可将旧状态Ct-1更新为Ct,即
| $ C_t=f_t \times C_{t-1}+i_t \times \tilde{C} $ | (4) |
输出门(Output Gate)主要控制单元状态输出值,其计算公式为
| $ o_t=\operatorname{sigmoid}\left(w_o \times\left[h_{t-1}, x_t\right]+b_o\right) $ | (5) |
| $ h_t=o_t \times \tan h \left(W_c\right) $ | (6) |
其中,ot代表t时刻的输出门的输出值;wo、bo分别代表t时刻输出门的权重和偏差。
3 实验验证 3.1 实验环境本文所开展的模型训练、验证等实验均采用GPU计算加速,实验设备配置如 表 2所示。
| 表 2 实验设备及环境配置 |
为确保爬虫程序所采集数据集的质量,最大限度提升数据与地震事件的相关度,以新浪微博为评论数据主要采集平台,以2020—2023年期间显著地震事件为主题搜索相关微博评论内容。经对比分析发现,与个人用户和大V账号(粉丝量较大的微博认证用户)相比,国家政府机关和主流媒体微博官方账号中,关于地震事件相关新闻简讯的网络评论内容较为丰富且相对集中、数量较大。因此,本文采用分散爬取汇总的策略,以国内地震信息速报的权威机构(中国地震台网中心)和部分主流新闻媒体的官方微博账号为主要舆情数据爬取源,采集特定地震事件简讯或速报发布后24h内的网民评论数据。为确保数据爬取效率,本文设计的网络爬虫程序采用多个用户ID和IP代理池相结合的策略,最大限度避免新浪微博数据反爬机制的干扰。
对于爬取的舆情数据,经汇总筛选处理后共计6万条评论数据,均通过人工方式逐条标注数据样本的情感倾向,其中-1代表消极情感倾向,0代表中性情感倾向,1代表积极情感倾向。主要采集的微博用户和震情事件如 表 3所示。
| 表 3 新浪微博新闻评论数据的主要采集对象 |
对采集数据样本长度进行统计分析(图 5),发现样本长度集中在[30,34],为最大限度保留评论文本语义,数据预处理中的语句裁剪长度设置为样本中位数长度32。为避免数据样本情感倾向不均衡,地震舆情数据集设定了相对等量的情感倾向,划分方法如 表 4所示。同时,将采集的数据集分别划分为训练集、验证集和测试集,划分比例为4 : 1 : 1。
|
图 5 数据集样本长度分布 |
| 表 4 实验数据集设定 |
为验证搭建的舆情分析模型的有效性,本文通过设定多样的实验确定模型最优架构参数,并分别与传统CNN、RNN的情感分析模型进行实验对比。其中,模型失活率(Dropout) 设定为[0.1,0.9],学习率(LearRate)设定为[0.1,0.00001],批处理规模(Batch_size)设定为128,文本处理长度(Pad_size)设定为32,隐藏层数(Hidden_size)设定为128,模型层数(Num_layer)设定为2,识别类别数设定为3。
3.4 实验指标为展现模型性能表现,本文采用3项评价指标进行实验对比,即模型准确率(Accuracy)、平均召回率(ARecall)和F1值。
指标1:准确率(Accuracy)
| $ \text { Accuracy }=\frac{\mathrm{TP}+\mathrm{TN}+\mathrm{TNe}}{\mathrm{TP}+\mathrm{FP}+\mathrm{TN}+\mathrm{FN}+\mathrm{TNe}+\mathrm{FNe}} \times 100 \% $ | (7) |
其中,TP(True Postive)代表被模型识别情感倾向为积极,且自身也为积极的样本数量;FP(False Postive)代表被模型识别情感倾向为非积极,但自身为积极的样本数量;TN(True Negtive)代表被模型识别情感倾向为消极,且自身也为消极的样本数量;FN(False Negtive)代表被模型识别情感倾向为非消极,但自身为消极的样本数量;TNe(True Neutral)代表被模型识别情感倾向为中性,且自身也为中性的样本数量。
指标2:平均召回率(ARecall)
| $ \left\{\begin{array}{l} \text { ARecall }=\frac{\text { RecallP }+ \text { RecallNe }+ \text { RecallN }}{\text { ClassNum }} \times 100 \% \\ \text { RecallP }=\frac{\mathrm{TP}}{\mathrm{TP}+\mathrm{FNe}+\mathrm{FN}} \\ \text { RecallNe }=\frac{\mathrm{Tne}}{\mathrm{FP}+\mathrm{TNe}+\mathrm{FN}} \\ \text { RecallN }=\frac{\mathrm{TN}}{\mathrm{FP}+\mathrm{FNe}+\mathrm{TN}} \end{array}\right. $ | (8) |
其中,ClassNum代表模型情感倾向分类总数。
指标3:F1值
| $ F 1=\frac{2 \times \text { Accuracy } \times \text { ARecall }}{\text { Accuracy }+ \text { ARecall }} \times 100 \% $ | (9) |
为多方位表现所搭建的情感分析模型性能,本文通过设定多样的模型超参数、失活率(Dropout)开展相关实验,并与其他常见情感分析模型进行性能对比。
3.5.1 模型超参数性能对比(1) 多样学习率的模型性能对比。该部分通过设定多样的模型学习率(LearRate),展现本文搭建模型的性能表现。从 表 5中可见,随着学习率的降低,模型的验证准确率、平均召回率和F1值随之升高,然后再降低。当模型学习率为0.001时,本文搭建的情感分析模型性能表现最优,其准确率、召回率和F1值均达到96.5%。
| 表 5 多样学习率的LSTM模型实验性能表现 |
(2) 多样失活率的模型性能对比。该部分通过设定不同梯度的模型失活率(Dropout),展现本文搭建模型的性能变化。从 表 6可见,随着失活率升高,模型的验证准确率、平均召回率和F1值先随之降低,然后再升高,当增长至一定数值后,再随之降低。当模型失活率为0.7时,模型性能表现最优,从而说明基于小规模数据集的情感分析模型,需要相对更强的正则化抑制模型过拟合,从而确保神经网络的性能与稳定性。
| 表 6 不同失活率的模型实验性能比较 |
本阶段实验的模型学习率(LearRate)和失活率(Dropout)分别设定为0.001和0.7,模型在测试集上的性能表现如 表 7所示。由 表 7可见,与CNN、RNN模型相比,LSTM模型的准确率、平均召回率和F1值均有提高,表明LSTM模型可从文本数据中读取到更为深度、丰富的语义,从而提升识别精度及准确率,证明了本文所搭建的地震情感分析模型的有效性。
| 表 7 实验模型测试结果 |
随着移动互联网应用的普及与新媒体的发展,基于网络评论内容的舆情情感分析成为当前研究热点,深度学习方法被舆情识别分析广泛采用。本文搭建了一种基于LSTM的地震舆情情感分析识别模型,通过Python网络爬虫程序,采集了特定地震事件下的微博用户网络评论数据,经过数据预处理,构建了相应的地震舆情数据集。基于该数据集,对模型开展训练实验,确定了模型最优参数配置,验证了本文所搭建模型的可行性和有效性。未来可进一步丰富地震舆情数据集种类和体量,结合情感强度分析方法,开展多模态地震舆情情感分析的相关研究,进一步拓宽模型的应用广度,提升性能表现。
致谢: 感谢本文审稿专家给予的高质量评审意见及建议,感谢中国地震局地震科技星火计划攻关项目、中国地震局地震信息青年重点任务、中国地震局第一监测中心科技创新主任基金项目对本研究的支持。
薄涛、王玉婷、李明政等, 2016, 基于微信公众平台的地震信息发布研究, 防灾科技学院学报, 18(4): 62-70. |
柴源, 2022, 基于LSTM和Word2 vec的图书评论文本情感分析研究, 信息技术, (7): 59~64, 69. |
郭峰、刘鑫, 2017, 媒介融合: 传统媒体的求存战略——以吉林日报报业集团为例, 青年记者, (24): 49-50. |
蒋翠清、郭轶博、刘尧, 2019, 基于中文社交媒体文本的领域情感词典构建方法研究, 数据分析与知识发现, 3(2): 98-107. |
李寿山、李逸薇、黄居仁等, 2013, 基于双语信息和标签传播算法的中文情感词典构建方法, 中文信息学报, 27(6): 75-81. |
李志恒、宋金龙、权腾龙等, 2020, 基于WCI指数的地震政务微信公众号影响力分析, 防灾科技学院学报, 22(2): 83-90. |
刘继、顾凤云, 2022, 基于BERT与BiLSTM混合方法的网络舆情非平衡文本情感分析, 情报杂志, 41(4): 104-110. |
孟佳娜、吕品、于玉海等, 2022, 基于CNN的方面级跨领域情感分析研究, 计算机工程与应用, 58(16): 175-183. |
潘列、曾诚、张海丰等, 2022, 结合广义自回归预训练语言模型与循环卷积神经网络的文本情感分析方法, 计算机应用, 42(4): 1108-1115. |
戚天梅、过弋、王吉祥等, 2020, 基于机器学习的外汇新闻情感分析, 计算机工程与设计, 41(6): 1742-1748. |
王玉婷、薄涛, 2019, 基于政务微信公众平台的地震信息发布效能评价方法研究, 防灾科技学院学报, 21(2): 61-67. |
邢玲、程兵, 2023, 基于结巴分词的领域自适应分词方法研究, 计算机仿真, 40(4): 310~316, 503. |
赵嵩正、魏娜、李美彦等, 2024, 基于情感分析和热度预测的网络舆情预测研究, 西安石油大学学报(自然科学版), 39(1): 135-142. |
郑志伟、邱佳玲、阳庆玲等, 2018, 随机森林对文本情感分析的应用与R软件实现, 现代预防医学, 45(8): 1345~1348, 1353. |
周知、王春迎、朱佳丽, 2021, 基于超短评论的图书领域情感词典构建研究, 情报理论与实践, 44(9): 183~189, 197. |
闫尚义、王靖亚、刘晓文等, 2023, 基于多头自注意力池化与多粒度特征交互融合的微博情感分析, 数据分析与知识发现, 7(4): 32-45. |
郗亚辉, 2016, 产品评论中领域情感词典的构建, 中文信息学报, 30(5): 136-144. |
王晓湘、刘洞天、刘南江等, 2022, 基于LSTM的震后通信数据异常检测分析, 中国地震, 38(2): 270-279. |
Kolesnikova O, Gelbukh A, 2020, A study of lexical function detection with word2vec and supervised machine learning, J Intell Fuzzy Syst, 39(2): 1993-2001. |
Sun L H, Yang B Q, Ma J, 2023, Trajectory prediction in pipeline form for intercepting hypersonic gliding vehicles based on LSTM, Chin J Aeronaut, 36(5): 421-433. DOI:10.1016/j.cja.2023.02.017 |
2025, Vol. 41


