
微博评论情感分析从数据预处理到词向量构建简介一、项目介绍1. 项目任务2. 数据处理策略1核心目标2输入词向量格式3固定输入长度4超长评论处理5不足长度填充6词表压缩7未登录词处理二、代码实现1. 构建词表vocab_create.py词表构建逻辑说明2. 数据加载与预处理load_dataset.py数据格式说明3. 数据迭代器DatasetIteratorDatasetIterator 核心功能三、总结项目核心流程回顾关键技术要点简介在当今信息爆炸的时代海量的文本数据如社交媒体评论、产品评价、新闻留言等不断涌现这些文本中蕴含着人们丰富的情感态度——无论是对商品的喜爱、对政策的支持还是对服务的不满。自然语言处理NLP领域中的情感分析技术正是挖掘这些情感信息的关键工具。情感分析也常被称为意见挖掘它通过计算机技术对文本数据进行处理、分析和理解自动识别和提取文本中所包含的情感倾向如积极、消极、中性甚至还能进一步细分为喜悦、愤怒、悲伤、惊讶等具体的情感类别为企业决策、公共舆情监测、个人服务等诸多领域提供有力的支持。一、项目介绍1. 项目任务本项目旨在对微博评论信息进行情感分析建立模型自动识别评论所表达的情绪状态如积极、消极、中性等。2. 数据处理策略在深度学习的 NLP 任务中文本数据无法直接输入模型需要先将其转换为数值形式。以下是本项目中的核心处理策略1核心目标将每条评论内容转换为词向量形式作为模型的输入。2输入词向量格式每个词/字转换为200 维的词向量。本项目采用腾讯训练好的词向量模型原始维度为 4960 维如需该模型文件可私信获取。3固定输入长度每次传入模型的词/字个数需要固定。例如设定输入长度为 32则每条评论传入的数据格式为32 × 200的矩阵表示该批次 32 个词的向量表示。4超长评论处理如果一条评论超过 32 个词/字直接截断删除后面的内容。5不足长度填充如果一条评论不足 32 个词/字使用特殊标记PAD进行填充补齐到固定长度。6词表压缩语料库中的词/字数量庞大部分低频词难以训练出有效特征。因此项目中选择出现频率最高的4760 个词构建词表。7未登录词处理被压缩掉的低频词以及词表中不存在的词统一使用特殊标记UNK替代。二、代码实现1. 构建词表vocab_create.py本模块负责读取原始数据统计字符频率构建固定大小的词表并保存。fromtqdmimporttqdmimportpickleaspkl MAX_VOCAB_SIZE4760UNK,PADUNK,PADdefbuild_vocab(file_path,max_size,min_freq): 基于文本内容构建词表 参数 file_path: 数据文件路径 max_size: 词表最大容量 min_freq: 最小词频阈值 返回 vocab_dic: 词表字典 {字符: 索引} tokenizerlambdax:[yforyinx]# 分字函数vocab_dic{}withopen(file_path,r,encodingUTF-8)asf:i0forlineintqdm(f):# 跳过表头ifi0:i1continue# 提取评论内容跳过标签和逗号contentline[2:].strip()ifnotcontent:continue# 统计每个字符的出现频率forwordintokenizer(content):vocab_dic[word]vocab_dic.get(word,0)1# 按词频降序排列取前 max_size 个vocab_listsorted([itemforiteminvocab_dic.items()ifitem[1]min_freq],keylambdax:x[1],reverseTrue)[:max_size]# 构建词表字典vocab_dic{word:idxforidx,(word,_)inenumerate(vocab_list)}vocab_dic.update({UNK:len(vocab_dic),PAD:len(vocab_dic)1})# 保存词表pkl.dump(vocab_dic,open(simplifyweibo_4_moods.pkl,wb))print(f词表大小:{len(vocab_dic)})returnvocab_dicif__name____main__:vocabbuild_vocab(simplifyweibo_4_moods.csv,MAX_VOCAB_SIZE,1)print(词表构建完成)词表构建逻辑说明步骤说明1从 CSV 文件中读取中文评论文本2统计每个字符在语料中出现的次数3按词频降序排列保留前 4760 个高频字符4为每个字符分配唯一索引0~47595添加UNK索引 4760和PAD索引 47616将词表序列化保存为 .pkl 文件2. 数据加载与预处理load_dataset.py本模块负责读取数据、进行填充/截断、划分数据集。fromtqdmimporttqdmimportpickleaspklimportrandomimporttorch UNK,PADUNK,PADdefload_dataset(path,pad_size70): 加载数据集并进行预处理 参数 path: 数据文件路径 pad_size: 固定序列长度 返回 vocab: 词表字典 train_data: 训练集 dev_data: 验证集 test_data: 测试集 contents[]vocabpkl.load(open(simplifyweibo_4_moods.pkl,rb))tokenizerlambdax:[yforyinx]withopen(path,r,encodingutf8)asf:i0forlineintqdm(f):# 跳过表头ifi0:i1continueifnotline:continue# 提取标签和评论内容labelint(line[0])contentline[2:].strip(\n)# 分字tokentokenizer(content)seq_lenlen(token)# 填充或截断到 pad_sizeifpad_size:iflen(token)pad_size:token.extend([PAD]*(pad_size-len(token)))else:tokentoken[:pad_size]seq_lenpad_size# 字符转索引words_line[vocab.get(word,vocab.get(UNK))forwordintoken]contents.append((words_line,label,seq_len))# 随机打乱random.shuffle(contents)# 按 8:1:1 划分训练集、验证集、测试集totallen(contents)train_datacontents[:int(total*0.8)]dev_datacontents[int(total*0.8):int(total*0.9)]test_datacontents[int(total*0.9):]returnvocab,train_data,dev_data,test_dataif__name____main__:vocab,train_data,dev_data,test_dataload_dataset(simplifyweibo_4_moods.csv)print(f训练集:{len(train_data)}条)print(f验证集:{len(dev_data)}条)print(f测试集:{len(test_data)}条)数据格式说明处理后的每条数据是一个三元组字段类型说明words_linelist[int]字符索引列表长度为 pad_sizelabelint情感标签0/1/2等seq_lenint填充前的实际长度3. 数据迭代器DatasetIterator本模块负责将数据按批次打包转换为 PyTorch Tensor并支持迭代访问。classDatasetIterator:数据集迭代器批次化处理 Tensor 转换def__init__(self,batches,batch_size,device):self.batch_sizebatch_size self.batchesbatches self.n_batcheslen(batches)//batch_size self.residuelen(batches)%batch_size!0self.index0self.devicedevicedef_to_tensor(self,datas):将批次数据转换为 Tensorxtorch.LongTensor([_[0]for_indatas]).to(self.device)ytorch.LongTensor([_[1]for_indatas]).to(self.device)seq_lentorch.LongTensor([_[2]for_indatas]).to(self.device)return(x,seq_len),ydef__next__(self):迭代下一批次# 处理剩余样本ifself.residueandself.indexself.n_batches:batchesself.batches[self.index*self.batch_size:len(self.batches)]self.index1returnself._to_tensor(batches)# 迭代结束ifself.indexself.n_batches:self.index0raiseStopIteration# 正常批次startself.index*self.batch_size end(self.index1)*self.batch_size batchesself.batches[start:end]self.index1returnself._to_tensor(batches)def__iter__(self):returnselfdef__len__(self):returnself.n_batches(1ifself.residueelse0)DatasetIterator 核心功能功能说明批次化处理将数据分批加载避免内存溢出自动转换 Tensor将 Python 数据转为 PyTorch Tensor设备兼容自动将数据分配到 CPU 或 GPU标准迭代接口支持 for 循环和 len() 操作三、总结项目核心流程回顾词表构建统计语料字符频率 → 筛选高频词 → 分配索引 → 保存词表数据预处理读取文本 → 分字 → 填充/截断 → 转索引 → 划分数据集批次迭代按批次加载数据 → 转 Tensor → 供模型训练使用关键技术要点固定输入长度是 NLP 模型训练的基本要求用于填充不足部分 用于处理未登录词词表压缩可减少模型参数量提升训练效率数据集迭代器是连接预处理和模型训练的关键桥梁