第5讲:文本分析建模的主要方法

传媒大数据专业,大三上, 新闻与舆情数据学, 2026

← 返回课程主页 · 上一讲:理论基础与研究设计

一、本讲定位与学习目标

前面的课程讨论了新闻与舆情研究的问题定义、文本预处理和文本表示。本讲进一步回答:当新闻报道、评论和社交媒体帖子已经转化为可计算的数据后,怎样选择模型,把这些数据转化为对研究问题有用的证据?

文本分析建模涉及不同层次的任务。聚类探索文本中存在的分组,分类把文本分配到预先定义的类别,情感分析识别针对特定对象的情感表达。社会网络分析进一步考察这些内容由哪些行动者发布、在什么群体中流动。建模前应明确研究对象、分析单位、预期输出与评价标准。

完成本讲后,应能:

  1. 区分文本聚类、文本分类、情感分析和网络社区识别的任务与输出。
  2. 解释文本表示与相似度如何影响建模结果。
  3. 掌握K-means、DBSCAN、朴素贝叶斯、SVM、KNN与决策树的基本思想和适用条件。
  4. 设计情感词典规则和监督情感分类方案,区分情感、情绪与立场。
  5. 使用适当的评价指标检查模型,并通过阅读误判文本改进研究设计。
  6. 将内容分析结果与时间、行动者和网络结构关联,形成有边界的舆情解释。

1.1 贯穿案例:校园食堂服务调整引发的讨论

本讲使用一个虚构教学案例:某高校调整食堂价格、营业时间和菜单,学生在校园论坛与社交平台上发表评论。研究者收集报道、评论及其发布时间,并在条件允许时记录回复、转发关系。

研究问题建模任务预期输出
评论主要讨论哪些问题?文本聚类关于价格、营业时间、菜品等的文本簇
一条新评论属于哪类诉求?文本分类预先定义的诉求标签
学生对价格调整表达了什么态度?对象或方面层面的情感分析针对价格调整的极性与相关证据
哪些用户频繁互动,讨论怎样跨群体流动?社区识别与传播分析网络社区、桥接节点、传播路径
调整说明发布前后,讨论发生了什么变化?时间分组与模型结果汇总各时期议题及情感表达的变化

以上输出需要真实数据与检验才能成为研究结论。本讲中的句子、类别和数值均为教学示例。

二、文本建模的共同流程

2.1 研究问题与分析单位

研究者首先确定“对什么进行判断”。一篇报道可能涉及多个议题,一条评论可能同时评价两个对象,一个用户可能在不同时间表达不同情绪。因此,文档、句子、观点片段、用户与事件不能直接互换。

例如,“价格贵了,但营业时间延长挺方便”在文档层面包含混合评价,在方面层面则分别表现为对价格的负向评价和对营业时间的正向评价。分析单位决定了需要怎样标注,以及模型误差应怎样理解。

2.2 数据治理与文本表示

建模前应处理重复文本、缺失值、无关内容及异常记录,保留必要的时间和来源信息。中文文本可以按词、字或子词进行表示。沿用前讲的表示技术,本讲主要使用:

表示方式表达的信息适用条件与局限
词袋与词频词项是否出现、出现多少次容易解释,难以表达顺序与上下文
TF-IDF词项在当前文本中的相对区分度适合建立传统模型基线,同义表达可能相距较远
n-gram连续词或字的局部组合可以保留部分短语信息,特征数量会增加
稠密语义向量文本的语义特征能表达部分语义相近关系,效果取决于表示模型和语料

这里的向量表示属于模型输入。更换表示方法可能改变相似文本的邻接关系,也可能改变分类边界。

预处理应服从任务。 情感分析中删除“不”“没”“非常”等词,可能破坏情感极性与强度信息。主题分析中过度保留平台模板或转发标记,也可能使模型主要按格式分组。

2.3 数据划分与信息泄漏

监督学习通常使用训练集学习参数、验证集选择参数、测试集评价最终方案。词表构建、IDF计算和特征选择也应遵循这一边界,不能利用测试集的信息提前调整模型。

新闻与舆情数据存在大量转载、近重复文本和同一事件的连续讨论。应先识别重复或关联记录,再考虑按事件、用户、来源或时间分组划分。划分方式取决于研究目标:如果希望预测未来讨论,就应让测试集更接近未来使用场景。

2.4 输出解释与人工复核

模型输出需要与原文一起检查。一个簇的名称、一个情感分值、一条传播路径都只是分析结果的一部分。研究者还应说明输入数据覆盖了哪些人群,判断依据是什么,哪些文本无法稳定判断,以及误差可能怎样影响结论。

三、文本聚类:探索文本中的分组

3.1 基本概念与相似度

文本聚类在没有逐条类别标签的情况下,依据文本特征之间的相似关系形成分组。它适合探索大量评论中的议题结构、整理相似报道、辅助发现事件线索。

硬划分聚类要求每个样本只属于一个类。其他方法可以允许软归属,密度聚类也可以保留噪声点。研究者应根据具体方法解释输出。

文本向量之间常使用余弦相似度:

\[\operatorname{cos}(x,y)=\frac{x^\top y}{\|x\|\|y\|}\]

它比较向量方向,可以减弱文本长度差异的影响。对于非负词频或TF-IDF向量,余弦相似度通常位于0到1之间。对于包含负值的向量,其范围可以为−1到1。零向量需要单独处理。

欧氏距离适合表达向量在空间中的距离。Jaccard相似度适合比较词项集合的重合程度。选择度量时,应考虑表示方式及研究问题,不能把某一种距离视为所有文本任务的通用标准。

3.2 K-means:围绕中心形成文本簇

K-means预先设定簇数K,然后反复执行样本分配和中心更新:

  1. 选择K个初始中心。
  2. 将每个文本分配给距离最近的中心。
  3. 计算各簇中文本向量的平均值,更新中心。
  4. 重复上述过程,直至满足停止条件。

标准K-means最小化簇内平方距离:

\[J=\sum_{k=1}^{K}\sum_{x_i\in C_k}\|x_i-\mu_k\|^2\]

在食堂案例中,模型可能形成围绕“涨价”“排队”“营业时间”的分组。研究者需要阅读各簇的代表文本,检查这些分组是否表达了可解释的议题。

K-means的优点是思想直接、便于建立基线。主要限制包括需要预设K、对初始化敏感、容易受异常值影响,以及对簇形状和分布存在偏好。课堂可以比较多个K值与随机初始化,观察结果是否稳定。

对经过L2归一化的文本向量,平方欧氏距离与余弦相似度存在对应关系,但普通K-means更新得到的中心未必保持单位长度。因此,普通K-means与球面K-means仍有区别。

3.3 DBSCAN:识别密集分组与噪声

DBSCAN使用邻域半径eps和最小邻域样本数min_samples描述局部密度。满足密度要求的核心点形成并扩展簇,边界点可以加入相邻簇,无法归入簇的样本保留为噪声。

它无需预先指定簇数,也能发现一定条件下形状不规则的簇。在舆情研究中,可以探索密集出现的相似表达。不过,重复模板、广告和刷屏内容也可能形成密集簇,因此密度高不能直接解释为议题重要。

高维稀疏文本中的距离和密度可能难以区分,不同簇的密度也可能差异较大。应用时应检查表示、距离选择与参数敏感性。噪声文本可能包含新议题或少数表达,值得单独阅读。

3.4 密度峰值与层次聚类

密度峰值聚类的中心候选具有较高局部密度,同时与其他更高密度点保持较大距离。密度估计、中心选择及距离计算成本会影响结果,可作为课堂拓展。

层次聚类通过逐步合并或拆分样本形成树状结构,便于观察议题之间的层级关系。合并准则不同,结果可能不同,大规模语料还需要关注计算与存储成本。本讲将其作为对聚类方法家族的补充。

3.5 文本数据流聚类

新闻与评论持续到达,研究对象随时间变化。可以使用界标、快照和滑动窗口等处理范围,并采用STREAM与CluStream等数据流聚类方法。

STREAM以分批处理和压缩摘要缓解存储限制。CluStream将在线微簇更新与离线聚类分析结合,使研究者能够按不同时间范围考察变化。

在课堂案例中,可分别分析调整公告前、公告后和回应后的文本,再比较议题变化。应注意:不同窗口的簇编号没有天然对应关系,需要通过关键词、代表文本和中心相似关系进行匹配。表示或聚类参数发生变化时,也可能造成表面上的“议题变化”。

3.6 聚类结果怎样评价

没有参考标签时,可以检查轮廓系数等内部指标,同时阅读代表文本、边界文本和离群文本,判断簇的内部一致性、簇间差异及命名的合理性。还应比较不同初始化、参数或抽样下的稳定性。

有参考分组时,可以使用ARI、NMI等指标比较划分的一致程度。精确率和召回率也可以用于特定的簇与参考类匹配方案,或成对关系评价,但必须说明评价单位与匹配规则。

聚类形成的是基于所选特征的分组。 给簇命名属于研究者的解释工作,需要原文支持。

四、文本分类:识别预先定义的类别

4.1 类别体系与编码本

文本分类学习输入文本到已知类别的映射。它可以用于新闻栏目识别、诉求归类、评论类型编码,也可以用于情感或立场标签预测。

常见任务包括二分类、多分类、多标签分类和层级分类。例如,“价格太贵,晚上还买不到饭”同时涉及价格和营业时间。如果研究允许保留多个诉求,应设置多标签任务,或者先按观点片段拆分文本。

编码本至少应包含类别定义、纳入与排除条件、正反例、边界样本处理规则,以及无法判断时的处理方式。可以让两名标注者独立编码一部分文本,检查分歧并修订规则,随后建立经复核的参考标签。

4.2 朴素贝叶斯:根据词项证据比较类别概率

朴素贝叶斯依据贝叶斯公式计算文本属于不同类别的相对可能性,并使用“给定类别时特征条件独立”的简化假设。

对词项计数向量,常见的多项式模型可以写为:

\[\hat c=\arg\max_c\left[\log P(c)+\sum_j x_j\log P(w_j\mid c)\right]\]
其中,P(c)是类别先验概率,x_j是词项计数,P(w_jc)表示类别c中词项出现的条件概率。平滑处理可以避免某个词从未出现导致概率为零。

伯努利模型关注词项是否出现,多项式模型关注词项计数。两者通常都使用词袋假设,不直接建模完整词序。

例如,“涨价”“收费”“负担”可以为价格诉求类提供证据。朴素贝叶斯训练与预测成本较低,适合作为教学基线。但词项独立假设难以充分处理否定、转折和长距离语义,模型给出的概率也需要谨慎解释。

4.3 支持向量机:学习类别之间的分界

支持向量机通过学习分类边界,将不同类别区分开。在线性情形下,边界可以表示为:

\[w^\top x+b=0\]

它在分类间隔与训练误差之间进行权衡。软间隔允许部分样本违反间隔约束,参数C控制相应惩罚程度。C的最佳取值需要验证,不能简单理解为越大越好。

核方法使用核函数计算隐式特征空间中的内积,可用于学习非线性边界。文本本身往往具有高维特征,因此可以先比较线性SVM基线,再根据证据决定是否使用更复杂的核。

多分类常用一对多或一对一策略。一对多对K个类别训练K个分类器,一对一训练K(K−1)/2个分类器。决策分数表示相对分类依据,不能直接当作经校准的类别概率。

4.4 KNN与类中心分类

KNN寻找待分类文本最接近的K个已标注样本,通过多数投票或距离加权判断类别。它便于用相似原文解释判断依据,但预测时需要近邻搜索,且容易受表示、距离、K值和类别分布影响。

KNN中的K是邻居数量,K-means中的K是簇数量,两者的任务不同。

Rocchio类中心方法的基本过程是:先计算各已知类别的中心向量,再把新文本分配给最相近的类中心。它结构简单,但当一个类别包含差异很大的子主题时,单个中心可能不能充分代表该类别。

4.5 决策树与组合分类器

决策树通过一系列特征条件进行分支判断。常见划分依据包括信息增益、信息增益率与基尼不纯度。限制树深、设置叶节点最小样本数及剪枝可以控制模型复杂度。

例如,研究者可以用“是否包含价格表达”“是否包含时间表达”等特征建立直观的诉求分类示例。对于高维稀疏文本,单棵树可能不稳定,应通过验证比较其效果。

Boosting依次训练多个弱分类器,并按具体算法的规则关注前一阶段难以处理的样本,将它们组合用于预测。组合模型的收益仍需独立评价,标签噪声也可能影响结果。

4.6 神经网络文本分类的拓展

神经网络可以在词或子词表示上学习任务特征。以CNN文本分类为例,一般流程包括将文本转为序列、构建嵌入表示、提取局部模式、池化并输出类别。

“非常不满意”等局部表达可以作为理解卷积特征的例子。但深度模型同样需要关注标注质量、数据分布、训练成本和可解释性,应与传统基线在同一测试集上比较。

所提供的“04-CNN文本分类-checkpoint.ipynb”主要展示新闻类别分布、token分布、长度统计及训练测试数据的分布比较,适合作为建模前数据诊断材料。不能根据文件标题将它视为已经完成CNN训练和评价的实验。

4.7 主要分类方法比较

方法判断依据教学价值主要注意事项
朴素贝叶斯类别先验与词项条件概率理解概率分类,建立快速基线独立假设、平滑、领域差异
线性SVM学习具有间隔的分类边界理解高维文本分类正则化、类别不平衡、分数解释
KNN已标注近邻的类别用相似案例理解预测相似度、K值、搜索成本
类中心方法文本与已知类中心的接近程度对照聚类与分类类内异质性
决策树逐级条件规则展示可解释判断路径深度、剪枝、稀疏特征
Boosting多个分类器的组合理解集成思想参数与标签噪声
神经网络从序列表示学习分类特征理解自动特征学习数据、算力与独立验证

五、情感分析:识别针对对象的表达

5.1 情感、情绪与立场

情感分析的定义应与研究问题保持一致。正负极性、具体情绪及针对某个议题的立场属于不同标签体系。

任务典型输出示例与说明
主客观识别主观表达、客观陈述“营业时间延长两小时”是事实性表述,但可能与评价共同出现
情感极性识别正向、负向、中性或混合“新的菜单很不错”表达正向评价
情绪识别愤怒、悲伤、喜悦等“太气人了”可能表达愤怒,标签取决于所用体系
立场识别支持、反对、未表态等“我反对涨价”明确指向价格调整
情感强度分析强度分值或等级需要定义强度含义和标注规则

“我很担心,但支持这次调整”可以同时表达担忧与支持。新闻报道引用他人的负面评价,也不等于报道作者表达相同态度。因此,应识别观点持有者和评价对象。

5.2 基于词典的情感计算

词典方法把词项映射为极性或情绪标签,再按文本结构进行组合。简化的极性评分可以写为:

\[S(d)=\sum_i p(w_i)\,a_i\,n_i\]

其中,p(w_i)表示词项的基础极性,a_i表示程度权重,n_i表示否定等规则带来的调整。该式用于说明规则思想,实际应用还需要界定作用范围和冲突处理。

可结合“0-sentiment-analysis-with-dict.ipynb”讨论情感词、否定词、程度词及句子划分。课堂示例包括:

  • “满意”与“非常满意”:极性相近,表达强度不同。
  • “满意”与“不满意”:否定结构改变评价。
  • “不太满意”:否定与程度的组合不能机械处理。
  • “真不错,又涨价了”:表层词典可能与反讽含义冲突。
  • “菜品不错,但价格难以接受”:不同方面具有不同极性。

词典方法容易检查命中词及规则,适合建立可解释的初步方案。其限制包括领域词义变化、词典覆盖不足、网络新词、反讽、转折和否定作用域。

评分为零可能表示没有命中情感词,也可能表示正负分值抵消。只有按照标签定义完成检验后,才可以把它解释为中性。

5.3 多情绪词典与词典扩展

“1-emotion-dict.ipynb”与“2-NRC-Chinese-dict.ipynb”展示了读取情感词汇表、中文词典与匹配统计的思路。研究者可以得到某些情绪词出现的次数或比例,但这些统计首先反映词典命中情况。

它们与“多少用户表达了愤怒”之间还隔着分析单位、上下文判断和人工验证。一个文本可能命中多个情绪类别,同一词项也可能在不同语境中具有不同含义。报告时应明确分母是词项、文本还是用户。

可以使用PMI方法扩展情感词典,其基本思想是比较候选词与正向、负向种子词的共现关联:

\[\operatorname{PMI}(w,s)=\log\frac{P(w,s)}{P(w)P(s)}\]

通过两组关联强度的差异,可以获得候选词的倾向线索。但低频词、共现窗口、种子词选择与语料领域都可能影响结果,应人工复核扩展词项。

5.4 监督情感分类

监督情感分类将人工标注的情感标签作为学习目标。它可以沿用TF-IDF与朴素贝叶斯、SVM等方法,也可以使用神经网络。模型是否适合校园服务讨论,需要在这一领域的独立样本上检验。

“4-sentiment-classifier.ipynb”包含TF-IDF、GaussianNB、SVC及其他工具的示例。用于词项计数或非负稀疏文本特征时,可在教学中比较多项式朴素贝叶斯基线。GaussianNB使用连续特征的高斯分布假设,需要说明这一假设与输入特征的关系。小规模示例上的分类结果不足以说明真实舆情任务的表现。

“3-textblob.ipynb”展示TextBlob与SnowNLP的便捷使用方式。课堂可以让学生观察同一句子在不同工具中的输出,并分析语言、对象和领域的影响。工具分数的含义应依据工具接口说明及独立验证来解释。

5.5 方面情感与观点结构

对多对象、多方面文本,可以将一条观点整理为:

\[(\text{对象},\text{方面},\text{情感倾向},\text{观点持有者},\text{时间})\]

“价格贵了,但营业时间延长挺方便”可以形成两条记录:

对象方面倾向持有者时间
食堂服务调整价格负向评论作者发布时间
食堂服务调整营业时间正向评论作者发布时间

这样可以保留同一文本内部的评价差异。它也意味着任务复杂度增加:模型需要识别对象、方面及其对应情感,评价时应分别检查这些步骤。

5.6 跨领域与跨时间使用

模型学习到的词项关系与训练语料有关。产品评论、新闻报道和校园帖子在文体、对象和标签分布上都有差异。即使领域相同,新出现的网络表达也可能改变原有规则的效果。

迁移使用前,应抽取目标领域样本重新评价,必要时修订词典、标签或模型。文本结果应解释为观测到的表达特征,推断个人持续心理状态需要额外证据。

六、内容分析与社会网络分析的结合

6.1 文本簇与网络社区

文本簇依据内容特征分组,网络社区依据节点连接结构分组。同一议题可能跨越多个社区,同一社区也可能讨论多种议题。

可以将GN、模块度优化、标签传播等方法作为社区识别的拓展。GN通过逐步移除高边介数的边形成分组。模块度方法比较社区内部连接与指定空模型的预期连接。标签传播使用邻居标签更新节点归属,结果可能受更新顺序和随机性影响。CPM等重叠社区方法允许节点参与多个群体。

网络中的“标签传播”是一类社区算法名称,不能据此把其输出直接解释为人工定义的文本类别。

6.2 网络构建先于社区解释

研究者应明确节点与边:用户节点可以通过回复、转发或提及连接,词语节点可以通过共现连接,文本节点可以通过相似度阈值连接。这些网络回答的问题不同。

例如,转发边可能表示支持,也可能表示批评或信息搬运。回复边表示存在互动,未必表示关系认同。由文本相似度构建的网络,其社区结果仍依赖内容表示和阈值。

6.3 内容、群体与时间的联合分析

获得文本标签与社区归属后,可以比较各社区的议题分布、情感表达和跨社区连接。汇总时应区分文本数量、独立用户数量与互动数量,避免少数高频账户主导结论。

两个社区同时出现相似表达,可以构成传播研究的线索。但判断传播方向、情绪影响或因果机制,还需要时间顺序、互动路径及适当的研究设计。

6.4 传播动力学和链接预测的边界

SI、SIS、SIR和SIRS用不同状态转换描述传播过程。用于舆情研究时,必须重新定义“尚未接触”“参与传播”“退出传播”等状态,并检查固定人口、接触机制和状态转换参数等假设。

阅读信息、相信信息和转发信息属于不同过程,不能仅凭同一状态标签混为一谈。此类模型适合提出和检验机制假设,不宜直接替代实际传播记录。

链接预测估计未来或未观测连接的可能性。连接形成、信息到达与态度变化分别需要不同证据。本讲将这些方法作为文本分析的关联拓展,具体建模可放入后续社会网络专题。

七、模型评价与错误分析

7.1 分类指标

以某一类别作为正类,TP是真正例,FP是假正例,FN是假负例,TN是真负例:

\[\operatorname{Precision}=\frac{TP}{TP+FP},\qquad \operatorname{Recall}=\frac{TP}{TP+FN}\] \[F1=\frac{2PR}{P+R},\qquad \operatorname{Accuracy}=\frac{TP+TN}{TP+TN+FP+FN}\]

精确率表示模型判为该类的文本中有多少正确,召回率表示真实属于该类的文本中有多少被找出。准确率与精确率应分别报告,不能混用名称。分母为零时需要说明计算处理方式。

例如,100条评论中只有10条属于投诉,模型把所有评论都判为非投诉,准确率仍为90%,投诉召回率却为0。因此,单一总体准确率可能掩盖研究关注类别的失败。

7.2 宏平均与微平均

宏平均F1先计算各类别F1,再取算术平均,使各类别具有相同权重。微平均先汇总各类别的TP、FP和FN,再计算指标,样本多的类别影响较大。在通常的单标签多分类且纳入全部类别的情况下,微平均F1与准确率相同。

建议至少报告各类样本量、各类精确率与召回率、宏平均F1及混淆矩阵。指标选择应与研究错误成本一致。例如,发现稀少风险表达时,应重点检查相关类别的召回率,并同时关注误报。

7.3 误判原文的阅读

错误分析可以按以下类型组织:标签边界不清、否定与转折、反讽、隐含对象、多方面混合、领域新词、引用与作者态度混淆,以及训练测试分布差异。

每种错误选择若干原文,记录参考标签、预测标签、分歧原因与修订措施。改动标签、词典、表示或模型后,应使用适当的验证集检查改进,最终测试集保留到方案确定后使用。

7.4 模型效果与研究有效性

高分类分数仍可能对应一个设计不当的标签体系。研究评价还应检查:标签是否测量了研究概念,样本是否覆盖目标讨论,结果是否受到重复文本或平台缺失的影响,以及测量误差是否改变了群体或时间比较。

论文和报告应把模型质量、数据覆盖与研究推断分别说明。

八、课堂实践:同一批评论的三种分析

8.1 实践任务

使用经脱敏、允许用于教学的评论样本。建议准备200至500条文本作为课堂练习规模,具体数量随课时调整。

  1. 探索分组:用统一表示比较若干K值的聚类结果,阅读代表文本并命名,保留无法解释的簇。
  2. 建立分类:从探索结果与研究问题中制定诉求编码本,独立标注并复核样本,划分数据,比较朴素贝叶斯与线性SVM。
  3. 分析情感:明确评价对象,对比词典结果与人工标签,检查否定、反讽及混合评价。
  4. 形成解释:结合发布时间比较议题和情感分布,同时说明样本覆盖与误差。存在关系数据时,再加入社区对比。

8.2 notebook的使用安排

提供的材料适合课堂使用的部分使用边界
朴素贝叶斯notebook词项表示、概率估计与简单文本判断小型例子主要用于理解原理
决策树notebook构造、纯度、剪枝与预测流程包含鸢尾花、房价和泰坦尼克等例子,需要另建文本输入
SVM notebook特征、划分、标准化与分类流程示例使用肿瘤数据,不能视为文本分类实证
KNN notebook近邻分类与方法比较示例使用手写数字,需要更换为文本表示
CNN标题的notebook新闻类别、token与长度分布诊断所见内容主要为探索分析,未提供完整CNN训练评价流程
情感词典notebook词汇表读取、规则匹配与情绪统计必须验证作用范围、上下文与统计分母
TextBlob、SnowNLP示例比较便捷工具的输出输出需要目标语料验证
情感分类notebookTF-IDF、分类器及特征组合小样本、外部路径和环境依赖需要整理

TEXTCLASSIFICATION与“文本分类pynb”中的决策树、朴素贝叶斯、SVM和KNN主notebook文件相同,课堂可以选一套使用。不能仅按文件数将其视为独立实验。

本讲整理了材料中的方法与示例,没有执行这些notebook,也不把其中保存的输出当作本课程项目的验证结果。

8.3 课堂讨论

  • 同一文本能否同时属于多个诉求类别?应调整标签还是分析单位?
  • 某个簇中“涨价”出现频率很高,能否直接命名为“反对涨价”?
  • 一条评论没有命中负向词,能否判为正向或中性?
  • 回应后负向评论比例下降,哪些因素可能影响这一比较?
  • 某社区互动密集且表达相近,现有数据能支持哪些判断?

8.4 课后任务与提交内容

围绕自己的新闻或舆情项目,提交一份模型方法说明及可检查的分析记录,包含研究问题、分析单位、数据范围、编码本或聚类参数、表示方式、评价方案、误判原文与结论边界。

至少比较两种方案,例如两个分类器、两种表示,或词典情感与监督情感分类。所有方案使用可比的数据范围和评价标准。无法运行模型的同学可以提交人工编码与建模设计,但应明确完成程度。

评价重点是任务定义是否清楚、判断依据是否可追溯,以及分析结果能否支持研究问题。模型复杂程度和单一分数不作为唯一标准。

九、建议教学安排

以下按4课时、每课时45分钟设计:

课时内容课堂产出
第1课时任务区分、共同流程、相似度与聚类为案例选择分析单位,比较分组
第2课时编码本与主要分类器制定标签规则,解释分类依据
第3课时词典与监督情感、方面情感阅读规则错误,整理对象与方面
第4课时评价、网络拓展与综合实践形成方法比较和证据边界说明

课时有限时,重点保留K-means、朴素贝叶斯、线性SVM、词典情感与评价。密度峰值、数据流、神经网络和传播模型可作为阅读拓展。

十、概念辨析与实践注意事项

建模与阅读实验结果时,应注意以下概念和判断:

  • Precision译为“精确率”或“查准率”,Accuracy译为“准确率”,Recall公式为TP/(TP+FN)。
  • 多项式朴素贝叶斯的词袋模型统计词项计数,不保留完整词序。
  • SVC与LinearSVC用于分类,SVM回归使用相应回归模型。
  • 一对一多分类需要K(K−1)/2个二分类器,不能泛称比一对多的分类器数量少。
  • 聚类评价需要说明参考标签与比较单位,不能把分类指标直接套到无标签分组。
  • 进行KS检验时,若p值为0.528,在0.05水平下应表述为未拒绝原假设,不能据此证明两个数据集的分布相同。

复用代码前,还应检查本地数据路径、依赖与接口,并验证实际运行环境。


← 返回课程主页 · 上一讲:理论基础与研究设计