第3讲:新闻与舆情数据学主要分析方法
传媒大数据专业,大三上, 新闻与舆情数据学, 2026
新闻与舆情数据分析研究的是:谁在什么时间、什么平台,围绕什么对象和事件,表达了什么观点,这些表达如何传播、变化,并产生何种可观察结果。 文本处理与机器学习提供计算工具,新闻传播理论提供问题和解释框架,人工核验与研究设计决定结论是否可信。
本讲义系统介绍文本预处理、词义消歧、文本表示、数据融合、分类、聚类、数据流与网络分析,以及主题模型、情感与立场、框架分析、动态监测、统计推断、大模型辅助研究和多模态分析,贯穿从研究设计到结果解释的完整流程。文中的示例均为教学构造,不对应真实事件或学生评价。
目录
- 方法体系与研究设计
- 数据获取、抽样与质量控制
- 中文文本预处理
- 词义消歧、实体识别与数据融合
- 文本表示与语义检索
- 特征选择、降维与平滑
- 描述统计、关键词与共现分析
- 文本分类方法
- 分类评价与误差分析
- 文本聚类方法
- 聚类评价与主题发现
- 内容分析、框架与叙事分析
- 情感、情绪与立场分析
- 时间序列、事件演化与预警
- 数据流分析与在线聚类
- 社会网络与传播路径分析
- 信息抽取、事件图谱与知识图谱
- 跨平台比较与多源证据整合
- 统计检验、解释模型与因果识别
- 大模型辅助编码、摘要与检索增强
- 多模态分析与信息核验
- 典型应用与方法组合
- 完整研究示例
- 方法选择、成果组织与质量检查
- 核心概念辨析与参考资料
1. 方法体系与研究设计
1.1 从问题到证据
研究不能从“我要使用某算法”开始,而应从可回答的问题开始。例如,“分析某平台舆情”还不够明确;“某项校园服务调整公布前后,学生对收费公平性的讨论比例和责任归因如何变化”才明确了对象、时间、变量和比较关系。
| 研究层次 | 主要问题 | 常用方法 | 可交付证据 |
|---|---|---|---|
| 描述 | 讨论了多少、谁在讨论、何时集中出现 | 频数、比例、分布、交叉表、时间趋势 | 带分母的统计表与趋势图 |
| 发现 | 存在哪些未知议题、表达类型或社群 | 聚类、主题模型、共词网络、社区发现 | 主题结构、代表文本、社群特征 |
| 识别 | 一条内容属于哪种类别 | 文本分类、规则匹配、序列标注 | 标签、证据片段、分类性能 |
| 解释 | 群体、媒体或阶段之间有何差异 | 内容分析、框架分析、回归、比较研究 | 差异大小、解释依据、不确定性 |
| 预测 | 后续热度、类别或风险会怎样变化 | 时序预测、监督学习、在线监测 | 时间外测试结果、误报与漏报 |
| 因果 | 某行动是否改变了结果 | 实验、准实验、事件研究等 | 识别假设、对照关系、效应估计 |
| 决策支持 | 哪些问题需要优先核验与回应 | 多指标研判、证据汇总、人工复核 | 问题清单、证据链、处理优先级 |
分类预测准确,不意味着解释成立;两个变量相关,不意味着存在因果关系;话题热度高,不意味着多数公众支持;公开平台表达,也不等于全体公众态度。
1.2 明确分析单位
常见单位包括词、句子、段落、新闻、评论、用户、媒体机构、传播边、事件和时间窗口。同一问题可以使用多个层次,但必须明确数据如何聚合。
- 文本单位:适合识别议题、情感、立场和框架。
- 用户单位:适合比较参与者差异,避免高频发言者被重复计算为更多公众。
- 事件单位:适合比较事件特征及传播差异。
- 关系单位:适合研究转发、引用、回复、合作和共现。
- 时间单位:适合分析趋势、滞后、阶段变化与预警。
“负面评论占比”和“发表过负面评论的用户占比”有不同分母,不能互换。“转发次数”和“独立传播者人数”也不能互换。
1.3 理论概念的操作化
操作化是把抽象概念转成可观察、可重复测量的变量。
| 抽象概念 | 可操作变量举例 | 解释边界 |
|---|---|---|
| 关注度 | 文本量、独立参与者数、可获得的曝光量 | 发帖量只代表可观测表达量 |
| 争议程度 | 支持与反对分布、论点分歧、回复对立 | 情绪强度不能单独替代争议 |
| 传播广度 | 独立传播用户数、覆盖社群数、跨平台出现情况 | 受平台数据可见性影响 |
| 传播深度 | 可观测级联的最大深度、平均深度 | 缺失父节点会低估深度 |
| 信任表达 | 对指定机构的信任/怀疑表述 | 文本表达不能直接替代长期信任水平 |
| 回应效果 | 回应后问题解决表达、信息纠正、态度变化 | 自然衰减和同期事件可能构成混杂 |
建立变量字典,记录名称、定义、单位、取值、缺失编码、计算方式和来源。对于“舆情风险”“影响力”等综合概念,先分解维度,再决定是否合成指数。
1.4 通用研究流程
研究问题与理论 → 确定样本边界 → 获取与记录数据
↓
清洗、去重、消歧、融合 → 人工探索与编码规则
↓
文本表示 → 分类/聚类/主题/网络/时序分析
↓
性能评价、人工核验、稳健性与误差分析
↓
解释结果、回答问题、说明边界 → 保存可复现材料
探索性研究可以迭代问题和编码,但应记录调整。验证性研究应预先明确假设、主要变量和评价标准,避免只保留显著或符合预期的结果。
2. 数据获取、抽样与质量控制
2.1 数据类型
新闻与舆情数据通常包括新闻正文及元数据、评论和回复、转发引用关系、账号公开属性、平台互动计数、图片视频音频、政策公告以及线下事件资料。新闻数据库适合研究媒体议程;评论适合研究可见受众表达;传播链适合研究信息扩散。三者不能互相替代。
数据获取可以采用授权接口、数据库导出、公开网页采集、问卷、访谈或研究者自行标注。只收集回答研究问题所需的信息,保存来源和采集时间,对公开展示的普通用户信息做适当去标识化。
2.2 检索式与样本边界
- 明确事件、主体、时间、平台与语言范围。
- 建立关键词组:正式名称、简称、别名、俗称、拼写变体、相关议题词。
- 加入排除词,人工查看误命中和漏命中。
- 保存每版检索式、查询日期、分页和排序方式。
- 报告平台返回上限、不可访问内容和其他覆盖限制。
只使用事件名称容易遗漏泛化讨论;只使用“愤怒”“投诉”等情绪词,会人为放大负面表达。检索式应服务于研究对象,而不是预先制造研究结果。
2.3 抽样方法
| 方法 | 适合情况 | 主要限制 |
|---|---|---|
| 简单随机抽样 | 已掌握明确的数据总体 | 总体清单可能不完整 |
| 分层抽样 | 比较平台、阶段、媒体类型、热度层级 | 总体估计可能需要按抽样概率加权 |
| 系统抽样 | 按规则从有序清单抽取 | 周期性排序可能引入偏差 |
| 整群抽样 | 按新闻、话题或事件抽取评论群 | 群内相关使有效样本量降低 |
| 目的抽样 | 机制分析、关键案例与反例比较 | 不能据此估计总体比例 |
| 滚雪球抽样 | 追踪传播链和关联主体 | 受种子节点和可见关系限制 |
热搜、热门评论、点赞前列属于平台筛选结果,不能当作随机样本。分析热门内容本身是合理问题,但需把研究范围写为“热门评论中的表达”。
2.4 建议保存的数据字段
doc_id, source_platform, source_url, collected_at,
published_at, updated_at, author_id_hash, text_raw,
text_clean, parent_id, repost_source_id, event_id,
like_count, reply_count, repost_count, metric_observed_at,
language, duplicate_group_id, annotation_version
互动计数会随时间变化,应记录观测时点。发布时间、事件发生时间和采集时间应分开保存;时区应统一。无法获得的字段标记为缺失,不能自动填成零。
2.5 质量检查
检查完整性、唯一性、一致性、有效性、时效性和覆盖范围。例如:同一URL是否重复;发布时间是否晚于采集时间;评论是否缺失正文;多个平台的“阅读量”是否同义;爬取中断是否造成某天数据突然降低。
对于转载新闻,建议保留两个视图:去重后的内容视图用于议题分析,保留传播记录的视图用于扩散分析。直接删除全部重复内容会丢失传播证据,全部保留又会使高频转载议题主导文本模型。
3. 中文文本预处理
3.1 基本步骤
文本预处理的目标是减少与任务无关的噪声,同时保留判断所需信息。建议按以下顺序执行:
- 提取标题、正文、评论、引用和元数据,避免把导航栏、广告当成正文。
- 统一字符编码、空白和必要的全半角形式。
- 检测精确重复、近似重复和转引关系。
- 按任务处理URL、表情、标签、账号提及、数字和标点。
- 分句、分词或使用字级表示。
- 识别实体、短语、否定、程度和引用范围。
- 生成不同分析任务需要的文本版本。
原始文本应保留,清洗结果另存。不能让不可逆清洗破坏后续复查。
3.2 中文分词与任务词典
中文分词把连续字符划分为词语。词典方法依赖词表,统计方法依据序列规律,神经方法通过训练学习边界。对于课程项目,更关键的是人工检查领域词、人名、机构名、缩略语和网络新词。
例如,“自动驾驶责任认定”可以切分为“自动驾驶/责任认定”,也可以细分;不同粒度会影响词频和主题解释。应根据研究问题建立自定义词典,并报告其版本。
字级n-gram可以减少分词错误的影响,适合作为中文短文本分类基线;代价是特征解释可能不如完整词语直观。不能把英文默认空格切词直接当作中文分词。
3.3 停用词与保留词
停用词通常包括部分高频功能词、格式词和任务无关词,但必须按任务调整。
- 主题发现可以考虑删除泛化词和格式噪声。
- 情感与立场分析应保留“不”“未”“并非”“但是”等否定与转折词。
- 传播研究可能需要保留“转发”“引用”和账号提及。
- 时间、金额、地点和数量可能是事实核验的关键,不能统一删除数字。
- 表情、问号、重复标点可能表达情绪或反讽,应转换为可分析特征或保留原文。
“这次处理并不差”和“这次处理差”的判断方向不同,删除否定词会直接改变语义。
3.4 规范化与去重
同义词归并应有明确边界。“新能源汽车”和“电动车”在部分语境相近,但后者也可能指两轮电动车,不能无条件合并。繁简转换、缩写展开和错别字纠正同样需要记录规则。
去重常用方法包括:精确文本哈希、标准化后哈希、字符n-gram的Jaccard相似度、SimHash、MinHash和句向量相似度。阈值需要人工抽检,避免把表达相似但立场相反的文本合并。
3.5 上下文与引用处理
一条“说得真好”可能是赞同,也可能是反讽;“有人说这是骗局”可能是转述,不代表作者认同。处理评论时尽可能保留父评论、新闻标题和被评价对象。编码时区分作者表达、引述表达和新闻叙述。
4. 词义消歧、实体识别与数据融合
4.1 词义消歧
词义消歧(Word Sense Disambiguation,WSD)根据上下文确定多义词的具体含义。例如,“苹果发布新产品”与“苹果价格上涨”中的“苹果”可能属于不同对象。
形式上,可写为:
\[\hat{s}=\arg\max_{s\in S(w)}P(s\mid w,c)\]其中,$S(w)$是候选词义集合,$c$是上下文。输出依赖词义集合的粒度;没有被收录的新义可能无法正确识别。
| 方法 | 核心思路 | 优点 | 局限 |
|---|---|---|---|
| 词典与知识库方法 | 将上下文与词义释义、关系匹配 | 标注需求较少、便于解释 | 受词典覆盖和词义粒度影响 |
| Lesk及扩展 | 比较上下文与候选释义的词语重叠 | 简单、适合教学演示 | 短上下文和同义表达会削弱重叠 |
| 选择偏好/搭配 | 利用动词、宾语等语义搭配约束 | 能利用句法和语义角色 | 跨领域、隐喻和新表达较难 |
| 概念图与语义相似度 | 根据知识图谱路径或关系计算接近程度 | 可利用结构知识 | 路径短不必然意味着语义最合适 |
| 上下文聚类 | 将词的不同上下文表示聚类 | 可发现未预设用法 | 聚类结果仍需人工解释 |
| 词聚类与共现图 | 根据搭配、句法关系或图社区发现用法 | 能利用大规模未标注语料 | 易把主题差异当成词义差异 |
| 监督学习 | 用标注样本训练决策树、KNN等 | 任务定义明确时可评价 | 需要词义标注和领域适配 |
| 上下文语言模型 | 用上下文表示完成候选词义匹配或预测 | 能表达较复杂语境 | 仍需测试,不能保证理解反讽与新义 |
Markov聚类、HyperLex等可理解为利用共现图结构诱导词义的思路。实际选用时应检查图的构建单位、边权和剪枝规则。
4.2 命名实体识别、实体消歧与实体链接
三个任务分别回答:文本哪里出现实体、两个名称是否指同一实体、这个名称对应知识库中的哪一条记录。
- 命名实体识别(NER):识别人名、机构、地点、产品等文本片段。
- 实体消歧/记录链接:区分同名异人、同名企业,合并同一对象的别名记录。
- 实体链接:将提及映射到稳定的实体ID,并允许“知识库中无对应实体”。
可使用别名字典、规则、序列标注、预训练模型和人工校验。对于“某大学的张某”,姓名相同远远不足以确认身份,还需机构、研究方向、时间、合作者等证据。
4.3 实体匹配方法
匹配特征可以包括名称编辑距离、简称一致性、地址相似度、时间兼容性、机构关系、文本语义相似度和可靠标识符。基本加权形式为:
\[\operatorname{score}(a,b)=\sum_{j=1}^{m}w_j\operatorname{sim}_j(a,b)\]缺失属性不应简单当作“不一致”;权重应通过人工样本或领域依据确定。候选对很多时,可先按地区、名称前缀或机构进行分块,再做精细匹配,但应检查分块是否漏掉真正匹配。
Fellegi–Sunter方法将不同属性的一致与不一致视为匹配证据,用匹配与非匹配条件下的概率比构造分数,再划分匹配、非匹配和人工复核区间。主动学习可以优先送审接近边界、信息量较大的候选对。
4.4 数据融合与冲突处理
融合包括模式对齐、实体对齐、属性整合和来源追踪。常见冲突包括字段名不同、单位不同、类别标准不同、同名异义、更新时间不同和事实主张互相矛盾。
| 冲突类型 | 示例 | 处理方式 |
|---|---|---|
| 格式与单位冲突 | 日期格式不同;金额单位不同 | 格式与单位标准化 |
| 模式冲突 | 一个表按文章存储,另一个按评论存储 | 明确实体层级与连接键 |
| 语义冲突 | “热度”分别代表检索指数和互动量 | 保留原定义,避免直接相加 |
| 身份冲突 | 企业简称相同 | 多属性消歧、人工复核 |
| 时间冲突 | 两个来源记录不同任职单位 | 保留有效时间,不一定互相否定 |
| 事实冲突 | 两个来源对事故原因说法不同 | 保留各自主张、证据与核验状态 |
建议保存“实体—属性—值—来源—发布时间—有效时间—核验状态”。多数网页重复同一说法并不等于独立证据充分;复制链上的多个来源可能只来自一个原始出处。
5. 文本表示与语义检索
5.1 文档—特征矩阵
设有$n$篇文档和$p$个特征,构建矩阵$X\in\mathbb{R}^{n\times p}$。行是文档,列可以是词、字串、主题或向量维度。词袋矩阵往往高维稀疏,因为单篇文档只使用整个词表中的少量词。
5.2 One-hot、词袋与n-gram
One-hot把一个词表示为只有对应位置为1的向量。它表达身份,不直接表达词义接近程度。文档级词袋则对词出现与否或出现次数进行汇总,两者相关但不是同一层次的表示。
词袋模型(BOW)忽略大部分词序,适合词频统计和传统分类基线。n-gram保留局部连续组合:bigram只指连续两项,unigram+bigram才是同时包含单项和两项。
例如,“不/支持/涨价”的词级bigram为“不 支持”“支持 涨价”。字级n-gram可以捕捉未登录词、短语片段和网络表达,但会增加特征数量。
5.3 TF-IDF
TF-IDF衡量词在某文档中的出现程度,以及其在语料中的区分能力。一种常见定义为:
\[\operatorname{tfidf}(t,d)=\operatorname{tf}(t,d)\times\operatorname{idf}(t)\] \[\operatorname{idf}(t)=\log\frac{N+1}{\operatorname{df}(t)+1}+1\]其中,$N$为文档总数,$\operatorname{df}(t)$为包含词$t$的文档数。TF可以使用原始计数、相对频率或对数频率,实际实现应说明定义与是否进行向量归一化。
IDF是逆文档频率,不代表“词出现次数”。稀有词可能区分度高,也可能是错别字、账号ID或噪声。TF-IDF适合关键词、相似度和分类基线,但不能直接判断事实重要性、情绪或立场。实现细节可参见scikit-learn文本特征提取文档。
5.4 静态词向量
Word2Vec、GloVe和fastText将词映射到低维连续空间。
- Word2Vec CBOW:根据上下文预测中心词。
- Word2Vec Skip-gram:根据中心词预测周围词。
- GloVe:利用全局词共现统计学习向量。
- fastText:利用词内部字符片段,有助于处理部分未登录词和词形信息。
Word2Vec的模型设计可参见Mikolov等,2013。
词向量接近表示训练语料中的某种分布相似,不意味着逻辑等价。反义词也可能因上下文相似而接近。静态词向量通常为一个词提供一个表示,因此难以充分区分多义词。
文档可以由词向量均值、TF-IDF加权均值或专门的文档模型表示。简单平均容易弱化否定、顺序和少数关键信息。
5.5 上下文表示与句向量
上下文模型根据具体句子生成词的表示,同一词在不同语境可以获得不同向量。BERT类模型可用于分类和序列标注;用于句间相似度时,通常需要合适的句向量模型及池化方式,不能假定任意模型输出都适合余弦比较。BERT原论文
Sentence-BERT通过句对训练等方式构造适合句子比较的表示,常用于语义检索与聚类。不同模型的语言、领域、文本长度和训练目标不同,中文舆情仍需本地样本验证。Sentence-BERT原论文
长新闻可按段落切分后检索、聚合,或使用适合长文本的模型。切分需保留标题、段落顺序和引用位置,避免一句判断失去上下文。
5.6 稀疏检索、稠密检索与混合检索
| 方法 | 主要依据 | 优势 | 局限 |
|---|---|---|---|
| 关键词/布尔检索 | 精确词项及逻辑关系 | 可控、便于复现 | 易漏掉同义表达 |
| TF-IDF相似度 | 加权词项重叠 | 简单、可解释 | 语义改写匹配有限 |
| BM25 | 词项匹配、词频饱和与长度校正 | 适合文档检索基线 | 仍依赖词项匹配 |
| 稠密向量检索 | 向量语义相似度 | 能匹配部分同义改写 | 可能忽略数字、否定和精确名称 |
| 混合检索与重排序 | 结合词项、向量和候选精排 | 兼顾精确词与语义 | 需要单独评价检索效果 |
检索任务可用Recall@K、MRR、nDCG等评价。检索到相似文本不等于找到真实证据;证据还需核对来源、时间、对象和事实内容。
6. 特征选择、降维与平滑
6.1 特征选择
特征选择保留原特征中的一部分,便于解释和减少噪声。
- 频率与文档频率过滤:删除极少出现或几乎处处出现的词,但要检查关键稀有事件词。
- 卡方检验、信息增益、互信息:衡量特征与类别的关联,适合有标签任务。
- 正则化选择:例如L1正则化使部分线性模型系数为零。
- 领域规则:保留特定实体、责任归因词、时间或行为词。
所有依赖数据估计的筛选步骤应在训练集内拟合。在全部数据上挑选与标签最相关的词,再划分测试集,会造成信息泄漏。
6.2 主要降维方法
| 方法 | 原理与用途 | 解释注意 |
|---|---|---|
| PCA主成分分析 | 寻找保留较大方差的正交线性方向 | 无监督;方差大不等于议题重要;不相关不等于独立 |
| 截断SVD/LSA | 用低秩矩阵近似文档—词矩阵 | 常用于稀疏文本;维度未必容易命名 |
| 线性判别分析 | 利用标签使类间分离、类内紧凑 | 有监督;可用判别维度至多为类别数减一 |
| MDS多维尺度分析 | 使低维表示尽量保留给定距离关系 | 有多种版本,不能一概称为线性方法 |
| t-SNE | 重点保留局部邻域,适合可视化 | 图上簇间距离、大小和空白不能直接解释 |
| UMAP | 基于邻域结构构造低维表示 | 参数和随机性会影响图形及后续聚类 |
| 自编码器 | 通过重构目标学习压缩表示 | 需要训练与验证,压缩质量不等于研究效度 |
“LDA”有两种常见含义:Linear Discriminant Analysis,线性判别分析;Latent Dirichlet Allocation,潜在狄利克雷分配。前者主要用于监督判别和降维,后者是主题模型,不能混用。
可视化降到二维,是为了展示;为模型降维,是为了计算与泛化。两者目的不同。不能仅凭一张漂亮的t-SNE图宣称发现了稳定的社会群体。
6.3 稀疏性与维度问题
高维下距离可能失去区分力,参数估计需要更多样本,噪声特征容易干扰结果。处理方式包括改进特征、合理筛选、正则化、增加代表性样本和降维。把稀疏矩阵强行转为密集矩阵不会消除统计问题,反而可能耗尽内存。
6.4 概率平滑
平滑用于缓解未观察事件概率为零的问题,尤其常见于朴素贝叶斯和n-gram语言模型。
加法平滑示例:
\[P(w\mid c)=\frac{N_{wc}+\alpha}{N_c+\alpha |V|}\]| 其中$N_{wc}$为类别$c$中词$w$的计数,$N_c$为该类总词数,$ | V | $为词表大小,$\alpha>0$为平滑参数。 |
回退在高阶上下文不足时转向低阶模型;插值按权重组合多个阶数的概率;Good–Turing利用“出现若干次的事件有多少种”来调整计数。它们是相关但不同的概念。平滑是在改进概率估计,并不等同于降维或把文本矩阵变稠密。
7. 描述统计、关键词与共现分析
7.1 先建立数据全貌
至少统计文本数、独立用户数、时间跨度、来源分布、缺失比例、去重比例、文本长度和互动分布。互动量常高度偏斜,建议同时报告中位数、四分位数和必要的对数尺度图,避免只用均值。
比较不同阶段时,应同时给出数量和比例。例如负面文本从100条增至150条,但总量从200条增至500条,则负面数量增加、负面占比下降,这两个事实同时成立。
7.2 词频、关键词与特征词
- 词频回答什么词经常出现。
- TF-IDF关键词回答什么词对文档有相对区分力。
- TextRank等图排序方法利用词语共现结构寻找关键词或关键句。
- 对照语料特征词回答某阶段或群体相较另一组更偏好哪些词,可使用对数比率、对数似然等。
- KWIC语境索引展示关键词前后文,用于判断词频究竟代表何种用法。
词云只展示粗略频率,无法独立回答原因、立场或关系。重要关键词应结合原文例句、不同阶段和群体分布解释。
7.3 共现分析与关联规则
共现可定义在一个句子、一段、一篇文档或固定窗口内。窗口越大,越容易捕捉主题关联,越难说明直接语义关系。应报告窗口、是否去重计数和边权计算方式。
点互信息的一种形式为:
\[\operatorname{PMI}(x,y)=\log\frac{P(x,y)}{P(x)P(y)}\]PMI容易抬高稀有词对,因此需要最低频数等约束。共现网络中的边表示共同出现,不直接表示赞同、合作或因果。
关联规则可使用支持度$P(A\cap B)$、置信度$P(B\mid A)$和提升度$P(B\mid A)/P(B)$。高置信度可能只是因为$B$很常见;这些指标用于发现关联线索,不应解释为“A导致B”。
8. 文本分类方法
8.1 任务定义与基本流程
文本分类根据已有类别给新文本赋予标签。常见任务包括新闻栏目分类、投诉主题识别、情感判断、立场识别、事件相关性过滤、需要核验的主张识别等。
- 二分类:相关/不相关、包含投诉/不包含投诉。
- 多分类:从多个互斥类别中选一个。
- 多标签分类:一条评论可以同时涉及价格、服务和安全。
- 层次分类:先分政策、服务、产品,再进入下级类别。
- 开放集处理:允许未知类别或转人工,不强迫所有文本进入既有类别。
流程为:定义类别与边界 → 建立编码手册 → 人工标注 → 划分数据 → 构造特征 → 训练与调参 → 独立测试 → 分析错误 → 应用于完整数据。聚类可以帮助形成初始类别,但不能代替类别定义。
8.2 朴素贝叶斯
朴素贝叶斯根据贝叶斯公式估计类别,并作出给定类别后特征条件独立的简化假设:
\[\hat{c}=\arg\max_c P(c)\prod_{j=1}^{p}P(x_j\mid c)\]实现时常取对数,避免大量小概率相乘造成数值下溢。
多项式朴素贝叶斯适合词频等非负特征,其文档分类得分常写为:
\[\log P(c)+\sum_{w\in V}n(w,d)\log P(w\mid c)\]伯努利朴素贝叶斯使用词是否出现的二值特征,词出现和不出现都参与概率计算。多项式模型通常仍是词袋建模,不表示模型理解了词序。两种模型和补充朴素贝叶斯等变体的实现可参见官方说明。
优点是训练快、数据需求相对低、适合基线;局限是条件独立假设较强,否定、反讽和复杂语义难以处理,输出概率也不一定校准良好。
8.3 贝叶斯网络
贝叶斯网络用有向无环图表示变量之间的条件依赖,联合分布分解为:
\[P(X_1,\ldots,X_m)=\prod_{i=1}^{m}P(X_i\mid \operatorname{Pa}(X_i))\]可用于融合事件类型、信息来源、传播特征和内容标签,表达不确定性及进行概率推断。网络结构可以来自理论或数据学习,但普通概率网络的箭头不能自动解释为因果关系;因果解释需要额外设计和假设。
8.4 逻辑回归与最大熵分类
二分类逻辑回归用线性特征组合映射到概率:
\[P(y=1\mid x)=\sigma(w^Tx+b),\qquad \sigma(z)=\frac{1}{1+e^{-z}}\]多分类可以采用softmax形式。常见最大熵分类器与多项逻辑回归密切相关。结合TF-IDF时,这类模型训练高效,容易检查特征贡献,是有价值的基线。
系数只能在特征定义、正则化和其他变量给定的条件下解释,不能当作某个词对公众态度的因果作用。对高度相关的词,单个系数可能不稳定。
8.5 支持向量机
SVM寻找能够区分类别且间隔较大的决策边界。软间隔线性SVM的一种形式为:
\[\min_{w,b,\xi}\frac12\|w\|^2+C\sum_i\xi_i\] \[\text{s.t.}\quad y_i(w^Tx_i+b)\geq1-\xi_i,\quad\xi_i\geq0\]$C$控制间隔与训练错误之间的权衡。核方法通过核函数表达非线性关系;常见核包括线性、多项式和RBF。高维稀疏文本通常可以先测试线性SVM,复杂核并不必然更好。
多分类的常见组织方式:
- 一对其余(OvR):$K$个类别训练$K$个分类器,每个区分某类与其余类。
- 一对一(OvO):训练$K(K-1)/2$个两两分类器,再汇总决策。
- DAG式决策:按有向无环的比较路径逐步排除候选类。
OvO分类器数量通常多于OvR,但单个分类器使用的数据更少;总耗时取决于数据、模型与实现,不能只根据数量判断。决策分数也不天然等于概率。
8.6 Rocchio与K近邻
Rocchio/类中心分类计算每类训练文本的中心向量,把新文本分到最接近的类别。适合快速基线,但一个类别含多个相距较远的子主题时,单中心表达较弱。
KNN寻找新文本最相似的$k$个已标注样本,以多数票或距离加权投票分类。需要选择表示方式、距离、$k$值和类别权重。它直观、能展示参考样本,但大规模检索成本较高,易受不平衡和局部噪声影响。
可以通过近邻索引、样本压缩和批量计算改善效率。近似近邻引入的误差也应评价,不能默认近似检索与精确检索结果相同。
8.7 决策树、规则与集成学习
- 决策树按特征逐步划分样本,便于形成规则,但单树容易过拟合。
- 规则分类用人工规则或学习得到的关联规则识别类别,适合边界明确的表达,需检查规则覆盖及冲突。
- 随机森林通过多棵树的集成降低单树不稳定性。
- Boosting顺序训练弱学习器,逐步关注当前模型未处理好的部分;不同算法采用不同的权重或损失优化机制。
结构化特征较多时,树模型和提升方法很有价值;对于极高维稀疏词特征,应实际比较其效率与线性模型。复杂模型不能代替清晰的标签定义。
8.8 神经网络与预训练模型
CNN可捕捉局部文本模式;RNN、LSTM等建模序列依赖;Transformer通过注意力机制形成上下文表示。预训练模型可以通过微调、参数高效适配或提示方式用于分类。
这些方法适合复杂语义任务,但需要关注训练样本、计算成本、跨领域迁移、输入截断和预测稳定性。对长新闻只保留开头,可能错过后面的转折与更正;对回复只读取当前句,可能误判立场对象。
8.9 弱监督、半监督与主动学习
- 弱监督:利用词典、规则、话题标签等产生带噪声标签,需估计标签质量。
- 半监督:结合少量标注与大量未标注数据,例如谨慎使用高置信度伪标签。
- 主动学习:优先标注模型不确定、具有代表性或类别稀缺的样本。
以上方法可以节省标注成本,也可能放大初始偏差。应保留不参与迭代选择的独立人工测试集。
9. 分类评价与误差分析
9.1 混淆矩阵与基本指标
设“需要人工核验”为正类:TP为正确识别的正例,FP为误报,FN为漏报,TN为正确识别的负例。
\[\operatorname{Precision}=\frac{TP}{TP+FP},\qquad \operatorname{Recall}=\frac{TP}{TP+FN}\] \[F_1=\frac{2PR}{P+R},\qquad \operatorname{Accuracy}=\frac{TP+TN}{TP+TN+FP+FN}\]特异度为$TN/(TN+FP)$,灵敏度就是正类召回率。分母为零时应注明处理规则。
假设测试集有100条真实风险样本,模型找到80条,另误报20条,则Precision和Recall均为80%,F1为80%。如果全体样本极不平衡,准确率可能很高而少数类召回率很低。
9.2 多分类与多标签指标
- 宏平均(Macro):先逐类计算,再等权平均,能突出小类别的表现。
- 微平均(Micro):先汇总各类TP、FP、FN,再计算,容易受大类别主导。
- 加权平均(Weighted):按各类别样本数加权。
Macro-F1是各类F1的均值,一般不等于Macro-Precision和Macro-Recall的调和平均。在每个样本恰有一个真标签和一个预测标签、且纳入全部类别的单标签多分类中,Micro-Precision、Micro-Recall、Micro-F1与Accuracy相等;多标签情形不能直接套用。
多标签任务还可报告每标签PRF、Hamming loss,以及要求标签集合完全一致的subset accuracy。后者很严格,应解释其含义。评价指标定义与实现
9.3 阈值、概率与类别不平衡
分类阈值应根据漏报与误报成本选择。需要优先发现待核验内容时,可以提高召回,再由人工复核;如果误报会严重消耗处理资源,则需要兼顾精确率。不能不经验证就统一采用0.5。
可以报告PR曲线、ROC曲线、PR-AUC或ROC-AUC,并说明正类比例。对于概率输出,检查校准曲线、Brier分数或对数损失。高分类准确率不保证“90%置信度”的样本真的约90%正确。
不平衡处理包括类别权重、重采样、阈值调整和补充稀缺类别样本。重采样只能在训练部分进行,不能污染测试集。
9.4 训练、验证与测试的划分
| 划分方式 | 适用目的 | 防止的主要问题 |
|---|---|---|
| 分层随机划分 | 同分布分类基线 | 类别比例严重失衡 |
| 按用户分组 | 测试对新用户表达的泛化 | 同一用户习惯泄漏 |
| 按新闻/事件分组 | 测试新新闻或新事件 | 同一事件近重复文本泄漏 |
| 按时间划分 | 模拟未来应用 | 使用未来数据预测过去 |
| 跨平台/跨领域测试 | 检查迁移能力 | 仅在同平台获得乐观结果 |
去重分组应先确定,再进行划分。词表、IDF、降维、特征选择与调参都应限定在训练/验证流程内。测试集用于最终评估,不应成为反复调整规则的工具。
9.5 错误分析与报告
按类别、平台、文本长度、时间、是否含反讽、是否缺上下文等切片检查。建立错误表:原文、真实标签、预测标签、模型分数、错误原因和改进方向。不能只展示正确样本。
报告标注质量、样本数量、划分方式、基线、主要指标、各类指标与置信区间。人工标签有争议时,保存争议状态;不要假定每条文本只有唯一无争议答案。
10. 文本聚类方法
10.1 聚类与分类的区别
聚类根据相似性自动组织文本,不预先要求每条文本已有类别标签。它适合探索议题、组织新闻、识别事件簇和辅助构建编码体系。聚类输出的是给定表示与算法下的分组,并不自动等于社会现实中的“真实主题”。
传统硬聚类为每个对象分配一个簇;软聚类允许不同隶属程度;密度方法可以将部分对象标为噪声。不能强求所有语料都形成清晰、互斥、同等大小的主题。
10.2 数据矩阵与相似度矩阵
文档—特征矩阵为$n\times p$;文档两两相似度或距离矩阵为$n\times n$。后者在大样本下存储成本很高,应根据算法选择稀疏近邻图、批量计算或近似方法。
10.3 距离与相似度
| 度量 | 定义或核心含义 | 适用与限制 |
|---|---|---|
| 欧氏距离 | $\sqrt{\sum_j(x_j-y_j)^2}$ | 受量纲和向量长度影响 |
| 曼哈顿距离 | $\sum_j\lvert x_j-y_j\rvert$ | 累加各维差异 |
| 切比雪夫距离 | $\max_j\lvert x_j-y_j\rvert$ | 关注最大单维差异 |
| 闵可夫斯基距离 | $(\sum_j\lvert x_j-y_j\rvert^p)^{1/p}$,$p\geq1$ | 统一部分常见距离 |
| 余弦相似度 | $x^Ty/(|x||y|)$ | 常用于文本;零向量需单独处理 |
| Jaccard相似度 | 集合交集大小/并集大小 | 适合词集合、非对称二元属性 |
| 简单匹配系数 | 相同取值数/属性总数 | 适合0和1同等重要的二元属性 |
| Hamming距离 | 对齐位置上不同取值的数量或比例 | 适合等长编码,需说明是否归一化 |
| Pearson相关 | 中心化后的线性共同变化 | 反映形状关联,未必适合所有文本向量 |
名义变量应避免随意用数字大小表示距离;有序变量可以在说明假设后采用等级变换;连续、二元、类别混合数据可以考虑分类型组合距离,例如Gower距离。
余弦为1表示向量方向相同,不证明原文完全相同;余弦为0表示在该表示空间正交,不证明语义毫无关联。向量经L2归一化后,平方欧氏距离与余弦相似度存在$d^2=2(1-\cos)$关系。
10.4 K-means
K-means最小化簇内平方距离:
\[J=\sum_{k=1}^{K}\sum_{x_i\in C_k}\|x_i-\mu_k\|^2\]步骤:选择$K$和初始中心 → 分配到最近中心 → 更新中心 → 重复至收敛。可使用多次初始化、K-means++或MiniBatch版本。文本实践中常将TF-IDF或句向量归一化,并结合任务检查距离是否合适。
K-means计算高效,适合规模较大的初步主题组织;对$K$、初始中心、异常点和簇形状敏感。簇内平方和随$K$增加通常下降,不能仅以它选出最佳主题数。
10.5 层次聚类
凝聚式方法从单个对象开始逐步合并,形成树状结构。常见连接准则包括单链接、全链接、平均链接与Ward方法。Ward通常对应欧氏空间中的方差增加准则,不能随意与任意距离组合。
层次结构适合展示“大议题—子议题”关系,但结果依赖连接规则;单链接容易产生链式连接。大样本的计算与展示成本较高。
10.6 DBSCAN、HDBSCAN与OPTICS
DBSCAN根据邻域半径$\varepsilon$和最少样本数MinPts区分核心点、边界点和噪声。常见实现中邻域计数包含样本自身,使用时应核对具体约定。
它无需事先给定簇数,可以识别不规则形状并保留噪声,但对距离、密度差异和参数敏感。高维文本中邻域关系可能不稳定,通常需要认真选择向量表示和适当降维。
HDBSCAN通过层次密度结构提取簇,OPTICS刻画不同密度尺度下的可达结构。它们有助于处理密度不一的数据,但不能保证产生符合研究问题的主题。聚类方法与适用条件
10.7 密度峰值聚类
密度峰值方法以“局部密度较高,且远离更高密度点”的样本作为中心候选。对点$i$计算局部密度$\rho_i$及到更高密度点的最小距离$\delta_i$,结合决策图选中心,再分配其他点。
它提供直观的中心识别方式,但对距离、密度定义、中心选择和噪声敏感。若某主题存在多个密度峰或密度结构不明显,结果可能不稳定。Rodriguez与Laio,2014
10.8 其他聚类思路
- 谱聚类:基于相似图的谱结构划分对象,适合关系结构明显的中小规模问题。
- 高斯混合模型:以概率混合表示数据,可输出软归属,但分布假设应与表示空间相容。
- 模糊C均值:允许对象以不同程度属于多个簇,适合边界模糊的探索。
- K-medoids:以实际样本作为代表中心,在选定距离下便于展示典型文本。
- 约束聚类:利用“必须同簇/不可同簇”等人工知识指导分组,需记录约束来源。
无论采用何种算法,都应保存代表文本、边界文本和离群文本,用于人工解释,而不是只根据高频词为簇命名。
11. 聚类评价与主题发现
11.1 聚类评价
内部指标只依赖数据表示和分组,包括轮廓系数、Calinski–Harabasz指数和Davies–Bouldin指数。轮廓系数比较样本的簇内平均距离$a(i)$与最近其他簇平均距离$b(i)$:
\[s(i)=\frac{b(i)-a(i)}{\max\{a(i),b(i)\}}\]这些指标倾向于不同几何结构,应与所用距离及任务一起解释。只提高内部指标,可能得到数量更少、更粗糙、研究价值更低的簇。
外部指标在存在独立参考标签时使用,例如ARI、NMI,或对样本对计算的Precision、Recall、F1。簇编号本身无语义,不能直接把“簇0”和“类别0”逐项比较。纯度随簇数增加容易上升,不能单独评价。
稳定性评价比较不同随机种子、抽样、参数和时间窗口下的结果。人工评价检查簇内一致性、簇间区别、命名准确性、覆盖率和未知主题价值。噪声比例也是结果,应单独报告。
11.2 主题模型与聚类的关系
聚类通常把文档组织为组;主题模型通常以词分布描述主题,并允许一篇文档具有多个主题成分。二者都可以用于主题发现,但输出结构与假设不同。
11.3 LSA、NMF与pLSA
- LSA潜在语义分析:对文档—词矩阵作低秩分解,捕捉潜在关联;成分可能正负混合,不总是容易解释。
- NMF非负矩阵分解:近似$X\approx WH$,其中$W,H\geq0$;可以分别理解为文档—成分权重和成分—词权重。非负约束常使主题解释更直观,但结果依赖预处理、成分数和初始化。
- pLSA概率潜在语义分析:用潜在主题解释文档与词的共现,提供主题混合的概率思路。
11.4 LDA主题模型
潜在狄利克雷分配假设每篇文档具有主题混合比例,每个主题具有词分布。对每个词位置,先从文档主题分布选择主题,再从相应主题词分布生成词。
研究中得到两个主要对象:文档—主题分布$\theta_d$和主题—词分布$\phi_k$。主题不是单个关键词,而是一组词及其概率结构,名称应结合高权重词和代表文档解释。Blei、Ng与Jordan,2003
基本步骤:整理语料 → 分词与词表筛选 → 选择主题数候选 → 拟合模型 → 检查词分布与代表文档 → 比较稳定性与解释质量 → 形成主题命名和讨论。
短评论共现信息少,可以尝试按明确规则聚合、采用适合短文本的模型,或改用句向量聚类。聚合会改变分析单位,例如按用户聚合后,主题比例不能直接当作评论比例。
11.5 BERTopic与语义主题发现
BERTopic的典型流程是:文本嵌入 → 降维 → 聚类 → 基于类的TF-IDF生成主题词 → 解释与调整。组件可替换,常见配置使用句向量、UMAP和HDBSCAN,并非必须固定使用同一个BERT模型。BERTopic官方算法说明
优势是能利用部分同义表达和句子语义;局限包括嵌入模型偏差、降维与聚类参数敏感、离群文本较多、主题词仍需人工核验。大模型生成的主题名称只是解释候选,不是自动验证。
11.6 主题数、质量与动态比较
主题评价可以结合一致性、区分度、多样性、代表文档、人工可解释性和稳定性。困惑度衡量特定模型的预测拟合,不等于人类理解的主题质量。
跨时间比较时,可以固定一个主题体系再观察比例,也可以分期建模后进行主题对齐。前者便于比较但可能遗漏新议题,后者能发现变化但主题编号不能直接对照。应区分主题出生、消亡、合并、分裂和仅仅措辞变化。
12. 内容分析、框架与叙事分析
12.1 定量内容分析
定量内容分析按照明确规则编码文本,再统计类别分布与关系。它的基础是构念与编码规则,不取决于人工还是模型执行。
编码手册应包括:变量定义、分析单位、类别、纳入与排除条件、正反例、多重标签规则、缺失/无法判断规则,以及争议处理方式。先用小样本试编码,修订后再进行正式标注。
12.2 标注一致性
可以使用Cohen’s kappa评价两位编码者,或根据编码者数量、缺失情况和测量尺度选择Krippendorff’s alpha等指标。kappa的基本形式为:
\[\kappa=\frac{p_o-p_e}{1-p_e}\]$p_o$为观察一致率,$p_e$为由边际分布计算的机会一致率。类别极不平衡时,kappa与直观一致率可能表现不同,应同时报告类别分布和分歧表,不能只套统一阈值。
一致性应在独立编码、讨论裁决之前计算;裁决后的统一标签可以作为最终参考,但不能用裁决后的完全一致宣称原始一致性很高。kappa的原始定义见Cohen,1960。
12.3 框架分析
框架分析关注报道如何选择、组织和突出事件的某些方面。可从以下维度操作化:问题定义、原因解释、责任归因、价值判断、解决方案、消息来源和被突出/被忽略的主体。
例如,围绕公共服务争议,报道可能强调个体体验、资源分配、制度责任或技术效率。具体框架应由理论和材料共同确定,不能把任何关键词簇直接命名为框架。
框架可能在一篇报道中并存。定量部分可以比较不同媒体或阶段的框架比例;质性部分通过标题、叙述顺序、引语和代表段落说明框架如何形成。
12.4 叙事与话语分析
叙事分析关注角色、情节、时间顺序、冲突与解决;话语分析关注命名、隐喻、模态、主体位置、权力关系和表达条件。它们适合解释文本如何建构意义。
计算工具可以帮助检索例句、发现模式和选择案例,但不能仅凭词频完成完整话语解释。应纳入反例、异常案例和不同阶段材料,避免只挑支持论点的句子。
12.5 混合方法
常见路径包括:先聚类发现模式,再质性解释;先访谈与试读构建类别,再规模化编码;先统计发现差异,再回到原文解释机制。每一步应明确输出如何进入下一步,避免将多种方法简单并列。
13. 情感、情绪与立场分析
13.1 区分四个对象
| 分析任务 | 回答的问题 | 示例标签 |
|---|---|---|
| 情感极性 | 对某对象评价正面还是负面 | 正面、负面、中性、混合 |
| 情绪识别 | 表达何种情绪状态 | 愤怒、担忧、悲伤、喜悦等 |
| 立场识别 | 对某命题或行动是否支持 | 支持、反对、未明确、无关 |
| 方面级分析 | 对哪个方面持何种评价 | 对价格不满、对服务认可 |
“我很担心,但支持这项改革”同时包含担忧情绪和支持立场。不能用负面情绪直接替代反对立场;对事故的悲伤,也不能直接解释为对某机构的否定。
13.2 情感词典方法
词典方法识别情感词,并结合否定词、程度词、转折和表情计算得分。一种教学示意是:将情感词分值乘以程度权重和否定修正后加总。
关键在于作用范围:“不是不满意”与“不满意”不同;“价格贵,但服务确实好”包含不同方面;引述他人的不满不等于作者认同。简单加总适合作为可解释基线,不宜当作可靠的最终标签。
13.3 监督模型与大模型
可使用TF-IDF加线性分类器、预训练模型微调或大模型提示分类。训练与评价必须采用相同标签定义、对象和数据划分。电商评论模型不应未经测试就用于公共政策争议。
大模型可以输出“目标—情感—立场—证据片段”,但自报置信度不能直接当作校准概率。应检查目标混淆、反讽、含蓄表达、混合态度和上下文缺失。
13.4 群体指标与误差
负面比例可定义为:
\[r_{neg,t}=\frac{N_{neg,t}}{N_{eligible,t}}\]分母必须说明:全部相关文本、可以判断的文本,还是表达了情感的文本。排除“无法判断”会改变比例,应同时报告排除数量。
比较群体差异时,模型错误可能在不同平台、方言或表达方式上不均衡。除了整体F1,还应抽查各组;小幅比例差异若小于测量误差,不宜作强解释。
13.5 观点与论证挖掘
可以进一步抽取观点主张、理由、证据、支持关系和反驳关系,形成“争议焦点—支持理由—反对理由—待核验事实”矩阵。这比只报告正负面比例更能服务新闻解释和回应需求。
强烈语气、消极评价和虚假信息是不同维度。真实性判断需要证据核验,不能由情感模型推断。
14. 时间序列、事件演化与预警
14.1 构建时间序列
按小时、日或周聚合发文量、独立参与者、互动量、议题比例、情感比例和新出现实体数。时间粒度取决于事件速度和数据量,过细会放大随机波动,过粗会掩盖突发变化。
同时保存绝对量与相对量。某议题讨论量增加可能来自整个平台活跃度上升,也可能来自该议题占比提高,需要分别检验。缺测时段应显示为缺失,而不是零讨论。
14.2 趋势、峰值与阶段划分
常见方法包括移动平均、指数平滑、季节分解、峰值检测和变点检测。阶段可以依据外部事件节点,也可以依据数据变化识别,再用原文和时间线解释。
事件未必经历固定的“潜伏—爆发—扩散—衰退”四阶段,可能反复出现、多峰叠加或长期低强度延续。阶段命名应贴合数据。
增长率可写为$(N_t-N_{t-1})/N_{t-1}$,但基期为零或很小时不稳定。应同时报告绝对增量,并在预警中设置最低数量条件。
14.3 突发检测与异常识别
可以将当前观测值与历史同类时段比较,使用标准化偏离、稳健分位数、CUSUM或变点方法。异常应先排查采集故障、平台排序变化、集中转载、节假日和日内周期。
一套可解释的预警规则可结合:讨论增量、独立用户增长、新议题比例、证据不足的事实主张、跨社群扩散和持续时间。权重与阈值必须用历史样本或试运行校准,不能随意赋值后宣称“风险指数具有科学性”。
14.4 议题、情绪与框架演化
将每个时间窗口的主题比例、立场结构和框架分布画成堆积图或热力图,并标注外部事件。关注“同一议题内部态度变化”与“议题组成变化”的区别:整体负面比例上升,可能只是负面较多的议题占比增加。
文本相似度可以追踪旧议题延续、新议题产生与旧议题分裂;需要稳定的表示和跨期对齐规则。人工抽查时间边界附近的文本,避免模型变化被误认成社会变化。
14.5 预测方法
时间预测可以从简单基线开始,如上一时段、同一星期时段、移动平均;再考虑ARIMA类模型、回归、树模型或序列神经网络。计数、比例和连续值的模型假设不同,不能不加处理混用。
采用滚动时间验证,按预测时点可获得的信息构造特征。评价可使用MAE、RMSE等;接近零的序列不宜只用MAPE。提供预测区间或情景范围,并检查模型是否只是在复制周期规律。
14.6 传播动力学与滞后关系
SIR类模型可以作为信息接触与传播的简化机制模型,Hawkes过程可以描述事件发生后的自激式时间聚集。这些模型需要足够的时间戳数据、明确过程假设和外生冲击处理,不宜把拟合参数直接当作实际心理机制。
交叉相关和Granger检验可研究时间先后及增量预测关系,但共同外部冲击、趋势和采样差异也会产生滞后关系。因此,“某媒体先报道、另一平台后增长”不足以证明前者造成后者增长。
15. 数据流分析与在线聚类
15.1 数据流的特点
数据持续到达、总体规模可能无界、内存有限、处理延迟受约束,且词汇、议题和类别关系会随时间变化。系统需要增量更新、摘要存储和适当遗忘。
区分事件时间和到达时间,处理迟到、重复和乱序数据。按到达时间统计可能把采集延迟误判为舆情峰值。
15.2 时间模型
| 模型 | 保留范围 | 适用场景 |
|---|---|---|
| 界标/地标窗口 | 固定起点之后的全部数据 | 跟踪某事件自发生以来的累积变化 |
| 滑动窗口 | 最近固定时长或固定数量的数据 | 近期热点与实时状态 |
| 衰减窗口 | 数据越旧权重越低 | 平滑关注近期变化 |
| 快照 | 在特定时点保存状态摘要 | 回看与比较历史结构 |
时间序列流、插入型流(cash-register)和允许增减更新的turnstile模型描述不同的数据更新语义;它们与窗口选择是不同维度。
15.3 STREAM
STREAM采用分块和摘要思路,将一批数据压缩为带权代表中心,再对代表中心继续聚类,以有限空间近似全量聚类。重点是计算与存储可扩展性;如果把全部历史同等累计,旧议题仍可能压制新议题。
它应被理解为流式聚类近似框架,具体目标和实现需要说明,不能将所有版本一概当作普通K-means的完全等价实现。
15.4 CluStream
CluStream将过程分为在线微簇维护和离线宏簇生成。微簇保存数量、特征和时间的统计摘要;系统按金字塔时间框架保存快照,分析者再按指定时间范围生成较粗的聚类结果。这种设计兼顾持续更新与历史比较。Aggarwal等,2003
应用于舆情时,可把每条新文本转为向量,更新微簇,定期查看主题结构,并保存代表原文用于解释。摘要不能完全替代文本证据。
15.5 概念漂移与在线评价
漂移可能表现为新词增多、已有词含义变化、类别比例变化、同一特征与标签关系变化。可以监测输入分布、分类置信度、未知样本比例和人工抽检错误。
在线学习可采用“先预测、后获得标签、再更新”的顺序评价;若标签延迟到达,应保留预测当时的模型版本。不能先用未来标签更新,再回算过去的性能。
16. 社会网络与传播路径分析
16.1 三种互补网络
从主体、内容及主体与内容的关联出发,可以构建三种互补网络:
| 网络 | 节点 | 边 | 可研究问题 |
|---|---|---|---|
| 主体关系网络 | 用户、媒体、机构 | 转发、回复、提及、引用等 | 谁参与、谁连接不同群体 |
| 内容关系网络 | 新闻、帖子、事件或主题 | 相似、引述、链接、共享实体 | 内容如何聚集与演化 |
| 主体—内容二部网络 | 一侧为主体,一侧为内容 | 发布、转发、评论或讨论 | 不同群体如何参与同一议题 |
需要明确方向、权重、时间窗口、多重关系和自环处理。若“A转发B”,可以约定行为边为A→B;若研究信息流,则可能约定B→A。两种定义都可用,但必须贯穿解释。
16.2 基本结构指标
无自环的简单无向图有$n$个节点、$m$条边,其密度为:
\[D=\frac{2m}{n(n-1)}\]简单有向图的相应密度为$m/[n(n-1)]$。多重图、二部图和允许自环的网络需要不同口径。
其他指标包括连通分量、最大连通分量占比、平均路径长度、直径、互惠性和聚集系数。网络不连通时,路径指标要说明是在最大连通分量、可达节点对还是采用其他定义计算。
16.3 中心性与主体角色
| 指标 | 核心含义 | 新闻舆情解释 |
|---|---|---|
| 度/入度/出度 | 直接连接数量 | 活跃、被连接或连接他人的程度,依边方向而定 |
| 加权度 | 连接权重总和 | 互动强度,可能被重复互动放大 |
| 中介中心性 | 位于其他节点最短路径上的程度 | 潜在桥梁位置,不能证明真实信息必经此处 |
| 接近中心性 | 到其他节点的距离接近程度 | 潜在可达性,受断连与方向影响 |
| 特征向量中心性 | 与重要节点连接的程度 | 核心网络中的位置 |
| PageRank | 带随机跳转机制的链接重要性 | 依边定义识别被关注或被引用位置 |
这些指标测量结构位置,不能单独代表可信度、价值认同或真实影响力。中心性算法参考
16.4 社区、凝聚子群与网络形态
社区发现通常寻找内部连接相对密集、外部连接相对稀疏的群体,可使用Louvain、Leiden或其他适合网络类型的方法。模块度是常见目标之一,但存在分辨率限制;不同随机种子和参数可能得到不同划分。
凝聚子群概念包括团、n-clique、n-clan、k-core等。团要求内部两两相连;k-core要求子图内各节点至少具有$k$个邻接节点。它们表达不同强度的结构凝聚,不应混为一个指标。
串联、星型、多中心等结构可以描述传播组织形式。同配性用于考察相似属性或相似度数的节点是否更易连接。所谓“小世界”“幂律度分布”“稠化”“直径缩短”需要与基准模型或时间序列比较,不能只凭网络图外观断言。
16.5 传播级联与路径
以明确转发、引用或回复记录构建传播树或有向图,统计规模、宽度、深度、传播速度、首个可观测节点和跨社群传播。文本相似且发布时间接近只能提供传播关联线索,不能证明直接转载。
可进一步比较广播式扩散与多层级接力传播。平台只提供原始帖而不提供中间转发父节点时,不能伪造完整传播路径;应报告可观测结构的限制。
16.6 二部网络、多层网络与链路预测
主体—议题二部网络可研究不同群体参与哪些主题。投影为主体网络时,“共同讨论同一热门议题”容易制造大量连接,应考虑权重校正并保留二部结构检查。
多层网络区分转发、回复、提及或不同平台关系,避免把不同互动含义相加。链路预测可以用共同邻居、图嵌入等估计未来连接,但应按时间划分,并谨慎构造负样本;未观察到的边不一定是真正不存在的边。
16.7 协同行为线索
短时间集中发布、相似文本、共享链接和重复互动结构可以提示协同行为。需要排除正常新闻同步转载、组织公开活动和平台机制。行为同步不能单凭一项指标证明账号由同一人控制,更不能直接推断动机。
17. 信息抽取、事件图谱与知识图谱
17.1 从文本提取结构化信息
信息抽取包括实体、属性、关系、事件、时间和共指解析。新闻事件可表示为:
事件ID—事件类型—主体—行为—客体—发生时间—地点
—原因主张—结果主张—来源—证据片段—核验状态
应区分事件时间、报道时间和推测时间。“预计下周实施”不是“已经实施”;“被指存在问题”不是问题已被证实。
17.2 抽取方法
规则和模板适合固定格式;序列标注适合实体边界;关系分类适合判断给定实体之间的关系;生成式模型可输出结构化记录。不同方法都需要检查边界、关系方向、否定、条件和跨句指代。
评价可包括实体精确匹配F1、关系F1、事件触发词与论元F1,以及端到端正确率。宽松匹配与严格匹配应分开报告,不能只评价某个局部模块就声称整个图谱准确。
17.3 知识图谱构建
基本流程:设计实体与关系类型 → 抽取 → 实体链接 → 冲突处理 → 存储 → 查询与分析 → 更新。三元组“机构A—发布—公告B”与“机构A—对事件C负责”具有完全不同的证据要求。
图谱应记录事实出处、有效时间和置信/核验状态,允许互相矛盾的主张分别存在。自动抽取的关系宜先视为候选记录,不应在进入图谱后自动升级为已证实事实。
17.4 专家网络与专家知识组织
构建专家知识图谱时,可组织公开的基本信息、研究方向、论文、专利、项目、合作关系和学术活动。研究重点是实体消歧、专业领域识别与合作结构,不必为完成分析而收集无关的私人联系信息。
同名作者消歧可以综合机构、时间、共同作者、主题和稳定标识符。合作多、发表多、网络位置重要均不自动等于某个具体问题上的可靠专业判断。
17.5 企业与产业关系网络
可以从网页提取企业名称、产业属性和共现关系,形成候选网络。进一步研究投资、供应、合作、竞争等关系时,必须抽取明确关系证据。
企业在同一新闻中出现,只能证明该文档中的共现。不能把共现网络直接命名为“供应链网络”或“合作网络”。企业更名、集团与子公司关系也应单独建模。
18. 跨平台比较与多源证据整合
18.1 保证比较口径可比
不同平台的用户构成、内容形式、推荐机制和指标定义不同。点赞、收藏、评论与转发并非同一行为,原始计数不应直接加总为跨平台统一影响力。
可比较的设计包括:相同事件和时间窗口下的议题结构;同类媒体账号的表达差异;同一主张在不同平台的出现与变体;同一内容在多个平台的传播时间。平台内标准化只能改善尺度,不能消除机制差异。
18.2 匹配与测量一致性
匹配内容时结合标题、正文、URL、图像指纹、发布时间和人工核验。匹配账号时需要可靠公开证据,不能仅凭昵称和头像相似强行合并身份。
同一分类器在不同平台可能表现不同,应分别抽样评价。测量误差不同会造成虚假的群体差异;必要时分别校准、采用共同人工标签或报告不确定范围。
18.3 三角互证与矛盾证据
将平台表达、新闻报道、公告文件、事件记录、问卷和访谈相互对照。每类材料回答的问题不同:公告说明发布者的正式说法;评论体现可见表达;访谈帮助理解经验;它们不能互相充当完全等价的验证。
保留矛盾证据,建立“主张—来源—时间—支持材料—反证—当前状态”表。不同来源一致时,也应检查是否相互转载,避免把重复信息当成独立证实。
19. 统计检验、解释模型与因果识别
19.1 描述、估计与假设检验
比较均值、中位数、比例和分布时,应同时报告差异大小、样本量和不确定性。统计显著不等于实践意义重大;样本很大时,极小差异也可能显著。
| 问题 | 可考虑的方法 | 关键条件 |
|---|---|---|
| 两组类别比例是否不同 | 列联表、卡方检验、Fisher精确检验 | 观察独立性、期望频数等 |
| 两组连续变量差异 | Welch t检验、适当的非参数或置换方法 | 尺度、分布与抽样设计 |
| 有序关系或非正态单调关联 | Spearman相关 | 关联不等于因果 |
| 多因素与结果的关联 | 线性、逻辑、计数等回归 | 模型形式、混杂、相关误差 |
| 不确定区间 | 适当的解析区间或Bootstrap | 重抽样单位与数据依赖结构匹配 |
同一用户的多条评论、同一新闻下的回复通常不独立。可以按用户或新闻分组重抽样,采用聚类稳健标准误或多层模型。普通随机重抽每条评论可能低估不确定性。
19.2 回归与多层模型
连续结果可考虑线性模型;二元结果可考虑逻辑回归;计数结果可考虑Poisson或负二项模型,并检查过度离散;评论嵌套于新闻、用户或平台时,可考虑多层结构。
回归用于解释时,应根据理论与因果结构选择控制变量。不能把所有可获得变量全部加入,尤其不要随意控制处理之后产生的变量。模型用于预测与用于解释时,对变量和评估的要求不同。
19.3 回应效果与因果识别
“回应之后热度下降”只能说明时间上的变化。自然衰减、其他新闻、平台推荐、线下进展和样本构成变化都可能造成下降。
可考虑的设计包括:
- 随机实验:在适当条件下随机分配信息呈现或回应方式,比较结果。
- 中断时间序列:在足够长的前后序列中估计水平或趋势变化,处理季节性、自相关和同期冲击。
- 双重差分(DID):比较处理组与适当对照组的前后变化差,依赖平行趋势等识别条件。
- 匹配或加权:改善可观测特征可比性,但不能自动消除未观测混杂。
简单两组两期DID为:
\[\widehat{\tau}=(\bar{Y}_{T,post}-\bar{Y}_{T,pre})- (\bar{Y}_{C,post}-\bar{Y}_{C,pre})\]这只是最简单情形。多期、错位实施、处理效应异质时,不能不加检查地沿用一个普通双向固定效应系数。对照是否合理、处理前趋势和可能的溢出影响应单独说明。多期设计可参考Callaway与Sant’Anna的原始研究。
19.4 稳健性与敏感性分析
更换合理的时间窗口、检索式、去重规则、模型、阈值和样本范围,检查主要结论是否改变。多次检验应考虑多重比较问题;探索性发现应与预设假设区分。
稳健性不是反复调整直到得到显著结果,而是公开展示结论在哪些合理条件下成立或失效。
20. 大模型辅助编码、摘要与检索增强
20.1 合适的角色
大模型可以帮助归纳初始类别、辅助标注、抽取事实主张、生成主题名称、整理争议观点、摘要材料和查找编码冲突。它应进入可检验的研究流程,而不是成为无法复核的判断来源。
零样本、少样本提示与模型微调适用于不同资源条件。应与规则、词典或传统模型基线比较,记录模型版本、调用日期、提示词、示例、参数和输出后处理。
20.2 结构化编码
可要求输出以下字段,并限定取值:
{
"doc_id": "demo_001",
"target": "校园巴士收费方案",
"topics": ["价格", "服务"],
"stance": "支持",
"emotion": ["担忧"],
"evidence_span": "有点担心价格,但我支持先试行",
"needs_context": false,
"review_reason": null
}
分类说明应明确对象、互斥或多标签规则、无法判断条件,并提供边界例子。证据片段必须能在原文找到,不能由模型改写后冒充原文。
20.3 评价与人工分工
建立独立人工参考集,评价标签准确性、证据定位、结构合法性、重复运行稳定性和不同群体表现。对冲突标签、未知类别、关键事实和高影响结论优先人工复核。
多次调用或多个模型一致,不等于答案正确;它们可能共享偏差。模型解释也不是其判断可靠性的独立证据。
20.4 摘要方法
抽取式摘要选择原文句子,便于追溯但衔接可能较弱;生成式摘要重新组织表达,更流畅但可能补出原文没有的内容。多文档摘要应区分共同事实、不同主张、少数观点与未解决争议。
评价重点包括:事实一致性、关键内容覆盖、观点平衡、时间顺序、实体与数字正确性、引用可追溯性。摘要文本相似度指标只能提供部分信息,不能替代事实检查。
20.5 RAG检索增强生成
RAG先检索相关材料,再让生成模型基于检索结果组织回答。课程中可以用于构建事件证据问答、政策解释和舆情材料摘要。Lewis等,2020
流程为:材料入库并保存来源 → 合理切分 → 稀疏/向量检索 → 必要时重排序 → 生成带出处回答 → 检查引用与结论。需要分别评价检索召回、证据相关性和生成忠实度。
找到相关段落不保证段落可信;带有引用不保证引用支持结论。材料中出现的指令性文字应作为待分析文本,不能改变研究流程或让系统执行无关操作。
20.6 数据与结果管理
根据研究授权和工具的数据处理条件选择本地或外部处理方案,避免提交不必要的个人信息。保存输入版本、输出和人工更正记录;敏感原文与公开报告分开管理。
报告中说明大模型参与了哪些环节、人工复核了哪些内容、哪些结果仍存在不确定性。不能把模型生成的文献、事实、比例或案例未经核验写入最终研究。
21. 多模态分析与信息核验
21.1 多模态信息来源
图文、短视频和直播中的意义可能来自字幕、画面、声音、剪辑和评论共同作用。单独分析标题或转写文本,可能遗漏讽刺、视觉证据和上下文。
常见处理包括OCR提取图中文字,ASR生成语音转写,关键帧抽取识别画面内容,以及图文向量建立相似性。应保存时间戳、帧位置和原始文件引用,方便复核。
21.2 融合方式
- 特征级融合:组合文本、图像、音频特征,需处理尺度和缺失模态。
- 决策级融合:分别分析各模态,再组合判断,便于定位分歧。
- 跨模态匹配:比较图文是否相关、同一图片是否出现在其他上下文。
图文不一致可能来自配图习惯或讽刺表达,不必然是误导;模态一致也不证明事件真实。多模态模型同样需要人工标注测试集。
21.3 信息核验流程
- 抽取可核验的具体主张,区分事实断言与观点判断。
- 寻找原始发布、完整视频、原始文件或直接证据。
- 核对时间、地点、人物、数字和上下文。
- 比较独立来源,记录支持与反对证据。
- 给出有证据支持的核验状态,并保留“证据不足”。
图像相似检索、元数据和内容一致性检查可帮助发现旧图新用或截取上下文等问题。自动生成内容检测器的分数不能单独证明真伪;事实真假与内容是否由AI生成是不同问题。
22. 典型应用与方法组合
22.1 社会网络舆情研判
围绕“议题—主体—受众表达—传播—时间”构建指标:议题量与占比、独立参与人数、发布活跃度、支持与反对、情绪类型、传播范围、峰值与持续时间、网络结构变化。
浏览、点击、发帖、回复、粉丝等指标可作为不同侧面的观测量;“价值观”“影响力”则需要额外定义和证据,不能仅由粉丝数或一次发言直接推定。
建议输出:事件时间线、主要议题及代表文本、争议与事实核验表、关键传播节点、阶段变化、需要回应的问题及分析边界。
22.2 新闻生产与媒体议程
研究不同媒体关注什么、使用哪些消息来源、如何归因、是否存在内容重复和报道空白。可组合去重、主题模型、内容分类、来源抽取、框架分析和时间比较。
媒体议题与受众议题之间的相关和时序关系可以作为议程设置研究线索,但因果解释需要理论与研究设计支持。转载量不直接等于议题影响效果。
22.3 企业与公共服务评价
组合实体消歧、方面级情感、投诉分类和事件聚类,将“负面很多”细化为哪些产品、服务环节、地区和时间段存在何种问题。结合处理记录,可以研究问题是否解决及回应是否满足信息需求。
消费者网络表达是可见反馈,不等于总体满意度;必要时与问卷、工单和服务记录互证。
22.4 专利地图
专利地图可分为三类:
| 地图类型 | 主要数据 | 方法 | 主要产出 |
|---|---|---|---|
| 管理地图 | 申请人/权利人、合作、地域和时间 | 实体消歧、统计、合作网络 | 主体布局、合作结构、发展趋势 |
| 技术地图 | 标题、摘要、技术描述、分类号 | 文本表示、聚类、主题、相似检索 | 技术主题、关联方向、演化线索 |
| 权利相关文本地图 | 权利要求及其结构 | 文本分段、要素抽取、相似性组织 | 权利要求文本分布和待审阅关系 |
专利家族、重复公开文本和权利状态时间会影响统计。文本相似度用于筛选材料,不足以自动确定法律保护范围或侵权结论。
22.5 金融新闻与风险信息研究
在金融新闻与风险信息研究中,可以抽取企业事件、风险主张和信息来源,研究新闻特征与后续可观察结果的关联或预测能力。
研究设计应特别区分发布时间与可获得时间,避免把事后修订信息当成当时已知信息;使用时间外验证和适当基线,检查样本选择与信息泄漏。这里讨论的是新闻信息测量与预测研究,不根据舆情热度直接推导投资操作。
22.6 计算传播学的综合路径
更完整的研究可以把文本和网络结合:先识别议题与立场,再考察它们分布于哪些社群;进一步跟踪跨社群传播,并用代表文本解释信息在传播中如何被改写。
方法越多不代表研究越强。每一种方法都应承担明确任务,并把输出连接到最终研究问题。
23. 完整研究示例
23.1 题目与研究问题
示例题目:校园巴士收费调整讨论中的议题、立场与传播变化。 以下文本和数字全部为教学构造,不是实证结果。
研究范围设为某次虚构公告前后各7天,在两个公开讨论渠道中获得的相关表达。研究对象是可观测讨论,不推断全校学生总体态度。
| 研究问题 | 所需字段 | 方法 | 验证方式 |
|---|---|---|---|
| RQ1:主要争议集中在哪些方面 | 文本、时间、来源 | 聚类探索+人工多标签编码 | 簇代表文本、编码一致性、未知类检查 |
| RQ2:对收费方案的立场如何变化 | 对象、立场、时间 | 分类+阶段比例 | 独立人工测试、分阶段错误检查 |
| RQ3:哪些主体连接不同讨论群体 | 公开主体ID、可观测转发/回复边 | 网络与社区分析 | 边定义、缺失率、关键关系人工复查 |
| RQ4:公告后发生了什么变化 | 公告时间、连续讨论序列 | 描述比较与时序分析 | 同期事件、采集变化与样本构成检查 |
RQ4在缺乏适当对照和识别条件时,不写成“公告造成了何种效果”。
23.2 数据与编码
保留原文、上下文、时间、平台、匿名化用户ID、转发父节点和采集时间。检索式覆盖正式名称、简称及相关路线名称,同时人工排除无关交通讨论。
试读后形成议题类别:价格、便利性、资源公平、执行透明度、其他。议题允许多选;针对“是否支持当前收费方案”的立场设为支持、反对、条件支持、未明确、无关。
| 示例文本 | 议题 | 立场 | 情感/情绪 | 编码理由 |
|---|---|---|---|---|
| “只要把收费依据公开,我愿意支持试行。” | 价格、透明度 | 条件支持 | 不宜强行判负面 | 支持有明确条件 |
| “我支持调整,但早高峰班次还是太少。” | 便利性 | 支持 | 对班次不满 | 方案立场与服务评价分开 |
| “有人说已经涨价了,公告写的却是下月开始。” | 执行信息 | 未明确 | 无明显极性 | 主要在核对时间事实 |
| “这效率可真高,等了四十分钟。” | 便利性 | 未明确 | 反讽、不满 | 对效率负面,不足以推出反对收费 |
双人独立编码一部分样本,记录分歧,修订手册;冻结正式规则后建立参考集。
23.3 模型与评价
先使用字级TF-IDF加逻辑回归或线性SVM作为立场分类基线,再与合适的中文语义模型比较。按原始讨论串或近重复组划分,避免同一表达进入训练与测试;如果目的在于未来使用,再增加时间外测试。
报告每类Precision、Recall、F1、Macro-F1和混淆矩阵。人工审查反讽、条件支持、多目标评价和引用句的错误;性能不足时扩大人工编码比例,而不是直接把全量预测当作真实标签。
23.4 比例变化示例
假设经过统一编码及核验,公告前有200条可判定立场的相关评论,其中80条反对;公告后有400条,其中120条反对。
- 公告前反对比例:$80/200=40\%$。
- 公告后反对比例:$120/400=30\%$。
- 反对比例下降10个百分点;相对下降幅度为25%。
- 反对评论数量从80增至120,增长50%。
正确解释是:可观测样本中的反对比例下降,但反对评论绝对数量上升。 还需要检查新增参与者、平台组成、重复评论和分类误差,不能据此直接说“反对者减少”或“公告改善了全体学生态度”。
23.5 传播与主题结合
对明确的转发和回复构建网络,识别各社群的主要议题、立场与桥梁节点。检查跨社群传播时,原始主张是否被截取、增加新解释或变为反驳。
如果只有内容和时间,没有关系数据,可分析内容相似与出现顺序,但应将结果称为“内容关联及时间分布”,不绘制假定的真实转发路径。
23.6 最终结论的写法
一项结论至少包括研究对象、观察结果、证据和解释边界。例如:
在本研究采集的两个渠道及指定时间范围内,公告后的可判定评论中反对比例较低,但反对评论绝对量增加。文本复查显示,讨论同时涉及收费依据和班次便利性。该变化可能与新增参与者和议题组成有关;现有前后比较不能识别公告的独立因果效果。
实际研究应把“较低”“增加”等写成真实估计及不确定性;本例不能直接替换为真实案例的结论。
24. 方法选择、成果组织与质量检查
24.1 按研究问题选择最小充分方法
| 研究目标 | 可先采用的组合 | 何时增加复杂方法 |
|---|---|---|
| 描述主要议题 | 人工试读+关键词+人工主题编码 | 样本规模大、表达多样时加入聚类/主题模型 |
| 自动识别已有类别 | 清晰编码+TF-IDF+线性分类器 | 基线不足且有可验证语义困难时升级模型 |
| 识别公众争议 | 目标明确的立场编码+理由归纳 | 需要规模化论证结构时加入论证挖掘 |
| 比较媒体报道 | 分层抽样+内容与框架编码 | 多因素关联问题再加入解释模型 |
| 跟踪事件变化 | 时间线+数量和比例趋势+分期文本 | 需要实时监测或预测时加入流式与时序模型 |
| 研究传播结构 | 明确关系数据+网络指标+案例核验 | 跨平台或多种边关系时加入多层网络 |
| 评估回应效果 | 明确结果指标+前后描述 | 有识别条件和适当对照时考虑准实验 |
| 构建证据摘要 | 检索+来源核验+人工摘要 | 材料量大时加入可追溯的RAG辅助 |
24.2 课程项目的三个层次
基础层:完成问题定义、抽样、清洗、描述统计、人工编码和原文证据。适合样本较小、研究问题偏解释的项目。
进阶层:在基础层上增加一种主要计算方法,建立人工参考集,与简单基线比较,并报告误差。适合分类、主题或网络项目。
综合层:把文本、关系和时间整合,进行跨域验证、稳健性分析或符合条件的因果识别。前提是数据与研究设计支持,而不是为了展示更多算法。
24.3 工具按功能组织
| 工作环节 | 工具类别举例 | 选择重点 |
|---|---|---|
| 数据整理 | Python/R数据框、SQL、表格工具 | 数据类型、连接规则、缺失与重复处理 |
| 中文处理 | 分词、实体识别、句法处理工具 | 领域词、中文短文本和人工抽检 |
| 传统模型 | 机器学习库、统计建模库 | 可复现流程、参数、数据划分 |
| 向量与主题 | 词向量、句向量、矩阵分解、主题工具 | 语言适配、长度、解释与稳定性 |
| 网络 | 图分析库、网络可视化软件 | 边定义、方向、权重和规模 |
| 内容编码 | 编码表、质性分析软件、标注平台 | 版本管理、独立编码、争议记录 |
| 大模型辅助 | 本地模型或获准使用的模型服务 | 可追溯输出、数据处理条件、评价 |
工具名称和界面会变化,研究要求不变:输入可追溯、处理可复现、输出可验证。报告应保存实际使用的版本与配置。
24.4 图表选择
- 数量和比例比较:条形图、点图、带不确定区间的估计图。
- 时间变化:折线图,标注事件节点、缺测和分母变化。
- 分类结果:混淆矩阵和各类性能图。
- 主题结构:主题词与代表文本表、主题—阶段热力图。
- 网络关系:适当裁剪或聚合的网络图,配合结构指标表。
- 观点争议:主张—理由—证据矩阵。
图表应有标题、时间、单位、分母和数据来源。不要用网络布局位置暗示地理位置或真实社会距离,不要用二维向量图替代统计检验。
24.5 研究成果包
建议保存以下材料:
project/
README.md # 问题、数据范围、复现步骤
data_dictionary.md # 字段、单位与缺失规则
retrieval_log.md # 检索式与采集覆盖
codebook.md # 人工与模型共同遵循的编码手册
preprocessing_log.md # 清洗、去重、消歧与融合规则
scripts/ # 可复现分析过程
configs/ # 参数、版本和提示词
evaluation/ # 参考集说明、指标与错误分析
evidence/ # 可授权保存的原文与出处
outputs/ # 图表、结果表与报告
数据文件的保存与共享范围应与授权、研究需要和去标识化安排一致,不能因为追求复现而公开无关个人信息。
24.6 报告结构
- 研究问题及价值:解释为什么值得研究,而不是仅强调数据量大或技术新。
- 文献与理论:说明已有研究、概念定义和本研究的增量。
- 数据与方法:交代样本、变量、算法、参数和评价。
- 结果:先回答研究问题,再展示支撑证据。
- 讨论:解释机制线索、与已有研究的关系及替代解释。
- 局限:说明覆盖、测量误差、缺失、迁移和识别边界。
- 结论:只提出证据支持的判断和可执行建议。
24.7 提交前检查
- 每个研究问题都有对应的数据、变量、方法和结果。
- 分析单位、总体边界、抽样方式和时间范围明确。
- 原文与清洗文本分开保存,重复数据处理符合研究目的。
- 编码手册包括对象、边界例、未知类别和争议规则。
- 有独立评价,训练与测试不存在明显的用户、事件或近重复泄漏。
- 分类报告少数类表现,聚类报告代表文本、噪声与稳定性。
- 每个比例都有分母,每个网络指标都有边和方向定义。
- 时间变化排查了采集故障、组成变化和同期冲击。
- 事实、观点、推测与模型输出被清楚区分。
- 引用可以回到原始材料,数字、实体和时间经过复核。
- 结论没有超出样本覆盖和研究设计的能力。
- 工具版本、参数、提示词和人工修订过程可以追溯。
25. 核心概念辨析与参考资料
25.1 易混淆概念
| 容易混淆的说法 | 应采用的区分 |
|---|---|
| 词频高就是重要 | 高频、区分度、理论重要性和事实重要性不同 |
| TF-IDF中的IDF是词频 | IDF为逆文档频率 |
| One-hot就是文档词袋 | One-hot常描述词项身份,词袋汇总文档中的词项 |
| Word2Vec直接输出分类标签 | 它学习表示,分类需要另建任务模型 |
| PCA获得相互独立变量 | 主成分正交、不相关,不自动统计独立 |
| 两种LDA是同一算法 | 线性判别分析与潜在狄利克雷分配不同 |
| 平滑、回退、Good–Turing完全相同 | 它们处理概率估计的机制不同 |
| 多项式朴素贝叶斯理解词序 | 常见文本模型使用词袋计数 |
| Precision就是Accuracy | 精确率和准确率分母不同 |
| 宏平均等于微平均 | 汇总方式不同,少数类影响不同 |
| OvO分类器更少 | OvO为$K(K-1)/2$,OvR为$K$ |
| 余弦为1就是同一文本 | 仅说明给定表示的方向相同 |
| 聚类就是自动得到客观主题 | 结果依赖表示、距离、算法及解释 |
| 主题就是框架 | 主题回答谈什么,框架关注如何组织意义 |
| 负面情感就是反对立场 | 情感、立场、对象和情绪需要分开 |
| 共现就是实际关系 | 共现只证明在定义的窗口内共同出现 |
| 高中心性就是高可信度 | 网络位置、影响效果和可信度不同 |
| 转发就是支持 | 转发可能支持、反对、引用或讽刺 |
| 模型给出引用就是事实正确 | 引用相关性、证据真实性与推断都需检查 |
| 前后差异就是因果效果 | 需要排除混杂并满足识别条件 |
25.2 延伸阅读与实现参考
以下资料用于追溯原始方法或检查实现定义,不替代针对实际研究问题的验证。
- Mikolov, T., Chen, K., Corrado, G., & Dean, J. (2013). Efficient Estimation of Word Representations in Vector Space. 静态词向量与Word2Vec方法。
- Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. 上下文预训练表示。
- Reimers, N., & Gurevych, I. (2019). Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks. 句向量与语义相似度。
- Blei, D. M., Ng, A. Y., & Jordan, M. I. (2003). Latent Dirichlet Allocation. Journal of Machine Learning Research, 3, 993–1022. 主题模型。
- Rodriguez, A., & Laio, A. (2014). Clustering by fast search and find of density peaks. Science, 344, 1492–1496. 密度峰值聚类。
- Aggarwal, C. C., Han, J., Wang, J., & Yu, P. S. (2003). A Framework for Clustering Evolving Data Streams. VLDB. 在线微簇与离线宏簇。
- Cohen, J. (1960). A Coefficient of Agreement for Nominal Scales. Educational and Psychological Measurement, 20(1), 37–46. 编码一致性。
- Callaway, B., & Sant’Anna, P. H. C. (2021). Difference-in-Differences with Multiple Time Periods. Journal of Econometrics, 225(2), 200–230. 链接提供作者论文版本,讨论多期DID识别与估计。
- Lewis, P., et al. (2020). Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. 检索增强生成。
- BERTopic官方算法文档. 语义表示、聚类和主题词生成的组合流程。
- scikit-learn官方文档:文本特征提取、朴素贝叶斯、聚类、评价指标。
- NetworkX中心性算法文档. 网络指标定义与实现入口。
方法实施时应以实际安装版本的文档为准,并记录版本。对外部资料中的经验结论,应核对其语言、领域、数据规模和评价条件能否迁移到当前研究。
