第一章 新闻与舆情问题定义

传媒大数据专业,大三上, 新闻与舆情数据学, 2026

← 返回《新闻与舆情数据学》课程主页

本章导读

新闻与舆情数据分析的起点不是选择算法,而是明确研究对象和判断任务。同一公共事件可以被理解为一组已经发生的事实、一系列新闻报道、公众在不同平台上的表达、平台推动的信息扩散,以及政府、媒体、企业或社会组织采取的回应行动。如果这些层次没有区分清楚,后续的词频、情感分类、主题模型和传播网络即使计算正确,也可能回答了错误的问题。

本章用 4 课时建立全课程的分析框架。学生将学习新闻与舆情的基本概念、网络舆情的构成和生命周期、社会计算的研究视角、研究问题的操作化方法,以及大模型参与新闻与舆情分析时必须遵守的证据原则。课堂最终产物是一份可以贯穿后续课程的项目立项书。

学习目标

完成本章后,学生应能:

  1. 区分新闻事实、新闻报道、公众意见、网络舆情和舆情数据。
  2. 从主体、客体、媒介、时间、关系与行动等维度描述一个舆情事件。
  3. 解释网络舆情的形成、发酵、回应和演化过程。
  4. 将宽泛选题转化为具有明确对象、平台、时间窗和指标的研究问题。
  5. 区分原始事实、结构化数据、模型结果、研究解释和行动建议。
  6. 说明大模型可以辅助哪些工作,以及哪些判断必须由人负责。

课前准备

每名学生选择一个公共事件,准备以下材料:

  • 一份能够说明基本事实的权威材料,如正式通报、法规文件或原始采访。
  • 两篇来自不同媒体的新闻报道。
  • 若干公开平台帖文、评论或问答。
  • 一张与事件相关的图片或一段短视频,并记录其最初看到的页面和发布时间。
  • 一句话写出自己对事件舆情的初步判断,同时列出支持该判断还缺少的证据。

课前材料只用于课堂研究设计,不要求学生对事件作价值表态。

一 新闻 舆情与舆情数据

1 新闻与新闻事件

新闻是对新近发生、具有公共意义的事实的报道。新闻事件是报道所指向的现实事件,新闻报道则是媒体对事实进行选择、组织和呈现后的信息产品。二者不能混为一谈。

一项事实进入新闻生产后,会经过信源选择、采访核实、标题制作、叙事组织、图片配置和发布渠道选择。不同媒体可能围绕同一事件选择不同角度,突出不同主体,使用不同因果解释。这种差异不必然意味着某一报道失实,但说明新闻文本并不是现实的完整复制。

分析新闻报道时可以关注:

  • 报道选择了哪些事实,遗漏了哪些尚未确认的信息。
  • 标题、导语和正文分别突出什么。
  • 谁获得了直接发言机会,谁只被他人描述。
  • 事件被放入何种框架,如责任、冲突、风险、民生或技术框架。
  • 报道发布在事件发展的哪个时间节点。

2 舆情与网络舆情

舆情可以理解为一定社会情境中,公众围绕公共事务形成和表达的认知、情绪、态度、立场、诉求与行动倾向。网络舆情强调这些表达通过互联网平台产生、聚集、传播和变化。

网络舆情至少包含以下要素:

要素说明需要回答的问题
舆情主体参与表达、传播和回应的个人或组织谁在发声,谁保持沉默,谁能够影响可见度
舆情客体被评价的事件、人物、机构、政策或行为公众究竟在评价什么
舆情内容事实判断、情绪、立场、责任归因和诉求表达了什么,针对哪个对象
媒介平台新闻网站、社交平台、视频平台、搜索与即时通信渠道表达在哪里发生,平台机制如何影响传播
关系结构转发、回复、关注、引用、共现和跨平台搬运信息通过什么关系流动
时空情境事件地点、发布时间、关键节点和社会背景为什么某种表达在此时此地出现
回应行动政府、企业、媒体、平台或社会组织的回应回应是否覆盖主要疑问,是否引发新的讨论

舆情不是评论的简单集合。未公开表达的人、只浏览不互动的人、无法接入特定平台的人同样属于现实社会。网络数据只能观察一部分可见表达,因此任何结论都要说明平台、时间和样本范围。

3 舆情数据

舆情数据是研究者为了描述或解释舆情现象而采集、整理和构造的数据。它既包括文本,也包括行为、关系、时间和多媒体信息。

常见类型包括:

  • 新闻标题、正文、栏目、作者、发布时间和转载关系。
  • 帖文、评论、弹幕、话题标签和搜索词。
  • 点赞、收藏、评论、转发等互动指标。
  • 账号之间的回复、引用、转发或关注关系。
  • 图片、音频、视频及其元数据。
  • 政府通报、企业声明、媒体更正和后续政策行动。
  • 问卷、访谈和线下观察等非平台数据。

“能够采集”不等于“适合使用”。研究者需要考虑数据授权、个人信息保护、平台规则、版权、抽样偏差和数据安全。

二 新闻传播过程中的数据

新闻与舆情数据学关注新闻生命周期中不同环节的数据生产和使用。

1 新闻生产

新闻生产环节包括线索发现、事实核查、采访、编辑、发布与更新。相应数据包括信源记录、稿件版本、发布时间、标题修改和更正说明。大模型可以辅助整理资料、转写采访和生成摘要,但不能替代信源核实和编辑责任。

2 新闻内容

内容分析关注报道主题、人物、机构、地域、情绪、立场、框架和叙事结构。传统内容分析强调编码规则和人工一致性;计算方法则可以处理更大规模的文本。两者需要结合:人工定义概念和边界,算法扩大处理规模,人工再检查模型错误。

3 新闻传播

传播分析关注报道如何通过转载、推荐、分享和跨平台搬运获得可见度。传播量由内容价值、账号影响力、平台推荐、发布时间和外部事件共同决定,不能只用“内容好坏”解释。

4 新闻效果

阅读量、点赞和评论属于可观察行为,不自动等于认同、信任或态度改变。若要讨论传播效果,需要问卷、实验、访谈或更严格的因果设计。平台互动数据更适合描述“发生了什么行为”,而不是直接推断“人们内心怎样想”。

三 社会计算的分析视角

社会计算研究如何利用计算方法观察、模拟和理解社会行为。新闻与舆情数据分析通常结合三类知识:

  1. 传播与社会理论:帮助提出有意义的问题,解释媒介、群体、制度和情境。
  2. 数据与统计方法:帮助完成抽样、测量、比较、估计和不确定性表达。
  3. 计算方法:帮助处理大规模文本、网络、多媒体和动态数据。

三者不能相互替代。只有技术而没有理论,容易形成“有什么数据就分析什么”;只有理论而没有测量,难以检验判断;只有模型指标而没有数据质量控制,结论可能建立在偏差样本上。

从概念到数据

研究者需要完成一条操作化链路:

传播学概念
  -> 可观察现象
  -> 分析单位
  -> 数据字段
  -> 指标或标签
  -> 模型与评测
  -> 结论及适用范围

例如,“机构回应是否改善了公众态度”包含多个需要澄清的问题:公众指哪些人,态度针对哪个对象,改善用什么指标表示,如何排除时间、平台流量和新事实的影响。若只能获得评论数据,更稳妥的问题可能是“回应发布前后,所采集评论中的责任归因和主要诉求如何变化”。

四 舆情事件的生命周期

网络舆情往往经历诱发、扩散、聚集、回应、再解释和衰减等过程,但现实事件并不一定按固定顺序发展。

1 诱发阶段

现实事件、新闻报道、个人爆料、政策发布或旧材料再传播都可能成为诱因。此时需要首先确认原始事实和最早公开来源,避免把转载时间当作事件发生时间。

2 扩散阶段

少量内容通过媒体报道、平台推荐、关键账号转发和跨平台搬运获得注意。研究重点包括首发节点、传播路径、内容变形和平台之间的时间差。

3 聚集与发酵阶段

讨论量快速增加,主题、情绪、立场和责任归因逐渐形成。某些表达因为更具情绪性、更符合群体经验或更适合平台传播而获得突出位置。此时的高热度不等于观点已经一致。

4 回应与博弈阶段

涉事机构、媒体、平台和其他主体发布回应。回应可能补充事实、纠正错误,也可能因内容模糊、时间滞后或态度不当引发第二轮讨论。分析时应比较回应是否覆盖公众关注的核心问题。

5 演化与衰减阶段

事件可能逐渐退出公共注意,也可能因调查结果、司法进展、纪念节点或相似事件再次进入讨论。衰减不意味着问题得到解决,也可能只是注意力转移。

6 事件时间线

建议将关键节点整理为:

事实发生时间
  -> 首次公开时间
  -> 首篇报道或原始帖文
  -> 媒体集中报道
  -> 平台讨论高峰
  -> 机构首次回应
  -> 新证据或更正出现
  -> 讨论衰减或再次升温

每个节点都要记录来源、发布时间和核验状态。大模型可以帮助抽取候选节点,但不得凭模型记忆补齐缺失事实。

五 从宽泛主题到研究问题

“研究某事件的网络舆情”只是选题方向,不是可执行研究问题。一个可操作问题通常需要明确六项内容:

  1. 研究对象:具体事件、政策、机构或议题。
  2. 时间范围:从何时到何时,为什么这样划分。
  3. 数据空间:哪些媒体、平台或地区。
  4. 分析单位:文章、帖文、评论、账号、转发边或时间段。
  5. 核心变量:主题、情感、立场、框架、传播或回应效果。
  6. 比较关系:平台之间、时间节点前后、主体之间或内容类型之间。

可以使用以下句式:

在【时间窗】内,【平台或媒体集合】关于【事件】的内容中,【主体】对【对象】呈现出哪些【主题、情绪、立场、框架或传播特征】,这些特征在【比较条件或关键节点】下如何变化?

示例

  • 宽泛主题:分析某公共安全事件的网络舆情。
  • 初步问题:公众如何看待该事件?
  • 可操作问题:首次通报发布前后 48 小时内,新闻客户端与短视频平台公开评论中的责任归因框架和主要诉求如何变化?
  • 分析单位:一条去重后的公开评论。
  • 可观察指标:各责任归因标签比例、主题分布、评论增速、不同平台的标签差异。
  • 结论边界:结果只描述所采集平台和时间窗中的公开表达,不能代表全体公众意见,也不能仅凭前后变化证明回应产生因果效果。

六 常见概念误区

1 把热度等同于态度

热度由发帖量、互动量、推荐机制和事件节奏共同决定。高热度只能说明内容受到注意,不能说明公众支持或反对。

2 把情感等同于立场

“我很失望,但仍支持这项政策”表现为负面情绪和支持立场。情感分析必须说明评价对象,立场分析必须说明针对的命题。

3 把相关等同于因果

机构回应后讨论量下降,可能来自回应本身,也可能来自夜间流量下降、平台推荐变化或新事件分流。没有额外设计时,只能描述时间上的共同变化。

4 把平台用户等同于全体公众

平台用户结构、表达意愿和账号活跃度存在差异。少数高活跃账号也可能贡献大量内容。报告需要说明样本来自哪里。

5 把模型标签等同于真实属性

模型输出是按照特定数据、标签和参数得到的测量结果。它可能受到训练数据、提示词、语境和类别不平衡影响,必须通过人工样本评测。

七 AI 时代的证据观

大模型能够生成连贯文本、提取信息和解释代码,但语言流畅性不能证明事实正确。课程采用五层证据链:

层级内容核验要求
原始材料通报、法规、采访、原始帖文、可验证图片或视频检查来源、时间、完整上下文和真实性
结构化数据经过采集、清洗、去重和编码的数据保留数据来源、处理规则和版本
模型结果分类标签、主题、摘要、实体关系和相似度使用金标准、指标和错误样本评价
研究解释对数据模式及传播情境的说明比较替代解释,避免因果越界
行动建议面向媒体、政府、企业或平台的建议指明证据依据、适用条件和潜在风险

高层结论必须能够向下追溯。若一句建议无法回到原始材料或可靠数据,应补充证据、降低表述强度或删除。

大模型适合辅助的工作

  • 生成检索词和同义表达候选。
  • 辅助抽取人物、机构、时间和事件关系。
  • 根据已有编码规则完成候选分类。
  • 对给定证据生成结构化摘要。
  • 生成反例、边界案例和代码调试建议。

必须由人负责的工作

  • 确定研究问题和概念定义。
  • 判断数据是否获得合法授权,是否涉及隐私或敏感信息。
  • 核验人名、机构、数字、时间、引语和来源。
  • 确定模型错误是否影响结论。
  • 作出因果解释、伦理判断和行动建议。
  • 对最终发布内容承担责任,并披露人工智能参与环节。

生成内容的识别与标识

当前舆情环境同时存在人类创作与人工智能生成的文本、图片、音频和视频。研究者需要记录平台提供的生成内容声明、可见标识和文件元数据。未发现标识不能证明内容由人类创作,发现生成痕迹也不能自动证明其陈述为假。内容来源、生成方式和事实真伪是三个需要分别判断的问题。

八 课堂活动设计

活动一 新闻事实与舆情表达分层

教师提供同一事件的通报、新闻报道、平台评论和生成式摘要。小组将材料拆分为:

  • 已核验事实。
  • 媒体选择和叙事框架。
  • 公众情绪、立场和诉求。
  • 平台互动与传播信号。
  • 尚未核实的主张。

小组说明每一项判断所需的证据,不能把重复出现次数当作真实性证明。

活动二 五类陈述标注

学生将短文本中的句子标为“事实、数据、模型结果、研究解释、行动建议”。无法确认的内容标记为“待核验”。

示例:“模型将 62% 的评论判定为负面”属于模型结果。解释它还需要知道数据来源、样本量、分析单位、标签定义、模型版本、测试集表现和负面情感所针对的对象。

活动三 事件问题树

每组选定一个贯穿案例,绘制问题树:

  1. 最终希望解释或判断什么?
  2. 需要哪些子问题支撑核心判断?
  3. 每个子问题需要哪些数据和字段?
  4. 哪些内容可以用文本分析回答?
  5. 哪些内容需要网络、时间序列、问卷或访谈?
  6. 哪些数据可能获取不到,哪些结论容易越界?

活动四 大模型来源核验

向大模型询问同一事件的时间线并要求提供来源。学生逐条检查来源,将结果记录为“支持、部分支持、不支持、无法访问”。若链接能够打开,还要判断页面是否真正支持模型给出的主张。

九 本章小结

新闻与舆情数据学研究的不只是文本,而是事实、报道、公众表达、平台传播和回应行动之间的关系。可靠分析需要从理论概念出发,明确分析单位和数据边界,再选择统计、文本、网络或大模型方法。

本课程后续各章都服务于同一条证据链:数据从哪里来,经过怎样的处理,模型产生什么结果,模型可能错在哪里,研究者依据什么作出解释,以及最终结论适用于什么范围。

课后任务

提交一份项目立项书,包括:

  1. 事件名称及其新闻价值。
  2. 一句话研究问题。
  3. 研究对象、平台、时间窗和分析单位。
  4. 事件生命周期中的关键节点。
  5. 至少三类数据来源及其可信度。
  6. 计划分析的主题、情绪、立场、框架或传播关系。
  7. 预期采用的方法及传统基线。
  8. 可能的数据偏差、伦理风险和结论边界。
  9. 人工智能参与计划,包括允许使用的环节、必须人工核验的内容和披露方式。

自测题

  1. 新闻事件与新闻报道有什么区别?
  2. 为什么评论区不能直接代表全体公众?
  3. 互动量、情感和立场分别测量什么?
  4. 将“分析某品牌危机舆情”改写为一个可操作研究问题。
  5. “机构回应后负面评论减少,因此回应有效”存在哪些推断问题?
  6. “模型将 62% 评论判为负面”属于哪一层证据?还需要哪些信息才能解释?
  7. 大模型生成的来源链接能够打开,是否意味着其结论已经得到支持?为什么?
  8. 哪些数据不应直接上传到公共大模型?