第2讲:舆情分析报告指南

传媒大数据专业,大三上, 新闻与舆情数据学, 2026

← 返回课程主页 · 上一讲:新闻与舆情问题定义

本讲导读

第一讲区分了新闻事实、新闻报道、公众表达、平台传播与回应行动。本讲进一步讨论:如何把这些不同层次的材料组织成一份可信的舆情分析报告?

本讲以《第9讲:数据分析报告写作指南》为基础,将一般数据分析报告的写作框架转化为舆情研究场景中的具体要求。一般报告需要说明研究问题、数据来源、方法、结果和建议;舆情报告还要交代事件事实是否核实、平台表达能代表谁、情绪针对什么对象、传播关系能否验证,以及建议能否解决真实诉求。

本讲提前展示课程最终成果的写法。学生暂时不需要掌握全部文本模型和网络算法,可以先用小样本人工编码、频数表和证据记录完成一份简报,再在后续课程中逐步完善。

学习目标与课前准备

完成本讲后,学生应能:

  1. 根据使用场景区分监测快报、专题报告和复盘报告。
  2. 写出包含事件、平台、时间窗与核心问题的标题和摘要。
  3. 说明监测范围、采集限制、分析单位、去重规则与指标分母。
  4. 分别分析议题、情绪、立场、诉求和传播,避免概念混用。
  5. 组织“判断—证据—解释—边界—建议”的结果段落。
  6. 提交包含来源表、编码规则、图表底表和 AI 使用说明的报告。

课前请带上第一讲的项目立项书,选取一份事件原始材料、两篇不同来源的报道和 20—30 条公开表达作为试编码材料。记录出处与时间;材料不足时可以使用本讲模拟案例进行写作训练,必须标注模拟性质。

一、舆情分析报告要回答什么

1.1 从“发生了什么”到“证据允许判断什么”

舆情分析报告面向一个具体公共事件或议题,系统呈现已核实事实、可见表达、传播变化、争议焦点与回应情况,为进一步核查、信息公开和问题解决提供依据。

报告应回答六个问题:

核心问题需要的证据不能直接替代它的材料
事件发生了什么,哪些信息仍待核实原始文件、可核查记录、相互印证的材料热门评论、无出处截图
观察到了哪些表达,来自哪里平台、检索式、时间窗、样本筛选记录“全网热议”等笼统措辞
主要争议与诉求是什么编码分布、典型与反例文本单纯的高频词排行榜
情绪和立场如何分布明确评价对象的标注与核验结果一个不解释口径的“负面率”
讨论如何变化、如何传播分时数据、新闻节点、实际转发或引用关系仅凭同时出现推断传播路径
应回应什么,如何判断后续变化诉求与回应的对应关系、后续观察指标“加强引导、降低热度”等空泛口号

报告中的批评表达可能指出真实问题。分析的价值在于识别问题、核查信息和改善沟通,不能以压低讨论量作为唯一成功标准。

1.2 三种常见报告

类型主要任务写作重点
监测快报在明确截止时点提供当前情况已知事实、变化信号、待核实事项、下一次更新安排
专题分析回答一个相对完整的问题数据方法、议题结构、群体或平台差异、证据边界
事件复盘回顾发展过程与回应表现时间线、关键节点、回应覆盖、替代解释与改进方案

快报允许信息不完整,但不允许把未知写成确定;复盘可以利用后续材料,但要区分“当时能够知道的信息”和“事后新增信息”。所有报告都应注明版本、数据截止时间和撰写时间。

二、先搭建报告结构

推荐使用以下结构。篇幅可以调整,证据链不能省略。

部分应写清的内容常见问题
标题与版本事件、主题、范围、截止时间标题大于实际数据覆盖范围
摘要问题、数据、主要发现、限制、建议只有背景,没有实际发现
事件背景与事实时间线已知事实、信息来源、待核实事项把报道或声明直接等同于事实
研究问题2—4 个能够用材料回答的问题把所有可用方法都列为目标
数据与处理来源、筛选、缺失、单位、去重和偏差只有“采集了若干条数据”
方法与指标定义、计算口径、编码及核验办法指标名称明确,分母却不明确
分析结果按研究问题组织证据与解释按软件操作步骤堆砌截图
主要判断与建议发现、行动、责任角色、验证方式建议无法回到前文证据
局限与待办当前不能判断什么、如何补证只写“样本有限”
来源与附录出处、底表、代码、编码表、AI 披露正文数字不可复查

写作顺序通常是:先确定研究问题和数据口径,再完成结果与图表,随后写判断和建议,最后写摘要与标题。这样可以减少摘要承诺了正文无法回答的问题。

三、标题、背景与研究问题

3.1 标题要给出范围

不推荐:《某事件全网舆情大数据深度分析》。如果只收集了一个平台的热门评论,“全网”与“大数据”都会误导读者。

可以写成:

《某市公共图书馆预约规则调整的争议焦点与信息需求——基于平台 A、B 七日公开评论的分析》

本讲以下所有“某市图书馆”材料均为教学模拟,不对应真实城市、机构、账号或实际舆情。

标题可采用“事件或议题 + 分析问题 + 数据范围”的结构。截止时间和版本可以放在副标题,不必把所有信息挤进标题。

3.2 背景写成具体问题

背景应从事件和信息缺口切入,例如:

【模拟场景】某市公共图书馆调整预约规则后,平台上出现关于预约入口、名额安排和特殊读者服务的讨论。分析需要区分对规则本身的反对、对操作流程的疑问和对执行体验的不满,以判断现有说明遗漏了哪些信息。

背景中的事实必须有来源。声称“引发广泛不满”本身就是一个需要验证的结论,不应作为未经论证的开场白。

3.3 把问题写到能分析的程度

本例可设定三个问题:

  1. 七日观察窗内,平台 A、B 的有效评论主要涉及哪些议题?
  2. 评论对预约规则持何种立场,这与情绪表达有何区别?
  3. 规则说明发布前后,可见讨论数量与议题构成如何变化,哪些问题仍需要回应?

每个问题都要对应一个数据产物。问题一对应议题编码表,问题二对应立场与情绪交叉表,问题三对应分时底表与回应对照表。若拿不到数据,应缩小问题或说明暂不能回答。

四、事件时间线与事实核验

4.1 建立两条时间线

事件线记录规则发布、服务变化和处理行动;传播线记录报道、讨论增长、转发和回应发布。两条线可以并排展示,但不能互相代替。

时间所属时间线记录内容来源编号当前证据状态
待填事件线某机构发布规则文件S01可确认文件发布时间与条款内容
待填传播线某报道引用用户体验S02可确认报道存在,体验细节仍需核查
待填传播线某说法在样本中重复出现S03可确认说法被传播,不能据此确认其真实性

记录发布时间、采集时间和事件发生时间,统一使用北京时间或明确标注其他时区。网页更新、内容删除和后续更正也应记录。

4.2 区分四种表达

  • 已核实事实:“公开文件第 X 条载明……”并给出原文位置。
  • 主体陈述:“机构在声明中表示……”说明是谁的主张。
  • 公众表达:“样本中有评论提出……”说明这是一类意见。
  • 分析者解释:“这一变化可能与……有关”并列出替代解释。

正式声明能够证明发布者作出了相应说明,涉及实际执行效果时仍需其他材料验证。原始帖文只能证明某种表达出现过,不能自动证明其所描述的经历真实发生。

五、数据来源与监测口径

5.1 数据说明的最低要求

项目必须交代的内容
对象与范围事件名称、平台名称、栏目或话题、地域限制及其依据
时间内容发布时间范围、采集时间、数据冻结时间与时区
检索完整关键词组合、别名、排除词、筛选规则及修改记录
获取方式人工整理、获准接口或公开数据集;按时间或热度排序;页数及上限
分析单位新闻篇、原帖条、评论条、账号个或转发关系条
样本变化原始数量、各步排除数量、最终有效数量
可见范围登录限制、无法获取的评论层级、缺失时段和删除内容
使用与保存获取和使用依据、脱敏方式、访问权限与保存安排

按热度取前若干条评论得到的是“可见热门评论样本”。它不等于随机样本,也不能因为数量多就代表所有用户。评论数量、账号数量和现实人口数量必须分别报告。

5.2 清洗时不要删除真实异议

去重首先解决同一平台、同一内容 ID 被重复采集的问题。同文转载是否保留,取决于研究任务:分析内容多样性时可以合并并保留频次;分析传播时需要保留转载记录及关系。不同账号表达相同观点,不能仅因观点相似就删除。

广告、无关内容和无法解释的空文本应依据预先写出的规则处理。高频发言或措辞相似只能构成待核查信号,不能直接判定为机器账号或协同行为。不要把批评、反讽或反对意见视为“噪声”。

5.3 贯穿案例的数据台账

以下全部数量均为教学模拟,仅用于练习计算与写作;不构成真实监测结果。

假设采集的是 D1—D7、两个平台按时间排序的公开评论,限定在所选相关帖子下。D4 零时发布一份规则说明,D1—D3 为说明前,D4—D7 为说明后。即使按时间采集,这个范围也不能覆盖平台全部讨论。

处理步骤本步排除量剩余量
原始采集记录1,500
剔除同一平台同一评论 ID 的重复采集1801,320
剔除按既定规则判断的无关内容901,230
剔除空文本且无可解释附件的记录301,200

最终平台 A 为 720 条、平台 B 为 480 条。这个 60% 对 40% 的构成是样本构成,不能写成两个平台在现实舆情中的市场份额或影响力份额。

六、变量、议题与诉求编码

6.1 最小数据字典

字段含义与记录规则
record_id / source_id脱敏后的唯一记录编号、来源编号
platform / published_at平台、内容发布时间
collected_at / parent_id采集时间、所属原帖或上级评论编号
text_clean分析文本;原始版本受控保留,便于核查
main_topic主议题,按编码手册单选;无法归类保留其他类别
sentiment / target情绪倾向及其评价对象;含混合、无法判断类别
stance对指定主张的支持、反对、条件性支持、不明确
demand具体诉求,可多选,另记“无明确诉求”
label_method / review_status人工或模型、版本、复核状态

正文只保留必要的匿名文本。公开展示时还要考虑原文检索可能重新识别个人,必要时使用注明为转述的表达,并将原文核验材料限制在授权范围内。

6.2 议题、情绪、立场和诉求不是同一个变量

例如一条模拟评论:“预约制度可以保留,但希望给老年读者留一个线下办理渠道。”

  • 议题:特殊读者服务。
  • 情绪:未表现明显情绪,可按手册标为中性。
  • 立场:对保留预约制度持条件性支持。
  • 诉求:提供线下办理渠道。

另一条模拟评论:“页面总是报错,真让人着急。”表达负面情绪,但不足以判断作者反对预约制度。必须固定“立场针对的主张”,不能把对执行方式的不满直接归为反对政策。

6.3 编码手册与核验

编码手册应列出每个类别的定义、纳入与排除条件、典型例子、反例以及多议题冲突的裁决顺序。先试标一小批文本,修订规则,再开展正式标注。

建议由两名成员独立标注一部分共同样本,报告复核样本如何选择、各类数量、原始一致情况与分歧处理办法。单标签名义变量可以使用 Cohen’s κ 等一致性指标;多标签任务需要另行说明计算方式。一致性高并不等于分类定义一定有效,仍须检查是否回答了研究问题。

使用模型时,应报告模型版本、提示词、输入处理、分类规则和人工核验表现。评估样本应覆盖不同平台、时段和类别,并与调试提示词使用的样本分开;有意多抽难例的诊断结果不能直接当作总体错误率。没有验证的数据应称为模型初步标注,不应伪装成人工确认的事实。

七、方法与指标如何写

7.1 方法必须对应问题

任务入门方法解释边界
描述讨论变化固定时间间隔的数量表与折线图反映采集范围内的表达量,不是社会关注总量
提炼争议焦点人工编码、主题频数、典型与反例词频高不必然表示态度重要或诉求强烈
比较平台表达平台内比例、交叉表差异可能来自排序、选帖或用户结构
分析情绪与立场对象明确的分类与交叉表情绪不等于立场,帖子不等于独立受访者
描述传播关系可核验的转发、回复或引用关系无关系数据时,只能讨论出现顺序或共现
评估回应诉求与回应对照、前后分时比较时间先后不能单独证明回应导致变化

7.2 每个比例都交代分母

主议题占比 = 该议题有效评论数 ÷ 全部纳入议题编码的有效评论数。

若主议题为互斥单选,各类合计应为 100%(允许四舍五入误差);若诉求允许多选,各类占比之和可以超过 100%,须注明分母是评论数而非标签总数。

“负面表达占比”需要写明评价对象、分类方法,以及分母是否包含无法判断的文本。如果排除了 100 条无法判断文本,必须说明排除数量,不能仍按全部文本解释。对非概率采集的评论,不应套用简单随机抽样的误差范围宣称代表全体公众。

互动量也有口径:同一帖文的点赞数是某一采集时点的累计快照,不能把多次快照相加当新增点赞。不同平台的点赞、阅读、评论通常要分别呈现;若构造综合指数,应披露标准化、权重和敏感性,不能把人为指数当作客观风险等级。

八、把结果写成可核查的发现

8.1 模拟案例:议题结构

以下是前述 1,200 条模拟有效评论的主议题单选结果:

主议题评论数占全部有效评论比例
预约操作流程42035%
预约名额安排36030%
特殊读者服务24020%
其他议题18015%
合计1,200100%

弱写法:“流程占 35%,名额占 30%,特殊服务占 20%。”

改进写法:

【模拟结果】在两个平台所选帖文的 1,200 条有效评论中,预约操作流程为最大单一主议题,占 35%(420 条),但未超过半数。这表明流程说明值得优先检查;其余议题合计占 65%,报告不能把全部争议概括为操作困惑。该结果描述的是本次评论样本,不能推断 35% 的读者遇到了流程障碍。下一步应结合具体文本,核查疑问对应的步骤及现有说明。

这里依次呈现了判断、数量证据、解释、边界和补证方向。解释不能只靠更强的语气,必须说明证据究竟支持到哪里。

8.2 模拟案例:比例上升与数量下降同时发生

时段天数有效评论数特殊读者服务评论数时段内占比
D1—D3,说明前380012015%
D4—D7,说明后440012030%
合计71,20024020%

不能写:“说明发布后特殊服务问题翻倍,舆情明显恶化。”

可以写:

【模拟结果】说明后,特殊读者服务议题占比从 15% 升至 30%,增加 15 个百分点,但两个时段的该议题评论均为 120 条。由于时段长度不同,其日均数量实际由 40 条降至 30 条。该议题在较少的整体讨论中相对突出,不能据此认定问题发生数量翻倍,也不能单凭总评论减少认定说明产生了缓解效果。

总评论日均约由 266.7 条降至 100 条。解释时还需检查帖子覆盖、采集连续性、平台构成、工作日差异和事件自然衰减。若要评价回应的因果效果,需要更充分的设计、对照与假设检验;本讲的前后比较只作描述。

8.3 典型评论如何引用

引用要服务于已经说明的类别,而非挑几条极端表达代表全部样本。为每条引文附匿名编号、平台、日期、类别与出处记录,并解释选取原则。每类尽量检查典型、边界和反例文本。

可写:“以下转述用于说明‘特殊读者服务’类别的含义,不用于估计该观点的普遍程度。”不能把 AI 生成的示例评论写成真实用户引语。

九、图表、传播与回应的表达

9.1 保留能够回答问题的图表

图表应提供的信息应避免的问题
事件与传播时间线时间、节点、出处、核验状态把所有节点连成未经证明的因果链
讨论量折线图时间间隔、数量、采集中断、回应节点把缺测记为零,用总量比较不同长度时段
议题条形图条数、比例、分母、编码方式用词云代替议题判断
立场构成图评价主张、全部类别、样本量隐藏不明确类别或只画正负两类
传播网络图节点、边、方向、时间与覆盖范围无转发证据却声称找到源头或组织者
回应对照表诉求、对应原文、覆盖状态、待核查项用发文次数代替问题解决程度

图注模板:“图 2 平台 A、B 所选帖文有效评论的主议题分布;观察窗:D1—D7;n=1,200;主议题单选;来源:教学模拟数据。”正式报告将模拟说明替换为真实来源编号、采集日期和处理口径。

柱状图通常从零起始;颜色除区分类别外不要暗示未经定义的风险。每幅图都应有底表和正文解释,不能只放截图。

9.2 回应覆盖与风险判断

回应对照表可以按“已回应、部分回应、未见回应、无法判断”编码,但需要给出判定标准与原文位置。“已回应”表示有对应说明,不表示承诺已落实,也不表示公众已接受。

观察到的问题下一步行动执行角色验证办法
流程议题占模拟样本 35%对照评论中的问题逐步检查预约说明服务与信息维护人员用户能否依照说明完成关键步骤
特殊服务议题在说明后仍有表达核查现有文件是否覆盖线下办理等诉求,补充可执行信息服务管理人员回应条款覆盖、办理记录及后续反馈
某项事实说法缺少出处查找原始记录,说明当前核验状态核验人员是否获得可复查的证据与更正记录

本表是模拟案例的行动设计,不是对真实机构的判断。实际报告应为行动补充负责人、预计完成时间和复查日期。

风险应分开讨论事实不确定性、服务影响、表达变化与传播扩散。大量负面表达不必然构成高风险,数量不大的可核实服务障碍也可能需要优先处理。使用等级时须明示标准、证据和适用条件;不要自行给出无来源的“行业统一阈值”。

十、摘要与结论怎么写

10.1 摘要应浓缩实质内容

摘要可以按照“问题—范围—方法—发现—限制—行动”组织,写完正文后再检查数字与措辞。

【教学模拟摘要】本报告考察某市公共图书馆预约规则调整后七日内的主要争议,基于平台 A、B 所选帖文下的 1,200 条有效公开评论,采用主议题编码与分时比较。结果显示,预约操作流程占 35%,为最大单一主议题;特殊读者服务议题在说明前后的占比由 15% 升至 30%,但数量均为 120 条,日均数量有所下降。建议优先检查流程说明,并核查特殊读者服务信息是否充分。样本不覆盖全部平台讨论,前后变化亦不能单独证明说明的效果。本摘要所有数据均为模拟。

10.2 结论与局限要成对出现

每项结论后都应能指出一个表、图或材料编号。局限则要说明它具体影响哪个判断,并提出可行的补证方式。

局限影响的判断改进方向
仅选取部分相关帖文无法估计全部平台意见分布扩大选帖覆盖,记录统一选择规则
缺少稳定账号标识无法判断表达者人数及重复发言影响在获准范围内构造匿名标识或保留限制
反讽与多对象文本难分类情绪、立场比例可能受误判影响单列难例,人工复核并报告误差
仅有回应前后短期观察无法认定回应的因果作用延长观察并寻找合理比较基准

十一、大模型辅助写作与使用披露

大模型可以帮助整理提纲、提出候选编码、解释代码和检查语言。数据事实、数字计算、引文出处、分类结果和最终建议由报告作者负责。

可以使用以下提示词进行自查:

请只根据我提供的匿名结果表和来源记录检查这段报告。逐项列出:原句、支持它的表格或来源编号、是否超出证据、建议修改。缺少材料时写“无法核验”,不要补造数字、事实或引文。将相关关系和因果判断分开检查。

不要上传未经授权的原始个人信息。披露表应记录工具和模型标识、使用日期、参与环节、输入材料范围、关键提示词、采用内容及人工核验方式。模型不能作为事件原始来源;提示词记录也不能代替图表底表。

十二、可直接使用的报告模板

复制下列提纲并填写。尚未获得的结果保留“待分析”,不要用设想的结论填满模板。

标题:[事件/议题]的[具体问题]——基于[平台与时间窗]
版本:[版本号]    数据截止:[时间与时区]    撰写日期:[日期]

摘要
[研究问题、样本、方法、主要发现、限制与建议]

1. 事件背景与事实时间线
[事实、主体陈述、争议信息分别标注;附来源编号]

2. 研究问题与范围
[2—4 个问题;目标读者;对象、平台、时间和分析单位]

3. 数据来源与处理
[检索式、获取方式、排序、采集限制、样本流转、缺失与去重]

4. 方法与指标
[变量字典、编码规则、指标分母、模型或人工核验]

5. 分析结果(按实际研究问题设小节)
5.1 讨论规模与时间变化
5.2 议题、诉求与典型表达
5.3 情绪与立场(注明评价对象)
5.4 传播与回应(证据不足时明确不作相关判断)
[每节包含判断、证据、解释和边界]

6. 主要判断与行动建议
[3—5 项发现;逐项对应证据、行动角色、时间与验证方式]

7. 局限与待核实事项
[不能判断什么;所需补证;后续更新安排]

来源与参考资料
[编号、作者或机构、标题、发布时间、链接、访问日期]

附录
A. 数据字典与清洗日志
B. 编码手册与人工核验记录
C. 图表底表、代码或操作步骤
D. AI 使用说明与成员分工

十三、课堂练习与课后作业

13.1 课堂练习:从数字到判断(建议 90 分钟)

时间任务产物
0—15 分钟将项目题目缩小到可回答的问题一个标题、三个问题
15—35 分钟对 20—30 条课前材料进行试编码议题、对象、情绪、立场和诉求表
35—50 分钟用本讲模拟表计算数量、比例与日均变化计算表及分母说明
50—70 分钟写一个结果段落与一项建议有证据、有边界的段落
70—90 分钟交换检查来源与过度推断同伴反馈和修改记录

重点改写三个句子:“35% 的市民不会预约”“特殊服务问题翻倍”“说明成功平息舆情”。修改后不仅要换措辞,还要说明原句误用了哪个分析单位、指标或因果判断。

13.2 课后作业:一份可追溯的舆情简报

建议正文 2,000—3,000 字,另附来源与复现材料。使用第一讲选题,在可合法使用的范围内整理建议 80—150 条公开表达;样本量只是练习工作量建议,不构成代表性保证。若数据不足,可缩小研究范围并解释原因。

提交内容包括:

  1. 一份简报:具体标题、摘要、事实时间线、数据口径、分析结果、建议和局限。
  2. 至少两项具有明确解释的图表;每项附数据底表、单位、来源和分母。
  3. 一张编码表和一份编码手册,展示至少一轮共同样本复核及分歧处理。
  4. 来源记录、清洗日志、计算步骤或代码、AI 使用披露及小组分工。

本次可采用人工标注与电子表格,不要求复杂模型。有传播关系数据才进行网络分析;没有数据时不要为了补齐目录生成传播图。若使用模拟数据,须在标题、摘要、图表和数据说明中明确标注,并将结论限定为方法演示。

13.3 本讲作业建议评分标准

下表是为本讲设计的教学评分建议,不替代另行公布的课程总评安排。

维度分值评价依据
问题与范围10对象明确、问题具体、范围与数据匹配
事实与来源核验15区分事实和陈述、时间线可核查、未知有标注
数据口径与处理20分析单位、分母、检索和清洗完整,偏差说明具体
方法与分类核验15议题、情绪、立场定义清楚,核验过程可复查
结果解释与边界15数字正确,发现回应问题,无过度推断
图表与表达10图表服务判断,编号、底表和正文一致
行动建议10与证据对应,有执行角色和验证方式
复现与使用披露5附录、分工、AI 使用及材料处理说明完整
合计100重视证据质量与解释,不以模型复杂程度加分

十四、提交前检查清单

  • 标题、摘要和正文中的平台、时间窗、样本量一致。
  • 每项事件事实能回到原始来源,待核实内容明确标注。
  • 数据来源、检索式、排序方式、采集限制和去重规则完整。
  • 没有把评论数当人数,把样本分布当全体公众分布。
  • 每个比例有分母,多标签与无法判断类别的处理已说明。
  • 情绪和立场有明确对象,典型文本有来源与选取理由。
  • 前后比较同时检查数量、比例、时段长度和样本构成。
  • 没有把时间先后、共现或相关写成因果或传播关系。
  • 每项建议能对应发现,并说明实施与验证方式。
  • 图表底表、正文数字、摘要和结论逐一核对。
  • 模拟内容、AI 参与、隐私处理和方法限制如实披露。

延伸阅读与衔接

后续学习数据采集、文本分析与传播网络时,请持续更新这份报告的同一版本链:新增了什么证据,哪些判断因此改变,哪些问题仍不能回答。报告的成熟程度取决于证据与判断是否对应,而不是篇幅或图表数量。

返回课程主页 →