研究、证据与推理
从问题与主张出发,选择方法、评价来源、连接证据与结论,处理冲突、不确定性和研究充分性。
先确定研究要支持的判断
研究从一个需要回答的问题开始。读者可能想确认事实、理解机制、比较方案,或决定是否采用某个做法。不同目标要求的证据不同:版本文档可以说明接口的定义,实际配置可以说明启用了什么,一次运行可以说明某个环境中发生了什么。判断方法效果还需要样本、比较条件和评价指标。
例如,下面是一组构造问题:“给文档增加摘要,能否改善阅读?”可以进一步拆成三个问题:摘要是否忠实保留原文的主要信息;读者是否更容易找到答案;制作与维护摘要是否值得投入。第一个问题可通过对照文本检查,第二个需要相应读者和任务证据,第三个还要结合使用频率、维护成本与具体目标。仅有一个问题的答案,无法同时支持三个判断。
拆分时明确对象、场景、时间或版本、约束和预期结果。影响方向的未知条件要确认或作为假设说明;已经清楚的范围直接沿用。研究过程中发现问题设定有误,也可以调整问题,再检查已有资料是否仍然相关。
“关键主张”是其错误或缺失会改变主要理解、选择或操作的陈述。把注意力放在这些主张上,有助于安排核查投入。例如“摘要准确”是事实与文本关系,“摘要使查找更快”是效果判断,“所有文章都应加摘要”则还包含推广和价值取舍。它们需要分别成立。
选择能支持主张的研究方法
边界明确的事实,可先定位并核对直接材料;多个来源共同承担一个判断时,需要比较它们的对象、方法与适用范围;要确认效果,则需要相应实证设计。后果越大、争议越明显、信息越易变,或依据越间接,越需要深化研究。
| 要回答的问题 | 可以从哪里开始 | 仍需留意什么 |
|---|---|---|
| 某版本如何规定一个接口 | 对应版本的官方定义与说明 | 文档版本、例外条件及实现是否遵守 |
| 当前项目为何产生某个结果 | 有效配置、入口、调用关系和相关测试 | 未执行的路径、替换依赖和运行条件 |
| 某方法在什么情况下有效 | 原始研究、数据、案例及比较设计 | 样本、基线、偏差与推广范围 |
| 多种方法怎样取舍 | 相关来源的综合与共同维度比较 | 不可比数据、缺失结果及价值权重 |
针对问题的资料比较,可以形成有依据的调研。正式系统综述、快速综述等方法名称带有相应领域的实施要求。PRISMA 2020 提供系统综述的报告指导,其本身不评价综述的方法质量;使用报告清单也不能替代实际完成的方法工作。1
跨领域借用方法时,先辨认原方法承担的任务,再选择当前问题需要的部分。以下比较来自 2026-10-04 的定向研究,未执行正式系统综述,也没有测量这些方法在中文文档生产中的效果。
| 来源与原任务 | 可以借用的判断方式 | 采用边界 |
|---|---|---|
| Cochrane Handbook:医疗干预证据综合 | 按问题安排检索,识别同一研究的多个报告,检查遗漏 | 正式流程需要相应资源与专业方法;日常资料比较不能仅凭引用该手册自称系统综述2 |
| PRISMA 2020:系统综述报告 | 让读者能辨认方法、材料和结果 | 报告指导与方法质量分别评价;不据清单固定所有文章的栏目1 |
| Cochrane Rapid Reviews:资源受限的证据综合 | 明确方法调整和由此产生的限制 | 原研究取得官方方法入口,未取得所链接 BMJ 论文全文;没有采用未读到的具体程序3 |
| ODNI ICD 203:分析判断 | 区分来源信息、假设、推断、不确定性和替代解释 | 不移植情报机构的保密要求与专有概率词表4 |
| GRADE:特定结局的证据体评价 | 检查偏倚、不一致、间接性、不精确和发表偏倚 | 正式分级有专门方法;没有实施时,不给技术文章自授 GRADE 等级5 |
| ACM SIGSOFT Empirical Standards:软件工程实证研究 | 使主张与实际研究设计、执行和报告相匹配 | 按所声称的方法使用,普通调研不自动承担全部实证标准6 |
时间或访问限制可能迫使研究收窄。需要具体交代限制了哪些材料或场景,以及哪些判断因此不能确认。“没有找到”应连同检索范围表达;只有一个渠道没有发现资料,能支持的结论范围也限于该渠道。
让来源与主张相匹配
读到一份材料,先辨认它能够提供什么依据。规定、作者经验、实现、受控试验和真实使用观察,各自回答不同问题。来源声誉有助于选择阅读入口,最终仍需判断材料怎样支持当前主张。
核查承担关键判断的正文及上下文,保留作者或机构、材料标题、日期或版本和相关章节。涉及转引时沿来源链追到原始依据;只能取得二手材料,就准确说明取得范围。搜索摘要和 Agent 摘要适合定位线索,关键判断需要核对实际材料。
还要检查来源的独立性。五篇介绍可能都转述同一个试验;同一项研究也可能有不同时间或结果的报告。Cochrane 在研究选择中要求识别并归并同一研究的多个报告,这个视角有助于避免将转载篇数计为独立验证。其完整流程服务特定证据综合任务,日常调研按当前问题落实必要核查。2
对效果材料尤其要问:研究了谁或什么,如何选择样本,与什么比较,用什么指标测量,是否有系统性偏差,目标场景有什么差异。对仓库材料要问:代码是否位于实际入口,配置是否生效,测试是否替换了外部环节,断言究竟检查了什么。文档存放在站内或站外,都按这些问题评价。
对于陌生且承担关键判断的网页,可以离开该页查作者背景、机构关系和独立来源,再返回评价内容。Wineburg 与 McGrew 的横向阅读研究比较了 10 位历史学者、10 位专业事实核查者和 25 位斯坦福本科生在社会政治网页评价中的表现,提供了这种来源核查的采用线索。对象与任务限定了结论:它没有直接验证 Agent 的研究效果,也没有要求每份已熟悉资料都重复一套步骤。7
把证据接到结论
证据进入判断,需要经过解释:材料提供了什么结果,哪些前提成立,能够支持哪一部分主张,仍缺什么。推理和建议也保留成立条件,读者才知道自己的情境变化后是否还能采用。
继续使用摘要的构造情境。假设一次试用记录:第一天,五名熟悉主题的读者使用带摘要的页面;第二天,五名不熟悉主题的读者使用无摘要页面。前一组找答案更快。这个差异同时伴随读者基础和试验条件的变化,因此还需要检查这些替代解释,才能判断摘要的作用。直接写“摘要导致阅读更快”会超出现有构造证据。
如果进一步安排可比任务、记录读者基础并控制其他变化,判断的依据会更明确;结果仍受任务、样本和测量方式限制。这个例子只展示推理问题,没有执行读者试验,也不提供摘要有效的实证结论。ODNI 分析标准将信息、假设与判断区分,并要求在重要不确定性下评价合理替代解释;这里借用的是分析视角。4
数字同样需要准确口径。断言下界、逐项观察和总体效果各自需要相应证据;百分比要说明分母,时间要说明窗口,比较要确认双方用同一指标。后面的构造案例展示这种核对。
由事实提出建议,还要增加取舍推理。即使摘要帮助了一类任务,是否采用仍取决于目标读者、全文长度、查找方式及维护成本。把这些条件写清楚,比为每种方法排出脱离场景的总名次更有用。
一个结果怎样限制结论
以下为构造案例。某资料检索方法在三份固定材料上接受十个指定查询。事先制定的门槛是:至少九个查询取得目标资料,其中两个指定查询必须成功。只取得“检查通过”的记录,没有逐查询输出。
这份记录能够支持“满足预先设定的门槛”。它不能确定实际成功数恰好是十,也不能给出哪些非强制查询失败。后来另一组材料取得十次成功,结果属于另一组输入;两份记录各自保留来源与条件。
从此结果提出采用建议,还需考虑材料规模、查询类型、用户任务及错误代价。三个固定输入可以帮助确认一项局部关系;面向更大资料库的判断需要相应证据。这些要求来自结论所覆盖的范围。
| 实际取得的内容 | 可以判断 | 还需什么才能扩大判断 |
|---|---|---|
| 有效检查的通过记录,门槛为至少9/10 | 已测材料满足该门槛 | 逐项输出才能确认精确结果 |
| 不同输入的一组10/10观察 | 新输入中的该组结果 | 同范围复查或独立材料才能讨论稳定性 |
| 方法定义与实施材料 | 所声明规则及实际使用方式 | 相应效果观察才能确认使用结果 |
例子的目的在于区分检查条件、精确观察和推广范围,没有执行真实读者或检索试验。
分歧与未知怎样进入判断
来源冲突时,先确认是否讨论同一对象、版本、时点、指标和场景。例如,一份材料讨论首次阅读,另一份讨论精确查阅,结果不同可能来自目标差异。范围相同仍有冲突,再比较方法、直接性、样本与独立性;暂时无法消除的分歧,保留为分歧,不能按来源数量投票。
重要未知应说明它缺在哪里、影响哪一项判断、当前还能判断到哪一步,以及什么新证据会改变结论。可以写:“已有文本对照支持摘要忠实;尚无相应读者数据,查找效率暂不能确认。后续需在目标读者和可比任务中观察查找表现。”未知由此真正约束建议。没有估计方法时,不为判断编造百分比或正式证据等级。4
区分事件发生的可能性与判断依据的可靠程度也很有用。作者认为某结果可能出现,仍可能只有薄弱依据;稳定的观察结果也可能只覆盖很窄的环境。表述同时保留结果范围和依据范围。
何时可以结束研究
结束前回到原问题:主要问题是否有相应回答,关键材料和条件是否核对,有合理理由怀疑的反例与替代方案是否处理,剩余缺口会不会改变正文的确定性判断。广泛或争议问题,还需要检查检索是否遗漏决定性材料。
扩展查找反复出现相同依据,可以作为继续研究收益下降的线索;已知但未处理的关键来源仍需处理。Cochrane 对停止检索的讨论提醒,停止规则的正式评价有限,证据稀少时尤其应谨慎。日常调研的停止判断,应结合问题覆盖、证据质量和剩余风险。2
事实问题在直接依据确认且无未处理疑点时,可以结束;需要确认的效果仍缺相应证据,就要继续研究或明确限制当前可交付的判断范围。资源耗尽、稿件写完或达到某个来源数量,都不能独立证明研究充分。
把支持主要判断的出处、条件、必要推理和检查信息留在最终成果中,就能支持后续复核。提供可重跑材料表示具备复查条件;实际重跑以及换数据、换场景后的验证分别需要执行记录。NASEM 对可重复计算与独立数据检验的区分,也提醒相同材料的再运行不会自动扩大结论范围。8 组织成果时,将关键依据和成立条件保留在它实际支持的判断附近。
Footnotes
-
Page 等,2021,The PRISMA 2020 statement,Scope of the guideline、How to use PRISMA 2020。 ↩ ↩2
-
Cochrane Handbook,Chapter 4: Searching for and selecting studies,4.4.11、4.6.1–4.6.2。本文借用核查视角,不宣称完成正式 Cochrane 系统综述。 ↩ ↩2 ↩3
-
Cochrane,Cochrane Rapid Reviews Methods。2026-10-04 取得官方入口,所链接 BMJ 方法论文 DOI
10.1136/bmj-2023-076335全文未取得;不据此声称已执行其具体程序。 ↩ -
ODNI,Intelligence Community Directive 203: Analytic Standards,D.6.e.(1)–(4)。采用信息、假设、判断及不确定性和替代解释的区分,未移植情报专有概率词表。 ↩ ↩2 ↩3
-
Cochrane Handbook,Chapter 14: Completing “Summary of findings” tables and grading the certainty of the evidence,§14.2.1–14.2.2。借用影响可信程度的关注点,未实施正式 GRADE 评价。 ↩
-
ACM SIGSOFT,Empirical Standards,General Standard、Systematic Reviews。来源核查归属 2026-10-04 的研究,按其原任务解释主张与方法的对应。 ↩
-
Wineburg、McGrew,Lateral Reading and the Nature of Expertise,原研究 PDF 第 2 页摘要及网页评价任务。2026-10-04 读取;样本构成与任务范围不提供 Agent 效果结论。 ↩
-
NASEM,2019,Reproducibility and Replicability in Science,Conclusion 3-1,DOI
10.17226/25303。原研究于 2026-10-04 读取定义,用于区分计算材料、实际再运行和扩大证据范围。 ↩
最后更新于