展开知识库目录

论文结论互相冲突,到底该信哪一篇:先判断是否真冲突,再比较证据

两篇论文得出相反结论,不一定真的互相推翻。先把研究问题、设计、样本、结局和不确定性对齐,再判断是表面冲突、方法差异,还是真正没有定论。

先看最常见的误判

一篇说有效,一篇说无效,学生只看期刊和被引次数选了“更可信”的那篇

学生整理远程随访对糖尿病管理的研究:论文 A 报告 HbA1c 明显下降,论文 B 说组间差异不显著。他没有继续看对象、干预和时间点,而是比较期刊分区和被引次数,最后在综述里写“高质量研究证明远程随访有效”。导师追问后才发现,A 比较的是干预前后变化,B 比较的是干预组与常规管理组;A 随访 12 周,B 随访 12 个月,两篇回答的并不是同一个问题。

处理冲突不能先投票,更不能用期刊名替代方法判断。第一步是确认两项研究是否在同一对象、同一处理、同一比较、同一结局和相近时间点上给出了可比较估计;只有比较问题对齐,才进入偏倚风险、效应量和证据确定性的判断。

  • 判断两篇论文是否真的冲突
  • 把冲突定位到设计、估计或解释层
  • 写出带边界的综合结论
先给冲突分类

“结论不一致”至少有五种,处理办法完全不同

看到的现象先检查什么更准确的判断不能直接怎么写
一篇显著,一篇不显著效应方向、效应量、置信区间、样本量与模型两个区间可能高度重叠,只是精度不同不能自动写成两项研究结论相反
一篇有效,一篇无效对照方式、结局定义、测量时间与分析集研究问题可能不相同不能按论文数量少数服从多数
相同数据得出不同表述Results 数值与 Discussion 用词结果估计一致,作者解释强度不同不能把作者语气当成新证据
不同人群方向相反纳入标准、基线风险、地区、剂量和实施条件可能存在真实异质性或效应修饰不能把一个人群的结论外推给所有人
后发表研究推翻早期研究样本、预注册、偏倚风险、更正与数据完整性可能是证据更新,也可能只是新一轮不确定不能只按发表时间决定输赢

“不显著”只说明当前数据和模型下没有越过预设统计阈值,不等于已经证明没有效应。

按固定顺序比较

先对齐问题,再比较方法,最后才看结果

  1. 01

    把比较问题写成同一行

    为每篇记录对象、干预或暴露、对照、结局、时间点和目标估计。任一核心字段不同,先分组,不急着判定冲突。

    验收:遮住论文题名,只看这一行也能说清它实际回答了什么。
  2. 02

    确认实际分析样本

    区分招募人数、纳入人数、完成随访人数和进入模型的人数;检查排除、失访、交叉与缺失处理是否改变组间可比性。

    验收:每个结果数字都有明确分母。
  3. 03

    使用与设计匹配的偏倚判断

    随机试验检查随机化、偏离干预、缺失、结局测量和选择性报告;观察性研究还要检查选择、混杂和暴露分类。不要用一张万能分数表给所有设计排名。

    验收:每个风险判断都能指向方法段或补充材料。
  4. 04

    比较效应估计和不确定性

    记录效应方向、量级、置信区间和分析模型,而不是只抄 p 值。需要合并时再判断单位、定义和统计模型是否兼容。

    验收:可以解释差异来自效果大小还是估计精度。
  5. 05

    把剩余差异写成待解释问题

    检查人群、剂量、依从性、实施质量、随访时间和测量工具。没有足够证据解释时,明确写“当前无法确定”,不编造机制。

    验收:结论包含适用对象和不确定性来源。
用一个教学案例对齐

四篇都研究远程随访,但只有其中两篇能直接比较

下面的 A–D 是为说明方法编写的教学案例,不是真实论文结果。

研究实际设计报告结果放进冲突表后怎么处理
A12 周随机试验,远程随访对比常规管理组间 HbA1c 差异及区间可与相同对象、对照、结局和时间点的随机试验比较
B12 周单组前后研究干预后比基线下降不能与 A 的组间效应直接对立;缺少同期对照
C12 个月随机试验早期下降,12 个月区间跨零提示效果可能随时间变化,需保留两个时间点
D横断面问卷使用远程服务者自报管理更好属于关联证据,不能写成干预有效或无效

真正的判断必须回到目标论文原文、注册记录、补充材料和更正状态;本表只演示对齐顺序。

把综合结论写到证据能承担的位置

好的结论会解释差异,不会强行选出赢家

可以这样写:‘在短期、含同期对照的研究中,远程随访与 HbA1c 改善方向一致,但估计精度和偏倚风险不同;单组前后研究不能排除时间趋势,较长随访的效果仍不确定。现有结果更支持短期可能获益,而不足以证明长期效果。’这段话交代了哪些证据可比、哪些只能补充,以及结论为什么没有越界。

如果比较表最后只剩“作者说有效/无效”和“期刊高/低”,说明还没有完成证据比较。回到 Methods、Results 和风险判断,把每个冲突还原成可以检查的差异。

本篇依据

证据强弱要分设计评估,并把确定性与单篇研究质量分开