展开知识库目录
论文结论互相冲突,到底该信哪一篇:先判断是否真冲突,再比较证据
两篇论文得出相反结论,不一定真的互相推翻。先把研究问题、设计、样本、结局和不确定性对齐,再判断是表面冲突、方法差异,还是真正没有定论。
一篇说有效,一篇说无效,学生只看期刊和被引次数选了“更可信”的那篇
学生整理远程随访对糖尿病管理的研究:论文 A 报告 HbA1c 明显下降,论文 B 说组间差异不显著。他没有继续看对象、干预和时间点,而是比较期刊分区和被引次数,最后在综述里写“高质量研究证明远程随访有效”。导师追问后才发现,A 比较的是干预前后变化,B 比较的是干预组与常规管理组;A 随访 12 周,B 随访 12 个月,两篇回答的并不是同一个问题。
处理冲突不能先投票,更不能用期刊名替代方法判断。第一步是确认两项研究是否在同一对象、同一处理、同一比较、同一结局和相近时间点上给出了可比较估计;只有比较问题对齐,才进入偏倚风险、效应量和证据确定性的判断。
- 判断两篇论文是否真的冲突
- 把冲突定位到设计、估计或解释层
- 写出带边界的综合结论
“结论不一致”至少有五种,处理办法完全不同
| 看到的现象 | 先检查什么 | 更准确的判断 | 不能直接怎么写 |
|---|---|---|---|
| 一篇显著,一篇不显著 | 效应方向、效应量、置信区间、样本量与模型 | 两个区间可能高度重叠,只是精度不同 | 不能自动写成两项研究结论相反 |
| 一篇有效,一篇无效 | 对照方式、结局定义、测量时间与分析集 | 研究问题可能不相同 | 不能按论文数量少数服从多数 |
| 相同数据得出不同表述 | Results 数值与 Discussion 用词 | 结果估计一致,作者解释强度不同 | 不能把作者语气当成新证据 |
| 不同人群方向相反 | 纳入标准、基线风险、地区、剂量和实施条件 | 可能存在真实异质性或效应修饰 | 不能把一个人群的结论外推给所有人 |
| 后发表研究推翻早期研究 | 样本、预注册、偏倚风险、更正与数据完整性 | 可能是证据更新,也可能只是新一轮不确定 | 不能只按发表时间决定输赢 |
“不显著”只说明当前数据和模型下没有越过预设统计阈值,不等于已经证明没有效应。
先对齐问题,再比较方法,最后才看结果
- 01
把比较问题写成同一行
为每篇记录对象、干预或暴露、对照、结局、时间点和目标估计。任一核心字段不同,先分组,不急着判定冲突。
验收:遮住论文题名,只看这一行也能说清它实际回答了什么。 - 02
确认实际分析样本
区分招募人数、纳入人数、完成随访人数和进入模型的人数;检查排除、失访、交叉与缺失处理是否改变组间可比性。
验收:每个结果数字都有明确分母。 - 03
使用与设计匹配的偏倚判断
随机试验检查随机化、偏离干预、缺失、结局测量和选择性报告;观察性研究还要检查选择、混杂和暴露分类。不要用一张万能分数表给所有设计排名。
验收:每个风险判断都能指向方法段或补充材料。 - 04
比较效应估计和不确定性
记录效应方向、量级、置信区间和分析模型,而不是只抄 p 值。需要合并时再判断单位、定义和统计模型是否兼容。
验收:可以解释差异来自效果大小还是估计精度。 - 05
把剩余差异写成待解释问题
检查人群、剂量、依从性、实施质量、随访时间和测量工具。没有足够证据解释时,明确写“当前无法确定”,不编造机制。
验收:结论包含适用对象和不确定性来源。
四篇都研究远程随访,但只有其中两篇能直接比较
下面的 A–D 是为说明方法编写的教学案例,不是真实论文结果。
| 研究 | 实际设计 | 报告结果 | 放进冲突表后怎么处理 |
|---|---|---|---|
| A | 12 周随机试验,远程随访对比常规管理 | 组间 HbA1c 差异及区间 | 可与相同对象、对照、结局和时间点的随机试验比较 |
| B | 12 周单组前后研究 | 干预后比基线下降 | 不能与 A 的组间效应直接对立;缺少同期对照 |
| C | 12 个月随机试验 | 早期下降,12 个月区间跨零 | 提示效果可能随时间变化,需保留两个时间点 |
| D | 横断面问卷 | 使用远程服务者自报管理更好 | 属于关联证据,不能写成干预有效或无效 |
真正的判断必须回到目标论文原文、注册记录、补充材料和更正状态;本表只演示对齐顺序。
好的结论会解释差异,不会强行选出赢家
可以这样写:‘在短期、含同期对照的研究中,远程随访与 HbA1c 改善方向一致,但估计精度和偏倚风险不同;单组前后研究不能排除时间趋势,较长随访的效果仍不确定。现有结果更支持短期可能获益,而不足以证明长期效果。’这段话交代了哪些证据可比、哪些只能补充,以及结论为什么没有越界。
如果比较表最后只剩“作者说有效/无效”和“期刊高/低”,说明还没有完成证据比较。回到 Methods、Results 和风险判断,把每个冲突还原成可以检查的差异。
