返回Skills库

科学批判性思维

MIT
📊 数据知识
K-Dense-AI

评估科学声明和证据质量。用于评估实验设计有效性、识别偏见和混杂因素、应用证据分级框架(GRADE、Cochrane偏倚风险),或进行批判分析教学。最适合用于理解证据质量、识别缺陷。用于正式同行评审写作请使用peer-review技能。

科学批判性思维

概述

批判性思维是评估科学严谨性的系统过程。使用GRADE和Cochrane ROB框架评估方法学、实验设计、统计有效性、偏见、混杂和证据质量。应用此技能进行科学声明的批判性分析。

何时使用此技能

当您需要以下操作时,应使用此技能:

  • 评估研究方法学和实验设计
  • 评估统计有效性和证据质量
  • 识别研究中的偏见和混杂因素
  • 审查科学声明和结论
  • 进行系统评价或元分析
  • 应用GRADE或Cochrane偏倚风险评估
  • 对研究论文进行批判性分析

科学示意图的视觉增强

使用此技能创建文档时,始终考虑添加科学图表和示意图以增强视觉沟通。

如果您的文档尚未包含示意图或图表:

  • 使用scientific-schematics技能生成AI驱动的 publication 质量图表
  • 只需用自然语言描述您想要的图表
  • Nano Banana Pro将自动生成、审查和完善示意图

对于新文档: 默认应生成科学示意图,以可视化方式表示文本中描述的关键概念、工作流程、架构或关系。

如何生成示意图:

python scripts/generate_schematic.py "your diagram description" -o figures/output.png

AI将自动:

  • 创建具有适当格式的 publication 质量图像
  • 通过多次迭代进行审查和完善
  • 确保可访问性(色盲友好,高对比度)
  • 将输出保存在figures/目录中

何时添加示意图:

  • 批判性思维框架图
  • 偏见识别决策树
  • 证据质量评估流程图
  • GRADE评估方法图
  • 偏倚风险评估框架
  • 有效性评估可视化
  • 任何受益于可视化的复杂概念

有关创建示意图的详细指导,请参考scientific-schematics技能文档。


核心能力

1. 方法学批判

评估研究方法学的严谨性、有效性和潜在缺陷。

应用场景:

  • 审查研究论文
  • 评估实验设计
  • 评估研究方案
  • 规划新研究

评估框架:

  1. 研究设计评估
  • 设计是否适合研究问题?
  • 设计能否支持所提出的因果声明?
  • 对照组是否适当且充分?
  • 考虑实验、准实验或观察性设计是否合理
  1. 有效性分析
  • 内部有效性: 我们能否信任因果推断?
  • 检查随机化质量
  • 评估混杂控制
  • 评估选择偏倚
  • 审查流失/辍学模式
  • 外部有效性: 结果是否可推广?
  • 评估样本代表性
  • 考虑设置的生态有效性
  • 评估条件是否与目标应用匹配
  • 构念有效性: 测量是否捕获了预期构念?
  • 审查测量验证
  • 检查操作定义
  • 评估测量是直接的还是代理的
  • 统计结论有效性: 统计推断是否合理?
  • 验证足够的功率/样本量
  • 检查假设符合情况
  • 评估测试适当性
  1. 控制和盲法
  • 随机化是否正确实施(序列生成、分配隐藏)?
  • 盲法是否可行并已实施(参与者、提供者、评估者)?
  • 对照条件是否适当(安慰剂、活性对照、无治疗)?
  • 表现或检测偏倚是否可能影响结果?
  1. 测量质量
  • 仪器是否经过验证且可靠?
  • 测量是否尽可能客观,或主观且承认局限性?
  • 结果评估是否标准化?
  • 是否使用多种测量来三角测量发现?

参考: 请参阅references/scientific_method.md获取详细原则,以及references/experimental_design.md获取综合设计清单。

2. 偏见检测

识别和评估可能扭曲发现的潜在偏见来源。

应用场景:

  • 审查已发表的研究
  • 设计新研究
  • 解释相互矛盾的证据
  • 评估研究质量

系统性偏见审查:

  1. 认知偏见(研究者)
  • 确认偏见: 是否只强调支持性发现?
  • HARKing: 假设是先验陈述还是在看到结果后形成的?
  • 发表偏见: 负面结果是否从文献中缺失?
  • cherry-picking: 证据是否被选择性报告?
  • 检查预注册和分析计划透明度
  1. 选择偏见
  • 抽样偏见: 样本是否代表目标人群?
  • 志愿者偏见: 参与者是否以系统方式自我选择?
  • 流失偏见: 组间流失是否有差异?
  • 生存偏见: 样本中是否只有"幸存者"可见?
  • 检查参与者流程图并比较基线特征
  1. 测量偏见
  • 观察者偏见: 期望是否可能影响观察?
  • 回忆偏见: 回顾性报告是否系统地不准确?
  • 社会期望: 反应是否偏向可接受性?
  • 仪器偏见: 测量工具是否系统地出错?
  • 评估盲法、验证和测量客观性
  1. 分析偏见
  • P-hacking: 是否进行了多次分析直到出现显著性?
  • 结果切换: 非显著结果是否被显著结果取代?
  • 选择性报告: 是否报告了所有计划的分析?
  • 亚组钓鱼: 亚组分析是否在未校正的情况下进行?
  • 检查研究注册并与已发表结果比较
  1. 混杂
  • 哪些变量可能同时影响暴露和结果?
  • 混杂因素是否被测量和控制(通过设计或统计方法)?
  • 未测量的混杂是否可以解释发现?
  • 是否有合理的替代解释?

参考: 请参阅references/common_biases.md获取带有检测和缓解策略的综合偏见分类。

3. 统计分析评估

批判性评估统计方法、解释和报告。

应用场景:

  • 审查定量研究
  • 评估数据驱动的声明
  • 评估临床试验结果
  • 审查元分析

统计审查清单:

  1. 样本大小和功率
  • 是否进行了先验功率分析?
  • 样本是否足以检测有意义的效应?
  • 研究是否功效不足(常见问题)?
  • 小样本的显著结果是否会引起效应大小膨胀的标志?
  1. 统计测试
  • 测试是否适合数据类型和分布?
  • 测试假设是否被检查并满足?
  • 参数测试是否合理,或应使用非参数替代方案?
  • 分析是否与研究设计匹配(例如,配对vs独立)?
  1. 多重比较
  • 是否测试了多个假设?
  • 是否应用了校正(Bonferroni、FDR等)?
  • 主要结果是否与次要/探索性结果区分?
  • 多重测试是否可能导致假阳性发现?
  1. P值解释
  • P值是否被正确解释(原假设为真时数据的概率)?
  • 非显著性是否被错误解释为"无效应"?
  • 统计显著性是否与实际重要性混淆?
  • 是否报告了确切的P值,还是仅报告"p < .05"?
  • 是否有可疑的聚类刚好低于.05?
  1. 效应大小和置信区间
  • 效应大小是否与显著性一起报告?
  • 是否提供置信区间以显示精确性?
  • 效应大小在实际意义上是否有意义?
  • 标准化效应大小是否在领域特定背景下解释?
  1. 缺失数据
  • 有多少数据缺失?
  • 是否考虑了缺失数据机制(MCAR、MAR、MNAR)?
  • 缺失数据如何处理(删除、插补、最大似然)?
  • 缺失数据是否可能偏向结果?
  1. 回归和建模
  • 模型是否过拟合(预测变量过多,无交叉验证)?
  • 是否在数据范围之外进行预测(外推)?
  • 多重共线性问题是否得到解决?
  • 模型假设是否被检查?
  1. 常见陷阱
  • 相关性被视为因果关系
  • 忽略向均值回归
  • 基率忽视
  • 德克萨斯神枪手谬误(在噪声中寻找模式)
  • 辛普森悖论(亚组混杂)

参考: 请参阅references/statistical_pitfalls.md获取详细的陷阱和正确做法。

4. 证据质量评估

系统评估证据的强度和质量。

应用场景:

  • 权衡决策证据
  • 进行文献综述
  • 比较相互矛盾的发现
  • 确定结论的信心

证据评估框架:

  1. 研究设计层次
  • 系统评价/元分析(干预效果最高)
  • 随机对照试验
  • 队列研究
  • 病例对照研究
  • 横断面研究
  • 病例系列/报告
  • 专家意见(最低)

重要: 更高层次的设计并不总是质量更好。设计良好的观察性研究可能比执行不良的RCT更强。

  1. 设计类型内的质量
  • 偏倚风险评估(使用适当工具:Cochrane ROB、Newcastle-Ottawa等)
  • 方法学严谨性
  • 透明度和报告完整性
  • 利益冲突
  1. GRADE考虑因素(如适用)
  • 从设计类型开始(RCT = 高,观察性 = 低)
  • 降级因素:
  • 偏倚风险
  • 研究间不一致
  • 间接性(错误的人群/干预/结果)
  • 不精确性(宽置信区间,小样本)
  • 发表偏见
  • 升级因素:
  • 大效应大小
  • 剂量-反应关系
  • 混杂因素会减少(而非增加)效应
  1. 证据收敛
  • 更强时:
  • 多个独立复制
  • 不同研究组和设置
  • 不同方法收敛于相同结论
  • 机制和经验证据一致
  • 更弱时:
  • 单一研究或研究组
  • 文献中发现相互矛盾
  • 发表偏见明显
  • 无复制尝试
  1. 情境因素
  • 生物学/理论合理性
  • 与已建立知识的一致性
  • 时间性(原因先于效应)
  • 关系的特异性
  • 关联强度

参考: 请参阅references/evidence_hierarchy.md获取详细层次、GRADE系统和质量评估工具。

5. 逻辑谬误识别

检测和命名科学论证和声明中的逻辑错误。

应用场景:

  • 评估科学声明
  • 审查讨论/结论部分
  • 评估科普传播
  • 识别有缺陷的推理

科学中常见的谬误:

  1. 因果谬误
  • 事后归因: "B跟随A,所以A导致B"
  • 相关性=因果关系: 混淆关联与因果关系
  • 反向因果: 将原因误认为结果
  • 单一原因谬误: 将复杂结果归因于一个因素
  1. 概括谬误
  • 草率概括: 从小样本得出广泛结论
  • 轶事谬误: 个人故事作为证明
  • cherry-picking: 只选择支持性证据
  • 生态谬误: 将群体模式应用于个人
  1. 权威和来源谬误
  • 诉诸权威: "专家说的,所以是真的"(无证据)
  • 人身攻击: 攻击人,而非论点
  • 遗传谬误: 按起源判断,而非优点
  • 诉诸自然: "自然=好/安全"
  1. 统计谬误
  • 基率忽视: 忽略先验概率
  • 德克萨斯神枪手: 在随机数据中寻找模式
  • 多重比较: 未校正多重测试
  • 检察官谬误: 混淆P(E|H)与P(H|E)
  1. 结构谬误
  • 虚假二分法: "要么A要么B",当存在更多选项时
  • 移动球门柱: 达到证据标准后更改标准
  • 循环论证: 循环推理
  • 稻草人: 歪曲论点以攻击它们
  1. 科学特定谬误
  • 伽利略策略: "他们嘲笑伽利略,所以我的边缘想法是正确的"
  • 诉诸无知: "未被证明为假,所以是真的"
  • 涅槃谬误: 拒绝不完美的解决方案
  • 不可证伪性: 提出不可测试的声明

识别谬误时:

  • 命名特定谬误
  • 解释推理为何有缺陷
  • 确定有效推断所需的证据
  • 注意谬误推理并不证明结论为假—只是这个论点不支持它

参考: 请参阅references/logical_fallacies.md获取带有示例和检测策略的综合谬误目录。

6. 研究设计指导

为规划严谨研究提供建设性指导。

应用场景:

  • 帮助设计新实验
  • 规划研究项目
  • 审查研究提案
  • 改进研究方案

设计过程:

  1. 研究问题细化
  • 确保问题具体、可回答且可证伪
  • 验证它解决了文献中的差距或矛盾
  • 确认可行性(资源、伦理、时间)
  • 操作定义变量
  1. 设计选择
  • 匹配设计到问题(因果→实验;关联→观察)
  • 考虑可行性和伦理约束
  • 在被试间、被试内或混合设计之间选择
  • 计划析因设计(如果测试多个因素)
  1. 偏见最小化策略
  • 尽可能实施随机化
  • 计划在所有可行级别实施盲法(参与者、提供者、评估者)
  • 识别并计划控制混杂因素(随机化、匹配、分层、统计调整)
  • 标准化所有程序
  • 计划最小化流失
  1. 样本规划
  • 进行先验功率分析(指定预期效应、所需功率、alpha)
  • 在样本量中考虑流失
  • 定义明确的纳入/排除标准
  • 考虑招募策略和可行性
  • 计划样本代表性
  1. 测量策略
  • 选择经过验证、可靠的仪器
  • 尽可能使用客观测量
  • 计划关键构念的多种测量(三角测量)
  • 确保测量对预期变化敏感
  • 建立评分者间可靠性程序
  1. 分析规划
  • 预先指定所有假设和分析
  • 明确指定主要结果
  • 计划带有假设检查的统计测试
  • 指定如何处理缺失数据
  • 计划报告效应大小和置信区间
  • 考虑多重比较校正
  1. 透明度和严谨性
  • 预注册研究和分析计划
  • 使用报告指南(CONSORT、STROBE、PRISMA)
  • 计划报告所有结果,而不仅仅是显著结果
  • 区分验证性和探索性分析
  • 承诺数据/代码共享

参考: 请参阅references/experimental_design.md获取覆盖从问题到传播所有阶段的综合设计清单。

7. 声明评估

系统评估科学声明的有效性和支持。

应用场景:

  • 评估论文中的结论
  • 评估媒体对研究的报道
  • 审查摘要或介绍声明
  • 检查数据是否支持结论

声明评估过程:

  1. 识别声明
  • 究竟在声称什么?
  • 是因果声明、关联声明还是描述性声明?
  • 声明强度如何(已证明、可能、建议、可能)?
  1. 评估证据
  • 提供了什么证据?
  • 证据是直接的还是间接的?
  • 证据是否足以支持声明的强度?
  • 替代解释是否被排除?
  1. 检查逻辑连接
  • 结论是否从数据中得出?
  • 是否有逻辑跳跃?
  • 相关数据是否用于支持因果声明?
  • 局限性是否被承认?
  1. 评估比例性
  • 信心是否与证据强度成比例?
  • 对冲词是否被适当使用?
  • 局限性是否被淡化?
  • 推测是否被明确标记?
  1. 检查过度概括
  • 声明是否超出了所研究的样本?
  • 人口限制是否被承认?
  • 上下文依赖性是否被认识到?
  • 是否包含关于概括的警告?
  1. 红旗
  • 来自相关研究的因果语言
  • "证明"或绝对确定性
  • 精选引用
  • 忽略矛盾证据
  • 忽视局限性
  • 超出数据的外推

提供具体反馈:

  • 引用有问题的声明
  • 解释支持它所需的证据
  • 如果需要,建议适当的对冲语言
  • 区分数据(发现的内容)和解释(其含义)

应用指南

一般方法

  1. 保持建设性
  • 识别优势和弱点
  • 建议改进而非仅仅批评
  • 区分致命缺陷和次要局限性
  • 认识到所有研究都有局限性
  1. 保持具体
  • 指向具体实例(例如,"表2显示..."或"在方法部分...")
  • 引用有问题的陈述
  • 提供问题的具体示例
  • 参考违反的特定原则或标准
  1. 保持比例
  • 批评严重程度与问题重要性匹配
  • 区分对有效性的主要威胁和次要关注
  • 考虑问题是否影响主要结论
  • 承认自己评估中的不确定性
  1. 应用一致标准
  • 对所有研究使用相同标准
  • 不对您不喜欢的发现应用更严格的标准
  • 承认自己的潜在偏见
  • 基于方法学而非结果做出判断
  1. 考虑上下文
  • 承认实际和伦理约束
  • 考虑领域特定的效应大小和方法规范
  • 认识到探索性vs验证性上下文
  • 在评估研究时考虑资源限制

提供批判时

反馈结构:

  1. 摘要: 简要概述评估内容
  2. 优势: 做得好的地方(对可信度和学习很重要)
  3. 关注点: 按严重程度组织的问题
  • 关键问题(威胁主要结论的有效性)
  • 重要问题(影响解释但非致命)
  • 次要问题(值得注意但不改变结论)
  1. 具体建议: 可操作的改进建议
  2. 总体评估: 关于证据质量和可得出结论的平衡结论

使用精确术语:

  • 命名特定的偏见、谬误和方法学问题
  • 参考已建立的标准和指南
  • 引用科学方法学的原则
  • 准确使用技术术语

不确定时

  • 承认不确定性: "这可能是X或Y;需要的额外信息是Z"
  • 询问澄清问题: "[方法学细节]是否完成?这影响解释。"
  • 提供条件评估: "如果X完成,则Y随之而来;如果没有,则Z是关注点"
  • 注意什么额外信息会解决不确定性

参考材料

此技能包括提供批判性评估详细框架的综合参考材料:

  • `references/scientific_method.md` - 科学方法学的核心原则、科学过程、批判性评估标准、科学声明中的红旗、因果推断标准、同行评审和开放科学原则
  • `references/common_biases.md` - 认知、实验、方法学、统计和分析偏见的综合分类,带有检测和缓解策略
  • `references/statistical_pitfalls.md` - 常见的统计错误和误解,包括P值误解、多重比较问题、样本量问题、效应大小错误、相关性/因果关系混淆、回归陷阱和元分析问题
  • `references/evidence_hierarchy.md` - 传统证据层次、GRADE系统、研究质量评估标准、领域特定考虑、证据综合原则和实用决策框架
  • `references/logical_fallacies.md` - 科学话语中常见的逻辑谬误,按类型组织(因果、概括、权威、相关性、结构、统计),带有示例和检测策略
  • `references/experimental_design.md` - 综合实验设计清单,涵盖研究问题、假设、研究设计选择、变量、抽样、盲法、随机化、对照组、程序、测量、偏见最小化、数据管理、统计规划、伦理考虑、有效性威胁和报告标准

何时查阅参考:

  • 当需要详细框架时,将参考加载到上下文中
  • 使用grep搜索参考中的特定主题:grep -r "pattern" references/
  • 参考提供深度;SKILL.md提供程序指导
  • 查阅参考获取综合列表、详细标准和具体示例

记住

科学批判性思维是关于:

  • 使用已建立原则进行系统评估
  • 建设性批判,改进科学
  • 与证据强度成比例的信心
  • 关于不确定性和局限性的透明度
  • 标准的一致应用
  • 认识到所有研究都有局限性
  • 怀疑与对证据开放之间的平衡

始终区分:

  • 数据(观察到的内容)和解释(其含义)
  • 相关性和因果关系
  • 统计显著性和实际重要性
  • 探索性和验证性发现
  • 已知和不确定的内容
  • 反对声明的证据和支持原假设的证据

批判性思维的目标:

  1. 准确识别优势和弱点
  2. 确定支持哪些结论
  3. 认识到局限性和不确定性
  4. 为未来工作建议改进
  5. 推进科学理解

兼容工具

Claude CodeOpenClawHermes Agent

数据来源:claude-scientific-skillsMIT 许可) | 查看上游来源

上游项目:K-Dense-AI/scientific-agent-skills / claude-scientific-skills | 收录时间:2026-08-18 | 更新:2026-08-18

本页面内容基于上游开源许可项目整理,仅供学习参考。AI铺子不对第三方内容承担责任, 详情请参阅免责声明