评估科学声明和证据质量。用于评估实验设计有效性、识别偏见和混杂因素、应用证据分级框架(GRADE、Cochrane偏倚风险),或进行批判分析教学。最适合用于理解证据质量、识别缺陷。用于正式同行评审写作请使用peer-review技能。
科学批判性思维
概述
批判性思维是评估科学严谨性的系统过程。使用GRADE和Cochrane ROB框架评估方法学、实验设计、统计有效性、偏见、混杂和证据质量。应用此技能进行科学声明的批判性分析。
何时使用此技能
当您需要以下操作时,应使用此技能:
- 评估研究方法学和实验设计
- 评估统计有效性和证据质量
- 识别研究中的偏见和混杂因素
- 审查科学声明和结论
- 进行系统评价或元分析
- 应用GRADE或Cochrane偏倚风险评估
- 对研究论文进行批判性分析
科学示意图的视觉增强
使用此技能创建文档时,始终考虑添加科学图表和示意图以增强视觉沟通。
如果您的文档尚未包含示意图或图表:
- 使用scientific-schematics技能生成AI驱动的 publication 质量图表
- 只需用自然语言描述您想要的图表
- Nano Banana Pro将自动生成、审查和完善示意图
对于新文档: 默认应生成科学示意图,以可视化方式表示文本中描述的关键概念、工作流程、架构或关系。
如何生成示意图:
python scripts/generate_schematic.py "your diagram description" -o figures/output.pngAI将自动:
- 创建具有适当格式的 publication 质量图像
- 通过多次迭代进行审查和完善
- 确保可访问性(色盲友好,高对比度)
- 将输出保存在figures/目录中
何时添加示意图:
- 批判性思维框架图
- 偏见识别决策树
- 证据质量评估流程图
- GRADE评估方法图
- 偏倚风险评估框架
- 有效性评估可视化
- 任何受益于可视化的复杂概念
有关创建示意图的详细指导,请参考scientific-schematics技能文档。
核心能力
1. 方法学批判
评估研究方法学的严谨性、有效性和潜在缺陷。
应用场景:
- 审查研究论文
- 评估实验设计
- 评估研究方案
- 规划新研究
评估框架:
- 研究设计评估
- 设计是否适合研究问题?
- 设计能否支持所提出的因果声明?
- 对照组是否适当且充分?
- 考虑实验、准实验或观察性设计是否合理
- 有效性分析
- 内部有效性: 我们能否信任因果推断?
- 检查随机化质量
- 评估混杂控制
- 评估选择偏倚
- 审查流失/辍学模式
- 外部有效性: 结果是否可推广?
- 评估样本代表性
- 考虑设置的生态有效性
- 评估条件是否与目标应用匹配
- 构念有效性: 测量是否捕获了预期构念?
- 审查测量验证
- 检查操作定义
- 评估测量是直接的还是代理的
- 统计结论有效性: 统计推断是否合理?
- 验证足够的功率/样本量
- 检查假设符合情况
- 评估测试适当性
- 控制和盲法
- 随机化是否正确实施(序列生成、分配隐藏)?
- 盲法是否可行并已实施(参与者、提供者、评估者)?
- 对照条件是否适当(安慰剂、活性对照、无治疗)?
- 表现或检测偏倚是否可能影响结果?
- 测量质量
- 仪器是否经过验证且可靠?
- 测量是否尽可能客观,或主观且承认局限性?
- 结果评估是否标准化?
- 是否使用多种测量来三角测量发现?
参考: 请参阅references/scientific_method.md获取详细原则,以及references/experimental_design.md获取综合设计清单。
2. 偏见检测
识别和评估可能扭曲发现的潜在偏见来源。
应用场景:
- 审查已发表的研究
- 设计新研究
- 解释相互矛盾的证据
- 评估研究质量
系统性偏见审查:
- 认知偏见(研究者)
- 确认偏见: 是否只强调支持性发现?
- HARKing: 假设是先验陈述还是在看到结果后形成的?
- 发表偏见: 负面结果是否从文献中缺失?
- cherry-picking: 证据是否被选择性报告?
- 检查预注册和分析计划透明度
- 选择偏见
- 抽样偏见: 样本是否代表目标人群?
- 志愿者偏见: 参与者是否以系统方式自我选择?
- 流失偏见: 组间流失是否有差异?
- 生存偏见: 样本中是否只有"幸存者"可见?
- 检查参与者流程图并比较基线特征
- 测量偏见
- 观察者偏见: 期望是否可能影响观察?
- 回忆偏见: 回顾性报告是否系统地不准确?
- 社会期望: 反应是否偏向可接受性?
- 仪器偏见: 测量工具是否系统地出错?
- 评估盲法、验证和测量客观性
- 分析偏见
- P-hacking: 是否进行了多次分析直到出现显著性?
- 结果切换: 非显著结果是否被显著结果取代?
- 选择性报告: 是否报告了所有计划的分析?
- 亚组钓鱼: 亚组分析是否在未校正的情况下进行?
- 检查研究注册并与已发表结果比较
- 混杂
- 哪些变量可能同时影响暴露和结果?
- 混杂因素是否被测量和控制(通过设计或统计方法)?
- 未测量的混杂是否可以解释发现?
- 是否有合理的替代解释?
参考: 请参阅references/common_biases.md获取带有检测和缓解策略的综合偏见分类。
3. 统计分析评估
批判性评估统计方法、解释和报告。
应用场景:
- 审查定量研究
- 评估数据驱动的声明
- 评估临床试验结果
- 审查元分析
统计审查清单:
- 样本大小和功率
- 是否进行了先验功率分析?
- 样本是否足以检测有意义的效应?
- 研究是否功效不足(常见问题)?
- 小样本的显著结果是否会引起效应大小膨胀的标志?
- 统计测试
- 测试是否适合数据类型和分布?
- 测试假设是否被检查并满足?
- 参数测试是否合理,或应使用非参数替代方案?
- 分析是否与研究设计匹配(例如,配对vs独立)?
- 多重比较
- 是否测试了多个假设?
- 是否应用了校正(Bonferroni、FDR等)?
- 主要结果是否与次要/探索性结果区分?
- 多重测试是否可能导致假阳性发现?
- P值解释
- P值是否被正确解释(原假设为真时数据的概率)?
- 非显著性是否被错误解释为"无效应"?
- 统计显著性是否与实际重要性混淆?
- 是否报告了确切的P值,还是仅报告"p < .05"?
- 是否有可疑的聚类刚好低于.05?
- 效应大小和置信区间
- 效应大小是否与显著性一起报告?
- 是否提供置信区间以显示精确性?
- 效应大小在实际意义上是否有意义?
- 标准化效应大小是否在领域特定背景下解释?
- 缺失数据
- 有多少数据缺失?
- 是否考虑了缺失数据机制(MCAR、MAR、MNAR)?
- 缺失数据如何处理(删除、插补、最大似然)?
- 缺失数据是否可能偏向结果?
- 回归和建模
- 模型是否过拟合(预测变量过多,无交叉验证)?
- 是否在数据范围之外进行预测(外推)?
- 多重共线性问题是否得到解决?
- 模型假设是否被检查?
- 常见陷阱
- 相关性被视为因果关系
- 忽略向均值回归
- 基率忽视
- 德克萨斯神枪手谬误(在噪声中寻找模式)
- 辛普森悖论(亚组混杂)
参考: 请参阅references/statistical_pitfalls.md获取详细的陷阱和正确做法。
4. 证据质量评估
系统评估证据的强度和质量。
应用场景:
- 权衡决策证据
- 进行文献综述
- 比较相互矛盾的发现
- 确定结论的信心
证据评估框架:
- 研究设计层次
- 系统评价/元分析(干预效果最高)
- 随机对照试验
- 队列研究
- 病例对照研究
- 横断面研究
- 病例系列/报告
- 专家意见(最低)
重要: 更高层次的设计并不总是质量更好。设计良好的观察性研究可能比执行不良的RCT更强。
- 设计类型内的质量
- 偏倚风险评估(使用适当工具:Cochrane ROB、Newcastle-Ottawa等)
- 方法学严谨性
- 透明度和报告完整性
- 利益冲突
- GRADE考虑因素(如适用)
- 从设计类型开始(RCT = 高,观察性 = 低)
- 降级因素:
- 偏倚风险
- 研究间不一致
- 间接性(错误的人群/干预/结果)
- 不精确性(宽置信区间,小样本)
- 发表偏见
- 升级因素:
- 大效应大小
- 剂量-反应关系
- 混杂因素会减少(而非增加)效应
- 证据收敛
- 更强时:
- 多个独立复制
- 不同研究组和设置
- 不同方法收敛于相同结论
- 机制和经验证据一致
- 更弱时:
- 单一研究或研究组
- 文献中发现相互矛盾
- 发表偏见明显
- 无复制尝试
- 情境因素
- 生物学/理论合理性
- 与已建立知识的一致性
- 时间性(原因先于效应)
- 关系的特异性
- 关联强度
参考: 请参阅references/evidence_hierarchy.md获取详细层次、GRADE系统和质量评估工具。
5. 逻辑谬误识别
检测和命名科学论证和声明中的逻辑错误。
应用场景:
- 评估科学声明
- 审查讨论/结论部分
- 评估科普传播
- 识别有缺陷的推理
科学中常见的谬误:
- 因果谬误
- 事后归因: "B跟随A,所以A导致B"
- 相关性=因果关系: 混淆关联与因果关系
- 反向因果: 将原因误认为结果
- 单一原因谬误: 将复杂结果归因于一个因素
- 概括谬误
- 草率概括: 从小样本得出广泛结论
- 轶事谬误: 个人故事作为证明
- cherry-picking: 只选择支持性证据
- 生态谬误: 将群体模式应用于个人
- 权威和来源谬误
- 诉诸权威: "专家说的,所以是真的"(无证据)
- 人身攻击: 攻击人,而非论点
- 遗传谬误: 按起源判断,而非优点
- 诉诸自然: "自然=好/安全"
- 统计谬误
- 基率忽视: 忽略先验概率
- 德克萨斯神枪手: 在随机数据中寻找模式
- 多重比较: 未校正多重测试
- 检察官谬误: 混淆P(E|H)与P(H|E)
- 结构谬误
- 虚假二分法: "要么A要么B",当存在更多选项时
- 移动球门柱: 达到证据标准后更改标准
- 循环论证: 循环推理
- 稻草人: 歪曲论点以攻击它们
- 科学特定谬误
- 伽利略策略: "他们嘲笑伽利略,所以我的边缘想法是正确的"
- 诉诸无知: "未被证明为假,所以是真的"
- 涅槃谬误: 拒绝不完美的解决方案
- 不可证伪性: 提出不可测试的声明
识别谬误时:
- 命名特定谬误
- 解释推理为何有缺陷
- 确定有效推断所需的证据
- 注意谬误推理并不证明结论为假—只是这个论点不支持它
参考: 请参阅references/logical_fallacies.md获取带有示例和检测策略的综合谬误目录。
6. 研究设计指导
为规划严谨研究提供建设性指导。
应用场景:
- 帮助设计新实验
- 规划研究项目
- 审查研究提案
- 改进研究方案
设计过程:
- 研究问题细化
- 确保问题具体、可回答且可证伪
- 验证它解决了文献中的差距或矛盾
- 确认可行性(资源、伦理、时间)
- 操作定义变量
- 设计选择
- 匹配设计到问题(因果→实验;关联→观察)
- 考虑可行性和伦理约束
- 在被试间、被试内或混合设计之间选择
- 计划析因设计(如果测试多个因素)
- 偏见最小化策略
- 尽可能实施随机化
- 计划在所有可行级别实施盲法(参与者、提供者、评估者)
- 识别并计划控制混杂因素(随机化、匹配、分层、统计调整)
- 标准化所有程序
- 计划最小化流失
- 样本规划
- 进行先验功率分析(指定预期效应、所需功率、alpha)
- 在样本量中考虑流失
- 定义明确的纳入/排除标准
- 考虑招募策略和可行性
- 计划样本代表性
- 测量策略
- 选择经过验证、可靠的仪器
- 尽可能使用客观测量
- 计划关键构念的多种测量(三角测量)
- 确保测量对预期变化敏感
- 建立评分者间可靠性程序
- 分析规划
- 预先指定所有假设和分析
- 明确指定主要结果
- 计划带有假设检查的统计测试
- 指定如何处理缺失数据
- 计划报告效应大小和置信区间
- 考虑多重比较校正
- 透明度和严谨性
- 预注册研究和分析计划
- 使用报告指南(CONSORT、STROBE、PRISMA)
- 计划报告所有结果,而不仅仅是显著结果
- 区分验证性和探索性分析
- 承诺数据/代码共享
参考: 请参阅references/experimental_design.md获取覆盖从问题到传播所有阶段的综合设计清单。
7. 声明评估
系统评估科学声明的有效性和支持。
应用场景:
- 评估论文中的结论
- 评估媒体对研究的报道
- 审查摘要或介绍声明
- 检查数据是否支持结论
声明评估过程:
- 识别声明
- 究竟在声称什么?
- 是因果声明、关联声明还是描述性声明?
- 声明强度如何(已证明、可能、建议、可能)?
- 评估证据
- 提供了什么证据?
- 证据是直接的还是间接的?
- 证据是否足以支持声明的强度?
- 替代解释是否被排除?
- 检查逻辑连接
- 结论是否从数据中得出?
- 是否有逻辑跳跃?
- 相关数据是否用于支持因果声明?
- 局限性是否被承认?
- 评估比例性
- 信心是否与证据强度成比例?
- 对冲词是否被适当使用?
- 局限性是否被淡化?
- 推测是否被明确标记?
- 检查过度概括
- 声明是否超出了所研究的样本?
- 人口限制是否被承认?
- 上下文依赖性是否被认识到?
- 是否包含关于概括的警告?
- 红旗
- 来自相关研究的因果语言
- "证明"或绝对确定性
- 精选引用
- 忽略矛盾证据
- 忽视局限性
- 超出数据的外推
提供具体反馈:
- 引用有问题的声明
- 解释支持它所需的证据
- 如果需要,建议适当的对冲语言
- 区分数据(发现的内容)和解释(其含义)
应用指南
一般方法
- 保持建设性
- 识别优势和弱点
- 建议改进而非仅仅批评
- 区分致命缺陷和次要局限性
- 认识到所有研究都有局限性
- 保持具体
- 指向具体实例(例如,"表2显示..."或"在方法部分...")
- 引用有问题的陈述
- 提供问题的具体示例
- 参考违反的特定原则或标准
- 保持比例
- 批评严重程度与问题重要性匹配
- 区分对有效性的主要威胁和次要关注
- 考虑问题是否影响主要结论
- 承认自己评估中的不确定性
- 应用一致标准
- 对所有研究使用相同标准
- 不对您不喜欢的发现应用更严格的标准
- 承认自己的潜在偏见
- 基于方法学而非结果做出判断
- 考虑上下文
- 承认实际和伦理约束
- 考虑领域特定的效应大小和方法规范
- 认识到探索性vs验证性上下文
- 在评估研究时考虑资源限制
提供批判时
反馈结构:
- 摘要: 简要概述评估内容
- 优势: 做得好的地方(对可信度和学习很重要)
- 关注点: 按严重程度组织的问题
- 关键问题(威胁主要结论的有效性)
- 重要问题(影响解释但非致命)
- 次要问题(值得注意但不改变结论)
- 具体建议: 可操作的改进建议
- 总体评估: 关于证据质量和可得出结论的平衡结论
使用精确术语:
- 命名特定的偏见、谬误和方法学问题
- 参考已建立的标准和指南
- 引用科学方法学的原则
- 准确使用技术术语
不确定时
- 承认不确定性: "这可能是X或Y;需要的额外信息是Z"
- 询问澄清问题: "[方法学细节]是否完成?这影响解释。"
- 提供条件评估: "如果X完成,则Y随之而来;如果没有,则Z是关注点"
- 注意什么额外信息会解决不确定性
参考材料
此技能包括提供批判性评估详细框架的综合参考材料:
- `references/scientific_method.md` - 科学方法学的核心原则、科学过程、批判性评估标准、科学声明中的红旗、因果推断标准、同行评审和开放科学原则
- `references/common_biases.md` - 认知、实验、方法学、统计和分析偏见的综合分类,带有检测和缓解策略
- `references/statistical_pitfalls.md` - 常见的统计错误和误解,包括P值误解、多重比较问题、样本量问题、效应大小错误、相关性/因果关系混淆、回归陷阱和元分析问题
- `references/evidence_hierarchy.md` - 传统证据层次、GRADE系统、研究质量评估标准、领域特定考虑、证据综合原则和实用决策框架
- `references/logical_fallacies.md` - 科学话语中常见的逻辑谬误,按类型组织(因果、概括、权威、相关性、结构、统计),带有示例和检测策略
- `references/experimental_design.md` - 综合实验设计清单,涵盖研究问题、假设、研究设计选择、变量、抽样、盲法、随机化、对照组、程序、测量、偏见最小化、数据管理、统计规划、伦理考虑、有效性威胁和报告标准
何时查阅参考:
- 当需要详细框架时,将参考加载到上下文中
- 使用grep搜索参考中的特定主题:
grep -r "pattern" references/ - 参考提供深度;SKILL.md提供程序指导
- 查阅参考获取综合列表、详细标准和具体示例
记住
科学批判性思维是关于:
- 使用已建立原则进行系统评估
- 建设性批判,改进科学
- 与证据强度成比例的信心
- 关于不确定性和局限性的透明度
- 标准的一致应用
- 认识到所有研究都有局限性
- 怀疑与对证据开放之间的平衡
始终区分:
- 数据(观察到的内容)和解释(其含义)
- 相关性和因果关系
- 统计显著性和实际重要性
- 探索性和验证性发现
- 已知和不确定的内容
- 反对声明的证据和支持原假设的证据
批判性思维的目标:
- 准确识别优势和弱点
- 确定支持哪些结论
- 认识到局限性和不确定性
- 为未来工作建议改进
- 推进科学理解
兼容工具
站内相关工具
数据来源:claude-scientific-skills(MIT 许可) | 查看上游来源
上游项目:K-Dense-AI/scientific-agent-skills / claude-scientific-skills | 收录时间:2026-08-18 | 更新:2026-08-18
本页面内容基于上游开源许可项目整理,仅供学习参考。AI铺子不对第三方内容承担责任, 详情请参阅免责声明。