返回Skills库

学术评估

MIT
📊 数据知识
K-Dense-AI

使用ScholarEval框架系统评估学术工作,在研究质量维度(包括问题表述、方法论、分析和写作)提供结构化评估,包含定量评分和可操作反馈。

学术评估

概述

应用ScholarEval框架系统评估学术和研究工作。此技能基于同行评审的研究评估标准提供结构化评估方法,能够对学术论文、研究提案、文献综述和学术写作进行多质量维度的全面分析。

何时使用此技能

当您需要以下操作时,应使用此技能:

  • 评估研究论文的质量和严谨性
  • 评估文献综述的全面性和质量
  • 审查研究方法设计
  • 评分数据分析方法
  • 评估学术写作和呈现
  • 为学术工作提供结构化反馈
  • 根据既定标准对研究质量进行基准测试
  • 评估目标期刊的发表准备情况
  • 提供定量评估以补充定性同行评审

科学示意图的视觉增强

使用此技能创建文档时,始终考虑添加科学图表和示意图以增强视觉沟通。

如果您的文档尚未包含示意图或图表:

  • 使用scientific-schematics技能生成AI驱动的 publication 质量图表
  • 只需用自然语言描述您想要的图表
  • Nano Banana Pro将自动生成、审查和完善示意图

对于新文档: 默认应生成科学示意图,以可视化方式表示文本中描述的关键概念、工作流程、架构或关系。

如何生成示意图:

python scripts/generate_schematic.py "your diagram description" -o figures/output.png

AI将自动:

  • 创建具有适当格式的 publication 质量图像
  • 通过多次迭代进行审查和完善
  • 确保可访问性(色盲友好,高对比度)
  • 将输出保存在figures/目录中

何时添加示意图:

  • 评估框架图
  • 质量评估标准决策树
  • 学术工作流程可视化
  • 评估方法流程图
  • 评分标准可视化
  • 评估过程图
  • 任何受益于可视化的复杂概念

有关创建示意图的详细指导,请参考scientific-schematics技能文档。


评估工作流程

步骤1:初始评估和范围定义

首先确定要评估的学术工作类型和评估范围:

工作类型:

  • 完整研究论文(实证、理论或综述)
  • 研究提案或协议
  • 文献综述(系统、叙述或范围界定)
  • 论文或学位论文章节
  • 会议摘要或短论文

评估范围:

  • 全面(所有维度)
  • 针对性(特定方面如方法论或写作)
  • 比较性(与其他工作进行基准测试)

如果范围不明确,请要求用户澄清。

步骤2:基于维度的评估

系统评估工作的ScholarEval维度。对于每个适用维度,评估质量,识别优势和劣势,并在适当情况下提供评分。

请参考references/evaluation_framework.md获取每个维度的详细标准和评分标准。

核心评估维度:

  1. 问题制定与研究问题
  • 研究问题的清晰度和具体性
  • 理论或实践意义
  • 可行性和范围适当性
  • 新颖性和贡献潜力
  1. 文献综述
  • 覆盖的全面性
  • 批判性综合与单纯总结
  • 研究空白的识别
  • 来源的时效性和相关性
  • 适当的情境化
  1. 方法论与研究设计
  • 对研究问题的适当性
  • 严谨性和有效性
  • 可重复性和透明度
  • 伦理考虑
  • 局限性的承认
  1. 数据收集与来源
  • 数据的质量和适当性
  • 样本大小和代表性
  • 数据收集程序
  • 来源的可信度和可靠性
  1. 分析与解释
  • 分析方法的适当性
  • 分析的严谨性
  • 逻辑连贯性
  • 考虑替代解释
  • 结果-主张一致性
  1. 结果与发现
  • 呈现的清晰度
  • 统计或定性严谨性
  • 可视化质量
  • 解释准确性
  • 影响讨论
  1. 学术写作与呈现
  • 清晰度和组织性
  • 学术语调和风格
  • 语法和机制
  • 逻辑流程
  • 对目标受众的可访问性
  1. 引用与参考文献
  • 引用完整性
  • 来源质量和适当性
  • 引用准确性
  • 观点平衡
  • 遵守引用标准

步骤3:评分与评级

对于每个评估维度,提供:

定性评估:

  • 关键优势(2-3个具体点)
  • 需要改进的领域(2-3个具体点)
  • 关键问题(如有)

定量评分(可选):

适当时使用5分制:

  • 5:优秀 - 典范质量,可在顶级期刊发表
  • 4:良好 - 质量强,需要小幅改进
  • 3:足够 - 可接受质量,有明显需要改进的领域
  • 2:需要改进 - 需要重大修订
  • 1:差 - 存在需要重大修订的根本问题

要以编程方式计算综合评分,请使用scripts/calculate_scores.py

步骤4:综合总体评估

提供综合评估摘要:

  1. 整体质量评估 - 对工作学术价值的整体判断
  2. 主要优势 - 跨维度的3-5个关键优势
  3. 关键劣势 - 需要关注的3-5个主要领域
  4. 优先建议 - 按影响排序的改进列表
  5. 发表准备情况(如适用)- 对目标期刊的适合性评估

步骤5:提供可操作的反馈

将评估结果转化为建设性、可操作的反馈:

反馈结构:

  • 具体 - 引用确切的章节、段落或页码
  • 可操作 - 提供具体的改进建议
  • 优先排序 - 按重要性和可行性对建议进行排序
  • 平衡 - 在解决弱点的同时承认优势
  • 基于证据 - 以评估标准为基础提供反馈

反馈格式选项:

  • 带有维度分析的结构化报告
  • 映射到特定文档部分的注释评论
  • 带有关键发现和建议的执行摘要
  • 与基准标准的比较分析

步骤6:情境考虑

根据以下因素调整评估方法:

发展阶段:

  • 早期草稿:关注概念和结构问题
  • 高级草稿:关注完善和润色
  • 最终提交:全面质量检查

目的和期刊:

  • 期刊文章:对严谨性和贡献的高标准
  • 会议论文:平衡新颖性和呈现清晰度
  • 学生作业:以发展为重点的教育反馈
  • 资助提案:强调可行性和影响

学科特定规范:

  • STEM领域:强调可重复性和统计严谨性
  • 社会科学:平衡定量和定性标准
  • 人文学科:关注论证和学术解释

资源

references/evaluation_framework.md

每个ScholarEval维度的详细评估标准、评分标准和质量指标。进行评估时加载此参考以访问特定评估指南和评分标准。

快速访问的搜索模式:

  • "Problem Formulation criteria"
  • "Literature Review rubric"
  • "Methodology assessment"
  • "Data quality indicators"
  • "Analysis rigor standards"
  • "Writing quality checklist"

scripts/calculate_scores.py

用于从维度级别评级计算综合评估分数的Python脚本。支持加权平均、阈值分析和分数可视化。

用法:

python scripts/calculate_scores.py --scores <dimension_scores.json> --output <report.txt>

最佳实践

  1. 保持客观性 - 基于既定标准而非个人偏好进行评估
  2. 全面评估 - 系统评估所有适用维度
  3. 提供证据 - 用工作中的具体例子支持评估
  4. 保持建设性 - 将弱点框定为改进机会
  5. 考虑情境 - 根据工作阶段和目的调整期望
  6. 记录理由 - 解释评估和评分背后的推理
  7. 鼓励优势 - 明确承认工作的优点
  8. 优先排序反馈 - 首先关注高影响改进

评估工作流程示例

用户请求: "评估这篇关于机器学习用于药物发现的研究论文"

响应过程:

  1. 确定工作类型(实证研究论文)和范围(全面评估)
  2. 加载references/evaluation_framework.md获取详细标准
  3. 系统评估每个维度:
  • 问题制定:关于ML模型性能的清晰研究问题
  • 文献综述:全面覆盖最近的ML和药物发现工作
  • 方法论:适当的深度学习架构和验证程序
  • [继续评估所有维度...]
  1. 计算维度分数和整体评估
  2. 将发现综合为结构化报告,突出:
  • 强大的方法论和可重现的代码
  • 需要更多多样化的数据集评估
  • 写作可以提高结果部分的清晰度
  1. 提供按优先级排序的具体建议

与科学写作器集成

此技能与科学写作工作流程无缝集成:

论文生成后:

  • 使用学术评估作为同行评审的替代或补充
  • PEER_REVIEW.md一起生成SCHOLAR_EVALUATION.md
  • 提供定量分数以跟踪修订过程中的改进

修订期间:

  • 在解决反馈后重新评估特定维度
  • 跟踪多个版本的分数改进
  • 识别需要关注的持续弱点

发表准备:

  • 评估目标期刊/会议的准备情况
  • 在提交前识别差距
  • 根据发表标准进行基准测试

注意事项

  • 评估严谨性应与工作的目的和阶段相匹配
  • 某些维度可能不适用于所有工作类型(例如,纯理论论文的数据收集)
  • 应考虑学术规范的文化和学科差异
  • 此框架补充而非替代特定领域的专业知识
  • 与同行评审技能结合使用以进行全面评估

引用

此技能基于ScholarEval框架,该框架在以下文献中介绍:

Moussa, H. N., Da Silva, P. Q., Adu-Ampratwum, D., East, A., Lu, Z., Puccetti, N., Xue, M., Sun, H., Majumder, B. P., & Kumar, S. (2025). _ScholarEval: Research Idea Evaluation Grounded in Literature_. arXiv preprint arXiv:2510.16234. https://arxiv.org/abs/2510.16234

摘要: ScholarEval是一个检索增强评估框架,基于两个基本标准评估研究想法:合理性(基于现有文献的拟议方法的经验有效性)和贡献(该想法相对于先前研究在不同维度上的进步程度)。该框架实现了对专家注释评估点的显著更高覆盖率,并且在评估可操作性、深度和证据支持方面始终优于基线系统。

兼容工具

Claude CodeOpenClawHermes Agent

数据来源:claude-scientific-skillsMIT 许可) | 查看上游来源

上游项目:K-Dense-AI/scientific-agent-skills / claude-scientific-skills | 收录时间:2026-08-18 | 更新:2026-08-18

本页面内容基于上游开源许可项目整理,仅供学习参考。AI铺子不对第三方内容承担责任, 详情请参阅免责声明