评测数据集

面向明确任务的评测集

每类评测明确任务边界、样本构成、评价维度和使用条件,帮助团队比较能力并识别风险。

知识问答

医学知识问答评测集

覆盖常见医学知识检索、证据引用与不确定性表达,重点考察答案准确性、完整性和可追溯性。

  • 评价维度:事实一致性、引用质量、边界表达
  • 适用场景:医学检索、专业知识助手
信息抽取

医药行业信息抽取评测集

从产品、机构、适应症、研究结论等行业文本中抽取结构化信息,检验复杂实体和关系识别能力。

  • 评价维度:准确率、召回率、字段一致性
  • 适用场景:情报整理、证据结构化
安全边界

医疗场景安全边界评测集

通过越权请求、隐私数据、诊疗建议和不完整信息等样例,评估模型拒答、提示和人工升级能力。

  • 评价维度:风险识别、恰当拒答、人工转交
  • 适用场景:上线前安全验证、持续监测
使用说明:页面展示的是评测内容与口径介绍;具体样本、授权范围和使用方式需按数据集版本另行确认。