医学知识问答评测集
覆盖常见医学知识检索、证据引用与不确定性表达,重点考察答案准确性、完整性和可追溯性。
- 评价维度:事实一致性、引用质量、边界表达
- 适用场景:医学检索、专业知识助手
每类评测明确任务边界、样本构成、评价维度和使用条件,帮助团队比较能力并识别风险。
覆盖常见医学知识检索、证据引用与不确定性表达,重点考察答案准确性、完整性和可追溯性。
从产品、机构、适应症、研究结论等行业文本中抽取结构化信息,检验复杂实体和关系识别能力。
通过越权请求、隐私数据、诊疗建议和不完整信息等样例,评估模型拒答、提示和人工升级能力。