Back to Home
RadarAI··Papers & Tech

CHI-Bench 开源:75 个美国医疗长程工作流压测 30 个前沿 Agent,最强 Claude Code 仅过 28%,端到端医院–保险工司协作直接归零

中文摘要

CHI-Bench开源评估30个医疗Agent,最强模型通过率仅28%,医保协作为0%,凸显了AI临床推理与长程可靠性的短板。

English Summary

CHI-Bench evaluates 30 AI agents on medical workflows. Top models score only 28%, while insurance tasks hit 0%, exposing flaws in clinical reasoning and reliability.

Original Excerpt

📌 一句话摘要 CHI-Bench 基准测试显示,当前最强 AI Agent 在医疗长程工作流中通过率仅 28%,端到端医院-保险公司协作通过率为 0%,揭示了临床推理与长程可靠性的严重短板。 📝 详细摘要 actAVA.ai 联合 Johns Hopkins、斯坦福、CMU 等 20 余家机构发布 CHI-Bench,这是全球首个面向医疗长程工作流的 Agent 评测基准。基准覆盖处方授权、医疗服务使用管理、护理管理...