最新 Nature Medicine 研究 显示:LLM前沿通用大模型(GPT-5.2、Claude Opus 4.6、Gemini 3.1 Pro)在多项医疗基准测试中,全面超越了专门设计的临床 AI 工具(如 OpenEvidence 和 UpToDate Expert AI)。
测试包括:MedQA 医学知识题
HealthBench 临床对齐评估
真实临床查询(RCQ)盲测,由 12 名美国临床医生随机盲评
前沿模型在所有维度都完爆,专家定制化定制了个寂寞 [呵呵]
发布于 美国
