出典:OpenAI Blog原文を見る ↗
原文の著作権は出典元に帰属します。当サイトでは収録、翻訳、体裁調整のみを行います。
事実関係
解説と影響
这项基准测试并非简单的知识问答,而是深入到计算生物学家的日常工作中。GeneBench-Pro 包含 129 个研究级难题,覆盖了统计遗传学、癌症基因组学、药物基因组学等 10 个专业领域[来源:techtimes.com]。其核心设计在于,所有问题都基于一个完全已知因果结构的合成数据集生成,这意味着每个问题都有一个经过验证的、确定性的标准答案。这种设计巧妙地规避了传统长周期基准测试中依赖人工评分或作者偏好所引入的主观性,使得对 AI 模型“判断力”的评估更为客观和严格[来源:techtimes.com]。
测试结果揭示了当前顶尖 AI 模型在专业科研领域的真实短板。数据显示,在 GeneBench-Pro 的难题面前,现有模型的表现远未达到可以替代人类专家的水平。高达 60% 的问题,模型的通过率低于 20%[来源:cryptobriefing.com]。即便是表现最好的模型,在问题集上的整体通过率也仅为 33.2%[来源:cryptobriefing.com]。这一数据清晰地表明,尽管 AI 在药物发现、基因组分析等领域被寄予厚望,但从处理多步骤、需要上下文判断的复杂推理任务来看,AI 与熟练的生物信息学家之间仍存在显著差距。
GeneBench-Pro 的推出,正值各大 AI 公司竞相将模型定位为科学研发核心工具的关键时期。就在 OpenAI 发布该基准后不久,其竞争对手 Anthropic 也推出了名为“Claude Science”的科学工作站,并宣布将资助最多 50 个研究项目,每个项目最高提供 3 万美元的额度[来源:beincrypto.com]。这种竞争态势凸显了生命科学已成为 AI 领域的前沿战场。然而,GeneBench-Pro 的测试结果也向市场传递了一个冷静的信号:AI 在科学研究中的角色,目前更可能是一个强大的辅助工具,而非独立的发现者。OpenAI 随后在 7 月底推出的“科学家免费 AI 访问计划”,也似乎是在鼓励科研人员在实际工作中探索和验证模型能力的边界[来源:techtimes.com]。
参考資料
- OpenAI Blog ↗
- OpenAI Genomics Benchmark: AI Judgment Gap Exposed in Research-Grade Tasks | Tech Times ↗
- Anthropic and OpenAI Take Their AI War Into Scientific Research | BeInCrypto ↗
- OpenAI introduces GeneBench to evaluate AI on computational biology's hardest problems | Crypto Briefing ↗
- OpenAI Launches Free AI Access for Scientists: Apply Now, Model Weights Still Off-Limits | Tech Times ↗