Google Gemini Pro 新模型刷新记录基准分数
观察者们指出,Gemini 3.1 Pro 在功能上比其前一个版本 Gemini 3 显著提升,后者在去年十一月推出时已经被认为是一款非常有能效的人工智能工具。本周四,Google 还公布了来自独立基准测试数据(如 Humanity’s Last Exam)的统计结果,显示新模型的表现远远超过了之前的版本。
AI 初创公司 Mercor 的 CEO Brendan Foody 也对 Gemini 3.1 Pro 表示赞赏。其公司的基准系统 APEX 是为了衡量新 AI 模型在现实专业任务中的表现而设计的。Foody 在社交媒体上表示,Gemini 3.1 Pro “现在位于 APEX-Agents 领导板的首位”,并强调这一模型取得的出色成绩表明“代理人工智能正在迅速提高其实际知识工作的能力。”
如今,随着 AI 模型之间的竞争愈演愈烈,科技公司们继续推出越来越强大的 LLM 以应对复杂的任务和多步骤推理。包括 OpenAI 和 Anthropic 在内的其他主要公司也已相继发布了新的模型。
🔗 来源:Google’s new Gemini Pro model has record benchmark scores — again (AI 严选)