初探 OpenAI GPT-4.1 性能:AI 编程能力大增,但谷歌 Gemini 依然称王
作者:方泰攻略站时间:2025-04-17 09:22:38
本站 4 月 16 日消息,科技媒体 bleepingcomputer 昨日(4 月 15 日)发布博文,报道称 OpenAI 最新发布的 GPT-4.1 系列模型,其性能相比 GPT-4o 虽然实现重大飞跃,但多项跑分未能超越谷歌的 Gemini 系列。
本站昨日报道,OpenAI 公司发布 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano,官方公布的跑分数据来看,这些模型在编程方面的能力,远超 GPT-4o 及 GPT-4o mini。
例如在 SWE-bench Verified 跑分中,GPT-4o 的得分为 21.4%,GPT-4.5 的得分为 26.6%,而 GPT-4.1 的得分为 54.6%。
尽管性能有较大提升,不过根据多位专家测试,相比较谷歌的 Gemini 系列,GPT-4.1 对比中却显露劣势。
根据 Stagehand(一款生产级浏览器自动化框架)发布的基准数据,Gemini 2.0 Flash 的错误率仅为 6.67%,精确匹配率高达 90%,且价格低廉、速度更快。相比之下,GPT-4.1 的错误率高达 16.67%,成本更是 Gemini 2.0 Flash 的 10 倍以上。
此外,哈佛大学 RNA 科学家 Pierre Bongrand 提供的数据也指出,GPT-4.1 的性价比不及 Gemini 2.0 Flash、Gemini 2.5 Pro 及 DeepSeek 等竞品。
在编码专项测试中,GPT-4.1 同样未能占据上风。Aider Polyglot 的测试结果显示,GPT-4.1 的编码得分仅为 52%,而 Gemini 2.5 则以 73% 的成绩遥遥领先。
值得注意的是,GPT-4.1 被归类为非推理模型(non-reasoning model),但其编码能力仍属行业顶尖。
相关文章
-
初探 OpenAI GPT-4.1 性能:AI 编程能力大增,但谷歌 Gemini 依然称王
本站 4 月 16 日消息,科技媒体 bleepingcomputer 昨日(4 月 15 日)发布博文,报道称 OpenAI 最新发布的 GPT-4 1 系列模型,其性能相比 GPT-4o 虽然实现
-
Fedora Linux 42 稳定版发布:Linux 6.14 内核、GNOME 48 桌面
本站 4 月 16 日消息,Fedora Linux 42 稳定版昨日(4 月 15 日)正式发布,搭载 Linux 内核 6 14,旗舰版 Fedora Workstation 采用 GNOME 4
-
谷歌 Veo 2 视频生成模型入驻 Gemini,用户可创建 8 秒 720p 视频
本站 4 月 16 日消息,谷歌宣布将旗下的 Veo 2 视频生成 AI 模型带给 Gemini Advanced 订阅用户。这一举措旨在应对 OpenAI 的 Sora 视频生成平台的竞争,并在日益
-
扎克伯格“疯狂想法”曝光:曾考虑删除所有 Facebook 用户好友
本站 4 月 16 日消息,在本周一美国政府对 Meta 提起的反垄断诉讼庭审中,Meta 首席执行官马克・扎克伯格透露曾考虑过删除所有 Facebook 用户的好友,以提升该社交平台的文化影响力。2
-
消息称苹果再遇资深管理层变动,“27 年老将”全球企业销售副总裁 Mark Rogers 年内离职
感谢本站网友 風見暉一 的线索投递! 本站 4 月 16 日消息,据彭博社今日援引知情人士消息称,苹果公司主管企业销售和西欧市场的副总裁Mark Roge
-
无需截图,微软 Win11 将允许用户直接从屏幕中提取文本
感谢本站网友 OkayTech 的线索投递! 本站 4 月 16 日消息,微软的 Windows 11 系统迎来一项备受期待的功能更新 ——“文本提取”,