五星体育围绕五星体育在线不断创新,回应用户的真实需求。

五星体育网页版整合世界杯足球全程直播内容,覆盖各大联赛及篮球赛事,提供赛程、比分和赛果信息更新。网站栏目设置合理,信息更新迅速,特别针对美加墨世界杯预热和直播内容进行了专门版块设计,让用户能够实时观看精彩比赛、获取赛事数据和赛前分析。五星体育网页版将观赛与数据分析结合,为用户打造高质量的体育直播和竞猜体验平台,让每场比赛更精彩可参与。

今天一早,SpaceXAI 最强模型 Grok 4.7 来了。

发布页开头只有一句极具「攻击性」的定位:面向编程与知识工作的最强模型,速度达到可比模型的两倍,价格只有一半。

这次升级没有停留在跑分表上。Grok 4.7 换用了更大的基础模型,强化了长时间任务、自我检查和长上下文管理能力,并把文档、演示文稿、法律、医疗和工程等专业工作纳入重点测试。它瞄准的场景很明确:让模型在持续数小时的任务里少走弯路,交出可以直接使用的结果。

马斯克发推表示,「Grok 4.7 在智能水平、运行速度和成本之间取得了很有竞争力的平衡。」

长任务,成为这一代模型的主战场

Grok 4.7 采用了比 Grok 4.6 更大的基础模型。训练阶段延长了强化学习周期,任务组合也进一步加难,其中更多样本需要数小时才能完成。SpaceXAI 称,新模型在检查自身工作、管理长上下文方面都有提升。

这类改进直接对应当前编程智能体最棘手的问题。短代码生成往往只需要局部判断,真正复杂的软件任务却包含阅读仓库、拆解需求、修改多处文件、运行测试和反复纠错。模型能否在漫长执行链中保持目标、发现错误,通常比一次写出漂亮代码更重要。

CursorBench 4.0 专门考察长时间编码任务。官方数据中,Grok 4.7 得分 46.3%,Grok 4.6 为 40.4%,提升 5.9 个百分点。在 DeepSWE v1.1 上,Grok 4.7 的高推理强度成绩为 71.0%;Terminal-Bench 4.0 则从上一代的 20.3% 升至 38.0%。

据此将 Grok 4.7 称为 CursorBench 4.0 上价格与性能均处于前沿的模型。

模型也被训练为原生理解 Grok Bot 的运行框架。按照官方说法,这项调整改善了对话任务和通用知识工作表现。换句话说,Grok 4.7 的升级重点已经从单轮回答延伸到模型与工具、执行环境之间的持续协作.

从写代码,走向完整的知识工作

编程仍是 Grok 4.7 最醒目的标签,但 SpaceXAI 给出的评测范围明显更宽。AA Briefcase 和 GDPval 关注的是专业人士日常完成的多步骤工作,覆盖律师、护士、金融分析师等岗位常见任务,也包括文档和演示文稿制作。

在 AA Briefcase v1.1 上,Grok 4.7 获得 1657 分,高于 Grok 4.6 的 1546 分;GDPval Elo 分数由 1605 升至 1695。官方图表中,它在 GDPval 上接近 Fable 5.1 的 1735 分,高于 GPT-6 Astra 的 1542 分。SpaceXAI 的结论是,Grok 4.7 在两项测试中均超过上一代,整体表现与其他前沿模型相当。

专业领域的提升也出现在多个方向。EEBench 得分由 53.0% 升至 64.0%,Harvey Legal Agent Benchmark 由 15.8% 升至 19.6%,HealthBench Professional 由 48.5% 升至 56.7%。这些结果来自 SpaceXAI 公布的内部对比表,能够说明新旧两代模型之间的变化;跨模型比较仍会受到推理强度、工具配置和测试环境影响。

这组成绩透露出一个清晰趋势:前沿模型的竞争正在进入「完成整项工作」的阶段。

模型需要理解任务、调用工具、产出文件并自行复核,单一问答能力只是其中一环。Grok 4.7 延长训练任务时长,并强化自我验证,正是在为这类工作流补课。

安全与价格

能力提升之外,Grok 4.7 启用了一套全新的安全防护体系。SpaceXAI 称,这是其测试过的模型中,在拒答与抵抗越狱方面表现最强的一款。

在生物安全评测方面,Grok 4.7 以 62.4% 的成绩登顶 LatchBio 基准。网络安全测试 HackerBench v0.3 主要覆盖高风险和恶意任务。按照官方数据,模型仅放行 3.3% 的高风险双重用途提示,同时很少误拦正常的安全研究请求。

SpaceXAI 还开始向少数网络安全合作伙伴开放邀请制红队能力,用于防御研究。目前,这项红队能力先以受控合作方式提供。

标准版延续原价,快速版速度翻倍

Grok 4.7 已经上线 Cursor 和 Grok Build,并通过 Grok API、第三方编程框架、模型路由服务及云平台提供。标准版起价为每百万输入 Token 2 美元、每百万输出 Token 6 美元,与 Grok 4.6 保持一致

价格策略让这次升级更具冲击力。开发者无需为换代支付额外的标准版 Token 成本,却能获得更强的长任务表现、自我检查能力和专业工作成绩。

对编程智能体与知识工作产品而言,模型每次调用的单价固然重要,完成一项任务需要多少轮尝试、多少次返工,最终决定了真实成本。

最后总结一波这次升级:

从训练方式到评测组合,Grok 4.7 都在强化同一件事:长时间留在任务里,把复杂工作做完。编程只是最先成熟的入口,文档、演示、法律分析、临床推理和工程任务已经被放进同一套能力版图。

但网友似乎并不买账,「这种模型居然也敢发布,简直差到不该发布。」只能挽尊地说,这次 Grok 4.7 的卖点不是全面碾压竞品,它是用远低于部分旗舰模型的 API 成本,换来了相当接近、并在个别专业任务上领先的性能。

参考链接:

https://x.ai/news/grok-4-7

https://x.com/ArtificialAnlys/status/2102074904560771365

本文来自微信公众号“机器之心”,编辑:机器之心编辑部,36氪经授权发布。

Date Time League Seauson Full Time
May 11 ,2023 12:00 FC League 2023 90
May 14 ,2023 16:00 FC League 2023 90
May 15 ,2023 17:00 FC League 2023 90
May 11 ,2023 19:00 FC League 2023 90
France FC
01
Lionel Messi

Goalkeeper

02
Andres Iniesta

Forward

03
Radamel Falcao

Forward

04
Andrea Pirlo

Midfielder

05
Yaya Toure

Defender

06
Edinson Cavani

Defender

07
David Silva

Forward

Italy
01
Bastian Schweinsteiger

Goalkeeper

02
Neymar

Forward

03
Luis Suarez

Forward

04
Vincent Kompany

Forward

05
Gerard Pique

Forward

06
Marco Reus

Forward

07
Manuel Neuer

Midfielder

Newsletter