Grok 4.7 发布

溪行者行业资讯📡 BestBlogs·全站精选⭐ 902026-09-23250 阅读💛 88 收藏
Grok 4.7 发布

📌 One-Sentence Summary xAI 的 Grok 4.7 是一款面向编程与知识工作的全新前沿模型,宣称速度是同类模型的两倍、价格仅为其一半,并配备重建的安全防护体系,在多项智能体基准测试中取得领先成绩。 📝 Summary xAI 发布 Grok 4.7,这是其面向编程与知识工作能力最强的模型,价格与速度与 Grok 4.6 保持一致。它采用更大的基础模型,并在更困难、耗时数小时的任务上进行了更长时间的强化学习训练,同时被训练为原生理解 Grok Bot 运行框架。在 CursorBench 4.0 上,它处于性价比前沿,并在 DeepSWE v1.1、EEBench、AA Briefcase v1.1、Terminal-Bench 4.0、Harvey Legal Agent Benchmark 和 HealthBench Professional 上取得有竞争力的成绩,GDPval Elo 为 1735。全新的安全防护体系使其成为 xAI 迄今测试过的在拒答与抗越狱方面最强的模型,在 LatchBio 的生物安全基准上以 62.4% 位居榜首,且仅放行 3.3% 的高风险两用网络提示词。定价为每百万输入 token 2 美元、每百万输出 token 6 美元,另有一款速度翻倍、价格翻倍的快速版本。该模型已在 Cursor、Grok Build、Grok API、第三方运行框架及云平台上线。 💡 Main Points Grok 4.7 定位为面向编程与知识工作的前沿性价比模型。 xAI 宣称其速度是同类模型的两倍、价格仅为其一半,在侧重长时间编程任务的 CursorBench 4.0 上,它相对于 Fable 5.1、Opus 5、GPT-5.6 Sol 和 Sonnet 5 处于性价比前沿。 性能提升来自更大的基础模型,以及在更困难、耗时数小时任务上更长时间的强化学习训练。 训练权重偏向需要数小时才能完成的问题,模型更擅长验证自身工作并管理更长的上下文;它还被训练为原生理解 Grok Bot 运行框架。 基准测试结果参差不齐,但具有竞争力,而非全面领先。 Grok 4.7 在 EEBench(64.0%)、Harvey Legal Agent Benchmark(19.6%)和 AA Briefcase v1.1(1,657)上领先,但在 CursorBench 4.0(46.3% 对 51.8%)和 Terminal-Bench 4.0(38.0% 对 57.9%)上落后于 Fable 5.1,在 HealthBench Professional 上落后于 GPT-5.6 Sol。 安全是核心卖点,配备重建的安全防护体系与两用管控。 xAI 称其是迄今测试过的在拒答与抗越狱方面最强的模型,在 LatchBio 的生物安全基准上以 62.4% 位居榜首,仅放行 3.3% 的高风险两用网络提示词,同时极少拦截合法的安全工作。 可用渠道与定价覆盖面广且极具进攻性。 该模型已在 Cursor 和 Grok Build 上线,并通过 Grok API、第三方编程运行框架、模型路由器和云平台提供,定价为每百万输入 token 2 美元、每百万输出 token 6 美元,另有一款输出速度翻倍、价格翻倍的快速版本。 💬 Key Quotes Grok 4.7 是我们面向编程与知识工作能力最强的模型。 它在困难任务上工作更久,更仔细地检查自身工作,并配备了我们迄今校准最好的安全防护。 在侧重长时间编程任务的 CursorBench 4.0 上,Grok 4.7 处于性价比前沿。 它是我们测试过的在拒答与抗越狱方面最强的模型。 该模型定价为每百万输入 token 2 美元起、每百万输出 token 6 美元起。 📊 Article Meta AI Screening: 90 Featured: Yes Source: Cursor Blog Author: xAI Category: 人工智能 Language: 英文 Read Time: 3 min Word Count: 626 Tags: AI 与智能应用 , 模型发布 , AI 编程 , AI 安全与对齐 , 模型评测与基准 Read Full Article

#AI 与智能应用# 模型发布# AI 编程# AI 安全与对齐# 模型评测与基准

文章评论(0

暂无评论,快来抢沙发~