Claude Opus 5.5 与 GPT-6 Sol/Luna 发布,Simon Willison 详解新一轮价格战 · AIHOT

山止川行AI 前沿📡 BestBlogs·AI高分精选⭐ 882026-09-23353 阅读💛 233 收藏
Claude Opus 5.5 与 GPT-6 Sol/Luna 发布,Simon Willison 详解新一轮价格战 · AIHOT

📌 One-Sentence Summary Simon Willison 分析了 Anthropic 的 Claude Opus 5.5 和 OpenAI 的 GPT-6 Sol/Luna 的同时发布,强调了价格战的戏剧性和 Claude Opus 5.5 的最大思考模式在 SVG 任务中出现的严重错误。 📝 Summary Simon Willison 提供了对两个重大模型发布的第一印象:Anthropic 的 Claude Opus 5.5 和 OpenAI 的 GPT-6 Sol 和 Luna。他记录了一个重大价格战,注意到 GPT-6 Luna 的定价是 GPT-5.6 Luna 的一半,而 Claude Opus 5.5 的 20% 价格下降与 60% 的缓存输入成本下降。然而,他报告了一个严重的错误:Claude Opus 5.5 在 '最大' 思考模式下两次失败了他的标准 '鸭子骑自行车' SVG 测试,过度思考直到达到 128,000 个令牌输出限制,耗时 2.56 美元和近 20 分钟。 他将此与 Claude Fable 5.1 进行对比,后者成功。Willison 结论 '最大' 模式可能对 Opus 5.5 无用,并分享了他更新的默认模型选择。 💡 Main Points 一场新的价格战正在进行中,GPT-6 Luna 和 Claude Opus 5.5 在之前模型中显著低于之前的价格。 GPT-6 Luna 的定价为每 1,000,000 个令牌 0.10/0.50 美元,低于 GPT-5.6 Luna 的一半。Claude Opus 5.5 下降了 20% 至 4/20 美元,缓存输入成本下降了 60%。这些降低使高性能模型更具可及性,适用于代理工作流。 Claude Opus 5.5 的 '最大' 思考模式容易出现灾难性的过度思考,失败了一个简单的 SVG 生成任务。 在 Willison 的 '鸭子骑自行车' 测试中,Opus 5.5 在最大努力下两次耗尽了 128,000 个令牌输出限制,思考 SVG 详情,耗时 2.56 美元和 ~20 分钟。 这表明 '最大' 模式可能不适合实际使用。 通过 '鸭子' 测试进行模型比较仍然有用,用于评估模型家族内的推理努力水平。 Willison 创建了 GPT 和 Claude 模型的比较表格,注意到虽然跨供应商比较可能不太有意义,但测试有效地揭示了不同思考努力如何影响输出质量和可靠性。 Willison 已更新他的默认编码代理模型为 GPT-6 Sol 和 Claude Opus 5.5。 他还将 Datasette 代理 demo 升级为使用 GPT-6 Luna,称其速度和 SQL 查询以及构建 Datasette 应用程序的 HTML/JavaScript 的能力。 💬 Key Quotes 这使我怀疑 "最大" 是一种无用的方法 - 如果它可以在一个愚蠢的 SVG 提示中过度思考自己,导致失败,我不信任它不会在更有趣的工作中做同样的事情。 这场价格竞争的竞争性不能被低估。 Opus 5.5 是您的反馈的结果。它清楚地表达了自己,成本低于 Opus 5.0 的令牌成本,具有 Fable 5.1 的智能水平,非常令牌高效,适用于所有努力水平。 📊 Article Meta AI Screening: 88 Source: AIHOT — 精选 Author: noreply@aihot.news (Simon Willison 博客) Category: 人工智能 Language: 英文 Read Time: 8 min Word Count: 1885 Tags: AI 与智能应用 , 模型发布 , 推理模型 , 科技行业分析 , 大语言模型 (LLM) Read Full Article

#AI 与智能应用# 模型发布# 推理模型# 科技行业分析# 大语言模型 (LLM)

文章评论(0

暂无评论,快来抢沙发~