Kimi K2.7 Code 对比 Claude Fable 5:12 个落地页实测,成本便宜 94%,评分只差几个点

星海拾光AI 前沿2026-09-17333 阅读💛 80 收藏

OVSC 网站收录了全部落地页变体及成本、token 用量与生成时间明细

一句话结论

同一组提示词、12 个落地页、两个模型:Kimi K2.7 Code 的总成本约比 Claude Fable 5 低 94%(平均便宜约 16 倍),GPT-5.5 按 0-100 分制盲评下绝大多数页面只落后 0-7 分;再给 Kimi 配上一个提供设计参考截图的自定义 MCP 服务器,页面质量还能再上一个台阶。对要批量生成落地页、多方案迭代探索的团队,这是一组可以直接拿来做选型决策的实测数据。

实验怎么做的

Together AI 的 Hassan El Mghari 做了一个对照实验:给 Kimi K2.7 Code 和 Claude Fable 5 同一组落地页提示词,每个模型各生成 12 个页面,然后从定位、视觉方向、内容结构、工艺、响应式、技术执行几个维度比较整体质量。所有变体连同成本、token 用量、生成时间都公开在 OVSC 网站上,可以逐页查看。作为参照,实验还包含了 Claude Opus 4.8 的生成结果——平均算下来 Kimi 比 Fable 便宜约 16 倍,比 Opus 便宜约 8 倍。

提示词设计

提示词覆盖几个不同品类,保证结论不依赖单一题材:

  • 「为一个把 SQL 查询变成图表的开发者工具做一个落地页」
  • 「为一个屋顶地下酒吧式的鸡尾酒酒吧做落地页——装饰艺术风格、金箔配祖母绿、1920 年代摩登」
  • 「为一个 B2B SaaS 创业公司做落地页——团队项目管理与协作工具(任务、时间线、团队工作流、集成)」

两个模型拿到完全相同的提示词。第一轮不看任何参考,只靠提示词本身生成。

基线结果:都像 AI 做的

这是两个模型收到「SQL 图表工具落地页」提示词后的直接输出对比:

仅用提示词时两个模型的初始输出

两个模型交出的页面都「一眼 AI」——精致但平庸,缺乏设计意图。这给了实验一个有用的基线:光靠一句提示词,无论闭源还是开源模型都做不出有辨识度的页面。要把质量推上去,需要给模型更强的创意方向输入。

关键变量:设计参考 MCP 服务器

实验中最大的质量杠杆不是换模型,而是给 Kimi 配了一个自定义 MCP 服务器,里面提供精心设计的落地页截图、单独的 UI 元素和其他视觉引用。因为 Kimi K2.7 Code 是多模态模型,这些截图可以直接跟文字一起放进提示词。

效果立竿见影:Kimi 不再从一句短提示凭空生成布局,而是从具体范例中捕捉视觉语言,把模式应用到新页面上。实际结果表现为更强的层级、更好的排版、更有意图的构图。

这是屋顶酒吧页面前后对比(左:仅提示词版;右:设计参考 MCP 版):

屋顶酒吧落地页前后对比:Kimi 仅提示词版与设计参考 MCP 版

有了设计参考之后,Kimi 生成的页面加载更快、不再出现碎图占位符,排版可读性也明显提升。

成本:单页 4 美分 vs 1.09 美元

成本差异是开源模型的直接优势。同一个 B2B SaaS 落地页提示词,Kimi 只花了 4 美分,Claude Fable 花了 1.09 美元——单页差约 27 倍。

同一提示词下两模型的总成本对比:Claude Fable 1.09 美元,Kimi K2.7 仅 4 美分

平均下来,Kimi K2.7 Code 生成的落地页比 Claude Fable 5 便宜约 16 倍。这里的关键在于生成式编码智能体的真实工作方式:你很少只生成一版落地页,而是批量生成多个变体探索不同设计方向,再对有希望的方案反复编辑迭代。这种来回多轮的流程里,单价差异会迅速放大——生成 100 个页面,用 Kimi 相比用 Fable 能省下约 94 美元。

质量对比:GPT-5.5 盲评 12 页评分表

为了系统比较质量,实验让 GPT-5.5 按评分细则审查每页截图和源代码,从 0 到 100 打分:

页面FableFable+MCPKimiKimi+MCP
SQL 图表工具86918286
长文阅读页86838285
建筑作品集91928879
睡眠 App92948080
学做菜 App94928681
独立书店95928989
电子音乐91918585
辣椒酱品牌91938687
屋顶酒吧93928685
香水品牌91918883
语音克隆 App88908384
B2B SaaS84908081

Claude Fable 在两组对比中得分都更高,但差距很小。Kimi 在设计、结构和整体页面质量上保持竞争力,运行成本低得多。对这个类别的工作流,这笔账算得过来。

给落地页生成工作流的三个可复用结论

1. 别指望裸提示词出好页面。 没有更强的上下文输入时,Kimi 和 Claude Fable 都倾向产出「精致但平庸」的结果——这说明瓶颈不在模型而在输入。

2. 上下文输入是最大的质量杠杆。 实验中提升最明显的动作是给 Kimi 配设计参考 MCP:能参考截图和设计参照后,页面可读性、结构性、视觉意图全面改善。多模态能力 + 参考素材 = 质量跃迁。

3. 用便宜模型批量探索,贵的模型留给关键决策。 100 个页面省约 94 美元的账差,在多轮迭代的真实工作流里会持续放大。给模型更强的输入、用低成本高频迭代,能走得很远。

原文信息

  • 作者:Hassan El Mghari(Together AI)
  • 发布时间:2026-06-17 原文地址:

文章评论(2

晨沐雨16 分钟前

楼主辛苦了,内容很有参考价值。

回复
风倚栏48 分钟前

思路清晰,干货满满。

回复