Kimi K2.7 Code 对比 Claude Fable 5:12 个落地页实测,成本便宜 94%,评分只差几个点

一句话结论
同一组提示词、12 个落地页、两个模型:Kimi K2.7 Code 的总成本约比 Claude Fable 5 低 94%(平均便宜约 16 倍),GPT-5.5 按 0-100 分制盲评下绝大多数页面只落后 0-7 分;再给 Kimi 配上一个提供设计参考截图的自定义 MCP 服务器,页面质量还能再上一个台阶。对要批量生成落地页、多方案迭代探索的团队,这是一组可以直接拿来做选型决策的实测数据。
实验怎么做的
Together AI 的 Hassan El Mghari 做了一个对照实验:给 Kimi K2.7 Code 和 Claude Fable 5 同一组落地页提示词,每个模型各生成 12 个页面,然后从定位、视觉方向、内容结构、工艺、响应式、技术执行几个维度比较整体质量。所有变体连同成本、token 用量、生成时间都公开在 OVSC 网站上,可以逐页查看。作为参照,实验还包含了 Claude Opus 4.8 的生成结果——平均算下来 Kimi 比 Fable 便宜约 16 倍,比 Opus 便宜约 8 倍。
提示词设计
提示词覆盖几个不同品类,保证结论不依赖单一题材:
- 「为一个把 SQL 查询变成图表的开发者工具做一个落地页」
- 「为一个屋顶地下酒吧式的鸡尾酒酒吧做落地页——装饰艺术风格、金箔配祖母绿、1920 年代摩登」
- 「为一个 B2B SaaS 创业公司做落地页——团队项目管理与协作工具(任务、时间线、团队工作流、集成)」
两个模型拿到完全相同的提示词。第一轮不看任何参考,只靠提示词本身生成。
基线结果:都像 AI 做的
这是两个模型收到「SQL 图表工具落地页」提示词后的直接输出对比:

两个模型交出的页面都「一眼 AI」——精致但平庸,缺乏设计意图。这给了实验一个有用的基线:光靠一句提示词,无论闭源还是开源模型都做不出有辨识度的页面。要把质量推上去,需要给模型更强的创意方向输入。
关键变量:设计参考 MCP 服务器
实验中最大的质量杠杆不是换模型,而是给 Kimi 配了一个自定义 MCP 服务器,里面提供精心设计的落地页截图、单独的 UI 元素和其他视觉引用。因为 Kimi K2.7 Code 是多模态模型,这些截图可以直接跟文字一起放进提示词。
效果立竿见影:Kimi 不再从一句短提示凭空生成布局,而是从具体范例中捕捉视觉语言,把模式应用到新页面上。实际结果表现为更强的层级、更好的排版、更有意图的构图。
这是屋顶酒吧页面前后对比(左:仅提示词版;右:设计参考 MCP 版):

有了设计参考之后,Kimi 生成的页面加载更快、不再出现碎图占位符,排版可读性也明显提升。
成本:单页 4 美分 vs 1.09 美元
成本差异是开源模型的直接优势。同一个 B2B SaaS 落地页提示词,Kimi 只花了 4 美分,Claude Fable 花了 1.09 美元——单页差约 27 倍。

平均下来,Kimi K2.7 Code 生成的落地页比 Claude Fable 5 便宜约 16 倍。这里的关键在于生成式编码智能体的真实工作方式:你很少只生成一版落地页,而是批量生成多个变体探索不同设计方向,再对有希望的方案反复编辑迭代。这种来回多轮的流程里,单价差异会迅速放大——生成 100 个页面,用 Kimi 相比用 Fable 能省下约 94 美元。
质量对比:GPT-5.5 盲评 12 页评分表
为了系统比较质量,实验让 GPT-5.5 按评分细则审查每页截图和源代码,从 0 到 100 打分:
| 页面 | Fable | Fable+MCP | Kimi | Kimi+MCP |
|---|---|---|---|---|
| SQL 图表工具 | 86 | 91 | 82 | 86 |
| 长文阅读页 | 86 | 83 | 82 | 85 |
| 建筑作品集 | 91 | 92 | 88 | 79 |
| 睡眠 App | 92 | 94 | 80 | 80 |
| 学做菜 App | 94 | 92 | 86 | 81 |
| 独立书店 | 95 | 92 | 89 | 89 |
| 电子音乐 | 91 | 91 | 85 | 85 |
| 辣椒酱品牌 | 91 | 93 | 86 | 87 |
| 屋顶酒吧 | 93 | 92 | 86 | 85 |
| 香水品牌 | 91 | 91 | 88 | 83 |
| 语音克隆 App | 88 | 90 | 83 | 84 |
| B2B SaaS | 84 | 90 | 80 | 81 |
Claude Fable 在两组对比中得分都更高,但差距很小。Kimi 在设计、结构和整体页面质量上保持竞争力,运行成本低得多。对这个类别的工作流,这笔账算得过来。
给落地页生成工作流的三个可复用结论
1. 别指望裸提示词出好页面。 没有更强的上下文输入时,Kimi 和 Claude Fable 都倾向产出「精致但平庸」的结果——这说明瓶颈不在模型而在输入。
2. 上下文输入是最大的质量杠杆。 实验中提升最明显的动作是给 Kimi 配设计参考 MCP:能参考截图和设计参照后,页面可读性、结构性、视觉意图全面改善。多模态能力 + 参考素材 = 质量跃迁。
3. 用便宜模型批量探索,贵的模型留给关键决策。 100 个页面省约 94 美元的账差,在多轮迭代的真实工作流里会持续放大。给模型更强的输入、用低成本高频迭代,能走得很远。
原文信息
- 作者:Hassan El Mghari(Together AI)
- 发布时间:2026-06-17 原文地址:
楼主辛苦了,内容很有参考价值。
思路清晰,干货满满。