GitHub - 0arch-io/kisoku: Kisoku 1.6B: a from-scratch language model trained solo on a TPU grant. Weights, code, evals and report.

星海拾光AI 前沿📡 BestBlogs·AI高分精选⭐ 902026-10-10437 阅读💛 244 收藏
GitHub - 0arch-io/kisoku: Kisoku 1.6B: a from-scratch language model trained solo on a TPU grant. Weights, code, evals and report.

📌 One-Sentence Summary

Kisoku 1.6B 是由单个研究人员使用 TPU v4-32 从头开始预训练的语言模型,其性能与 Meta 的 Llama 3.2 1B 相当,而训练数据量却少了非常多。该项目包括聊天微调、长期扩展,以及涵盖训练过程、污染审核和成本分析的详细技术报告。

📝 Summary

该仓库包含 Kisoku 1.6B 的资源,这是一个由 Joseph Rodriguez 开发的语言模型。该模型使用 Google TPU v4-32 在大约 0.5 万亿个标记上进行预训练,重点是效率和可扩展性。它由一个 16 亿参数的基模型、一个用于聊天的微调模型,以及支持最大 128K 个标记的长上下文功能组成。该项目包括一份综合性的技术报告、训练配置、评估脚本和污染审核,以确保数据完整性。

💡 Main Points

高效预训练

Kisoku 1.6B 仅在 ~0.5 万亿个标记上进行了训练,这大约是 Llama 3.2 1B 使用数据量的 1/18。尽管如此,它在多个基准测试中取得了媲美的性能,表明训练过程的效率很高。

长上下文能力

该模型被扩展到处理长上下文长度,原生支持最多 64K 个标记,并可以使用 YaRN 插值方法扩展到 128K 个标记。这使得它适用于需要大输入窗口的任务,例如文档分析或代码审查。

进行了彻底的污染审核,以确保训练数据不包含来自评估基准的信息。结果显示重叠情况非常少,确认了模型性能指标的可信度。

💬 Key Quotes

在一系列包含 10 项基准的测试中,它与 Meta 的 Llama 3.2 1B 的表现旗鼓相当(各胜 5 项),而使用的训练数据却少了大约 18 倍.

📊 Article Meta

AI Screening: 90

Source: Hacker News - Newest: "LLM"

Author: 0ARCH

Category: 人工智能

Language: 英文

Read Time: 3 min

Word Count: 529

Tags:

AI 与智能应用 , 长上下文 , 开源项目 , 独立开发 , AI 硬件与芯片

#AI 与智能应用# 长上下文# 开源项目# 独立开发# AI 硬件与芯片

文章评论(0)

暂无评论,快来抢沙发~