从未接受法律训练的自学 AI 登顶瑞士法律考试基准测试

📌 One-Sentence Summary
Darwin-180B-RSI 是一款在数学和科学领域使用模型级递归自改进的开源权重模型,尽管从未接受过法律数据训练,但已在瑞士法律考试基准测试中名列第一。
📝 Summary
本文介绍了来自 VIDRAFT 的 180B 参数模型 Darwin-180B-RSI,该模型在 LEXam 和 LEXam-hard 法律推理排行榜上均获得第一名。令人惊讶的是,该模型未经过任何法律文本训练;相反,它通过对其自身在数学和科学问题上的正确解法进行训练,实现了模型级递归自改进(RSI)。这一过程培养了一种通用的「推理习惯」,并成功迁移至法律领域。文中还区分了模型级 RSI(权重变化)与框架级 RSI(提示词/工作流变化),并解释了 Darwin 架构如何通过诊断融合而非从零预训练来演进模型。
💡 Main Points
推理能力的跨领域迁移
通过在可验证的数学和科学问题上进行递归自改进练习,模型培养了一套通用的推理方法论(分解问题并验证步骤),使其在没有法律训练的情况下,在瑞士法律考试中超越了专业模型。
模型级 RSI 与框架级 RSI 的区别
不同于框架级 RSI(如 Google 的 RRSI)通过在冻结模型周围优化提示词和工作流,模型级 RSI 直接更新实际权重,这意味着智能的提升被嵌入在模型文件本身之中。
Darwin 架构方法
Darwin 系列通过对父模型进行逐层诊断,并根据诊断信任度融合多个模型中最强的部分来演进模型,而非采用传统的从零预训练。
推理效率的提升
RSI 过程不仅提高了准确率,还提升了效率。该模型在达到与父模型相同准确率的同时,推理轨迹缩短了约 11%。
💬 Key Quotes
「在可验证问题上的自改进培养的是推理习惯而非知识:分解问题,检查每一步,得出结论。」
「Darwin 是在演进模型,而非从零开始预训练它们。」
「该模型从未接受过法律数据的训练。」
📊 Article Meta
AI Screening: 86
Source: DEV Community: machinelearning
Author: ai maya
Category: 人工智能
Language: 英文
Read Time: 3 min
Word Count: 662
Tags:
AI 与智能应用 , 推理模型 , 模型训练与推理 , 机器学习 , 大语言模型 (LLM)
实话,说的不明不白
支持作者,持续关注中。
有没有更详细的教程,期待后续。
支持作者,持续关注中。
有没有更详细的教程,期待后续。
收藏了,以后慢慢研究。
楼主辛苦了,内容很有参考价值。
写得挺用心的,支持一下。
看完了,收获满满,期待更多更新。
赞同,实践出真知。
支持作者,持续关注中。
楼主辛苦了,内容很有参考价值。