论文原文

kimi-k2是一个结构类似deepseekv3的大模型,特点在于极强的工具调用能力,适合做agent。

下面从技术的角度提取其中的关键方法。

1.MounClip优化器

用于解决的问题:Moun优化器比常见的AdamW优化器更能提升token效率,但是由于注意力logits爆炸问题,会导致损失值飙升(loss spike)。

通过QK-clip,解决了这一问题。

算法流程

在这里插入图片描述
解读:
在这里插入图片描述
在这里插入图片描述

2.预训练中的合成数据

这里提到了token效用,也就是一个token能够带来的学习收益。

预训练中:
单次遍历(single epoch)不足以让模型充分吸收复杂知识;
多次重复(multi-epoch repetition)又会导致学习效率递减,并显著增加过拟合风险。

核心理念:用多样化的表达方式“重新包装”知识,让模型从不同角度反复“阅读”同一内容,从而加深理解。

流程

1.多样化提示:构造提示词,让大模型对原始文本进行忠实且多风格和视角的改写。
2.逐块自回归生成:文本分段,逐个改写,而后拼接。
3.保真度验证:比较与原始文本的语义一致性。

3.大模型中的稀疏性缩放定律

这里的稀疏性为MOE模型中专家总数和激活专家数量的比率。
在激活参数参数量不变时,增加专家总数能够持续降低训练和验证损失。

4.后训练的agent数据合成工作

在这里插入图片描述
在Kimi K2模型的后训练阶段,agent数据合成流程主要分为三个核心阶段,具体如下:

  1. 工具规格生成:首先构建一个包含真实世界工具和大语言模型合成工具的大型工具规格库,为后续的工具使用场景模拟奠定基础。
  2. 智能体与任务生成:从上述工具库中抽样选取工具集,针对每个选定的工具集,生成对应的智能体(agent)以及该智能体需要完成的相关任务。
  3. 轨迹生成:针对每个智能体和其对应的任务,生成智能体通过调用工具完成任务的完整轨迹(trajectories),以此模拟真实世界中的工具使用过程。多轮轨迹生成采用用户模拟(大模型生成)和沙盒环境的方法。

5.强化学习

在这里插入图片描述
在这里插入图片描述

最关键的是怎么设计奖励,这里针对可验证和不可验证,分别设计

可验证的数学逻辑任务

代码解释器验证;大模型作为评估器验证

不可验证的开放性任务

采用自我批判优化,即pairwise评估

Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐