跳到正文

千问 Qwen

阿里千问 Qwen 系列的开源发布与迭代:从旗舰模型到端侧小模型的全谱系动态。

最新精選

第 1–2 條 · 共 2 條
9月3日週四
  1. Hugging Face Blog66

    如何用 TRL 和 OpenEnv 训练代码模型绘制水彩画

    作者基于开源方案复现了让大语言模型通过编写 JavaScript 代码绘制水彩画的强化学习流程,并公开了参考图像池、强化学习环境、训练脚本及训练好的模型。文章对比了不同美学奖励权重配置下的多项实验结果,详细记录了基础设施搭建及训练调优过程中的发现。

    推薦理由:文章复现并开源了使用强化学习训练代码模型绘制水彩画的完整流程,为读者提供了基于美学偏好进行对齐的具体实现与多重实验对比。

6月25日週四
  1. Google Research63

    Google Research:思考以检索:推理如何解锁大语言模型中的参数化知识

    Google Research 探讨了大语言模型中推理如何解锁参数化知识,通过控制实验揭示了计算缓冲区效应和事实启动两大机制。研究表明,即使面对简单的单跳问题,启用推理也能帮助模型召回原本难以触及的正确答案。不过,推理阶段产生的中途幻觉会显著降低最终答案的正确率。

    推薦理由:研究揭示了推理如何解锁大语言模型的参数化知识,并指出了中间事实对准确率的关键影响。