这项由清华大学主导、部分工作在Z.AI实习期间完成的研究,于2026年2月以预印本形式公开,论文编号为arXiv:2607.07508,研究方向聚焦于大型语言模型的强化学习训练效率与稳定性问题。 **大模型是怎么"学习"的?先从一个工厂比喻说起** ...