就在最近,SemiAnalysis发表了一篇硬核长文博客,爆料了不少大模型圈的内幕消息。
其中,一些最核心的亮点,先一睹为快:
- OpenAI正在训练一个规模介于GPT-4.1和GPT-4.5之间的新模型
- 下一代推理模型o4将基于GPT-4.1展开RL训练
- 强化学习改变了实验室结构,甚至是大厂未来研究的侧重方向和优先级
- 定义奖励函数难上加难,往往AI钻空子之后,漏洞才能被发现
- 不牺牲LLM任何性能,不用合并权重,RL另一条路——数据混合
- 与预训练不同,RL可持续更新Scaling模型能力,DeepSeek-R1是典例
- 高质量数据是Scaling强化学习的护城河
- 训练小模型,蒸馏效果要比RL更好

页码:下一页