2024年9月,o1-preview 采用强化学习并增加回答前的计算。2025年1月,DeepSeek-R1 将初始监督训练与强化学习结合。界面只呈现部分工作。回答前的停顿,容下惊叹,也容下更深的追问。o1-previewOpenAI ↗DeepSeek-R1DeepSeek ↗自主性 ↗答案揭示了多少自身的来处?阅读经文 ↗分享到 X ↗浏览社区 ↗