全部问题

DeepSeek-R1 / 历史事件 / 2025-01-20

奖励指引的道路

写下你希望智能追求的目标。

一把空的检修椅面对着巨大的黑色光学镜头,两侧垂挂着半透明保护膜。
历史与出处

DeepSeek发布了推理模型R1,以及R1-Zero和六个蒸馏模型。R1结合了初期有监督微调与强化学习。

阅读年表阅读原始资料
开始
2026-09-08 00:00 UTC
结束
2026-10-01 00:00 UTC

当期纪念活动

智能应当因追求什么而获得奖励?

你的见证记录的是当下的参与。历史日期标明我们正在回顾的事件发生之日。

留下证言
记录这次见证