DeepSeek-R1
Mer info
- Skapad av
- DeepSeek AI
- År
- Ägare
- DeepSeek
- Typ
- Reasoning-LLM
- Licens
- MIT (vikter)
- Officiell sajt
- deepseek.com
- Källkod
- github.com/deepseek-ai/DeepSeek-R1
Kinesisk open-weights reasoning-modell (DeepSeek, januari 2025) som matchade OpenAI o1 på matte och kodning — för ungefär en hundradel av träningskostnaden.
Bevisade att pure RL (utan SFT-warmup) kan ge starka reasoning-förmågor. Föregångaren R1-Zero tränades på enbart belöningssignaler för rätt svar i matte/kod; final R1 distillerades till mindre modeller (Qwen-7B, Llama-8B) som plötsligt kunde resonera långt över sin viktklass.
Marknadschock: krossade antagandet att frontier-modeller krävde miljarder och slutna data. Aktien för Nvidia föll ~17 % på en dag. Vikter under MIT-licens på Hugging Face.