DR.Cat (@o_cat)deepseek v4.1正式推出~encoder-decoder架构文艺复兴引人注目 中发帖

DeepSeek V4.1 Flash:更强、更快、更普惠
分数
 [0d68fbc08fd083f59581b433440d10e1] 
[compressed_1789019798126] 
模型开源链接:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash论文链接:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf 
架构解读
 [6d3935cb7a46bad1e50402bf954fd46d] 
这次用上的encoder-decoder是一个亮点 
现在大语言模型基本上都decoder-only 上一个encoder-decoder的佳作还是Google T5(广泛作为文生图/视频模型的文本...
 
 
Back to Top