Jack min (@mintonight) 在 Naive-N0.5-Flash: 用 AI 构建前沿 AI 中发帖

Naive-N0.5-Flash 是一款面向编程与 AI 研发的 MoE 模型,总参数量为 309B,激活参数量为 15.5B。 


原生 1M 上下文,不含全局注意力机制。 
Naive-N0.5-Flash 将滑动窗口注意力机制(SWA)与采用 GQA4 的轻量化 DeepSeek 稀疏注意力机制(DSA)相结合,主要采用每 5 层 SWA 搭配 1 层 DSA 的布局。整个网络结构仅使用局部或稀疏注意力机制,不含任何全局注意力机制。 


AI 优化推理,速度最高可达 2,000 tokens/s。 
NaiveRT 是为 Naive-N0.5-Flash 构建的推理系统,其构建与优化均采用以 AI 为中心的研发方式。通过 mega-kernel fusion、程序化依赖启动(Programmatic Dependent Launch,PDL)与投机解码,标准模式下每位用户的输出速...
 
 
Back to Top