@Zen608 在 模型降智的缘由大概在于算力稀释吧 中发帖

从下面的文章里的关键公式中:大概估计:参数量 N、数据集规模 D 以及总计算量 C 之间,这三个参数之间计算量的权重可能占比较大,当新模型推出,放量,使用人数越来越多时,分配到每个人的算力逐渐被稀释,而他们的算力同时还会被用于训练新模型,于是进一步被稀释。 
第 5 章 规模、对齐与生成

本章定位:当 Transformer 移除了时序与并行的物理枷锁后,人类如何将 AI 推向千亿参数的规模化深水区?本章剖析「规模的物理学定律(Scaling Laws)」、「文明的缰绳(对齐工程)」以及「创生的数学机理(生成范式演化)」。 


5.1 缩放定律与计算最优:算力炼金术中的物理学常数(T05, T06)
5.1.1 炼金术的黄昏与物理学家的入场
在 2020 年之前,深度学习研究在工业界与学界内部长期背负着一个略带戏谑的称谓——「现代炼金术」。 
成百上千名算法工程师守在昂贵的服务器机架前...
 
 
Back to Top