手机浏览器扫描二维码访问
在FP8问题上,孟繁岐与DS是一致的。
在稀疏这一方向上,孟繁岐选择了细粒度,矩阵层面的稀疏。
DS则选择了通道层面的MoE,混合专家模型。
简单来说,DS选择把模型拆分为1632个专家,就像是把一块蛋糕均分切成1632块。
每一块都是不同的味道,每一个专家更加专注于不同的知识。
根据具体的情况,会有一个门控系统,来决定哪些专家参与计算。
而孟繁岐的野心更甚,他想要从根本上将整个模型在原子级别拆分,细粒度地对所有权重进行大刀阔斧地裁减,直到原本大小的1632分之一。
从理论上说,这种方式的上限更高,MoE的稀疏更显得粗糙。
另一方面,孟繁岐也有愿景,想要增强国内硬件的竞争力。
因为英伟达的设备,是无法支持这种细粒度稀疏计算的。
倘若能够先发展国内计算设备,适配这种技术,就能够在制程等诸多硬件技术落后的情况下,达到更快的推理效果。
换言之,孟繁岐又一次将希望寄予了发展周期更长的硬件厂商,那么在这方面被其他人赶上,倒也不是什么奇怪的事情了。
虽然具体实现上稍显不同,但总体来说,DS完成了孟繁岐在技术上的两点宏观展望。
从其余的许多技术细节当中,孟繁岐可以很强烈地读到,他们的开发之路走得也并不顺利。
比如说混合专家MoE,很容易让一两个专家变成懂王,什么都要参与,很多其他的专家渐渐变成了挂件,貌似在参与,其实完全就是围观的观众。
如果增加额外的损失函数去调整它们,既增加了大量计算量,又极有可能影响到训练的主要目标本身。
专家们的调度问题这个小问题影响到模型的能力这个主要问题。
DS最终完美地解决了这个问题,既没有额外增添损失计算优化,又使得各专家实现了负载均衡。
孟繁岐相信,这个最终简洁优雅的技术方案背后一定存在许多努力与艰辛。
而现在的closeai对这种付出是越来越排斥的。
比起花费许多的努力在某一个算子上优化20-30%的速度,他们更愿意多用一些显卡,多花一些时间。
既然英伟达暂时不直接支持FP8做这样的操作,那就先等等吧。
诸如此类的事情持续累积,使得后来者已经实质上实现了相当数量的技术超越,甚至是在孟繁岐较为关注的技术方向上。
而DeepSeek的坦率开源,也让孟繁岐动摇了closeai是否继续闭源的想法。
“若是我适当裁减一些已经沉迷安乐的技术人员,逐渐走向开源,对比海对面的OpenAI倒也算是奇景了。”
孟繁岐想到这里也是笑出了声。
自从两国关系逐渐微妙,CloseAI的在美使用就收到了限制。
原本标榜开源的OpenAI逐渐走向闭源,而最初就闭源盈利的CloseAI反而在考虑拥抱开源盛世。
这倒也称得上是另一种双向奔赴了。
同一时刻,比起一直在关注技术细节的孟繁岐,普通人更为在意的,则是R1这个模型,首次揭露了前沿高性能智能思考问题的逻辑脉络。
二十三世纪天才科学家重生了,他用一项项科技改变世界,他拥有无数的荣誉,他俯视爱因斯坦,他拥有数之不尽的财富,他每天被无数美女诱惑包围。用科技征服全球,用经济殖民全世界。让全世界的人,为中国人打工,让中华民族屹立世界巅峰。在这个落后的地球上,我无所不能。求收藏,求推荐票支持。...
周通穿越到西游,成为五行山,获得打工人系统!一直压着孙悟空,就能变强!!孙悟空放我出去!周通我是西游打工人,打工人,打工魂,打工人是人上人!孙悟空我要让这天,再也遮不住我的眼!我要让这地,再也啪!一块大石头砸在孙悟空的脑袋上。周通呵呵!唐僧哭了贫僧爬山爬了二十年了,金帖呢?菩萨和佛祖也哭了求求你,把孙悟空放出来吧!圣人???天地大劫怎么变成这样了?...
隐瞒了两年的地下超级战神身份,终于被老婆发现了!...
一本不知道会写成什么样子的小说,范闲的弟弟应该叫什么,范多余,不是范熟在这个多智若妖的世界里,想要活着畅快些,只有一个办法。我看他起高楼,我看他宴群宾,我拆了他楼,看他还剩几人。如书名,第一个世界就是庆余年了后面的世界可能会写都市。第二个应该写混合一些的世界,比如说王多鱼什么剧接下来待定中...
网游之练级专家由作者发飙的蜗牛创作全本作品该小说情节跌宕起伏扣人心弦是一本难得的情节与文笔俱佳的好书919言情小说免费提供网游之练级专家全文无弹窗的纯文字在线阅读。...
医武无双,把敌人打了治,治完再打就问你怕不怕!...