森林文学

字: 大 中 小
关灯 护眼
森林文学 > 重返高三,满仓抄底狂赚百亿 > 第333章 挖人

第333章 挖人

  第333章 挖人 (第1/2页)
  
  第二天上午。
  
  棕榈滩国际机场。
  
  按照原定安排,陈默和陆静怡将从这里直接返回香港。
  
  车队刚刚驶进机场,陈默便接到了伊利亚的电话。
  
  “陈,你还没有离开美国吧?”
  
  “正在机场。”
  
  “先别走。”
  
  伊利亚的声音沙哑。
  
  陈默看了一眼时间。
  
  “出什么事了?”
  
  “下一代语言模型的第一次扩大训练失败了。”
  
  “模型结构有问题?”
  
  “不是模型。”
  
  电话另一端传来键盘敲击声。
  
  “昨天晚上,我们按照原方案将训练规模扩大到五百一十二张GPU。”
  
  “单机测试正常,接入的机器越多,训练效率反而越低。”
  
  “显存里堆满重复数据,大量GPU都在等待其他节点完成计算,机器之间传输参数的时间,甚至超过了真正用于训练的时间。”
  
  伊利亚停顿片刻。
  
  “最后系统在第七个小时失去同步,训练结果全部作废。”
  
  陈默没有立即说话。
  
  一台机器工作很快,不代表将几百台机器放在一起,速度便能增加几百倍。
  
  模型需要被拆分到不同GPU上。
  
  每一块GPU计算完自己的部分,还要与其他节点交换结果。
  
  数据如何分配。
  
  显存如何利用。
  
  什么时候通信。
  
  任何一个环节出现堵塞,价值数百万美元的GPU集群都会陷入等待。
  
  纸面算力再大,也无法转化成真正的训练能力。
  
  “现在的利用率多少?”
  
  “平均百分之三十二。”
  
  伊利亚回答。
  
  “最差的时候不到百分之二十。”
  
  OpenAI目前拥有两千多张GPU。
  
  如果始终保持这种效率,真正发挥作用的算力甚至不到账面规模的一半。
  
  未来将集群扩大四倍,问题只会更加严重。
  
  “上次会议结束以前,你说只剩下一个办法。”
  
  陈默想起马斯克推门时被打断的谈话。
  
  “就是这个?”
  
  “对。”
  
  伊利亚说道。
  
  “谷歌拥有比我们更多的机器、工程师和数据中心。”
  
  “只靠采购GPU,我们永远追不上他们。”
  
  “OpenAI必须建立自己的计算系统,让每一张GPU完成更多工作。”
  
  “我们需要真正理解CUDA、显存、通信与分布式系统的人。”
  
  “我已经让Sam在硅谷寻找合适的人选。”
  
  “不用找了。”陈默说道。
  
  伊利亚安静了两秒。
  
  “你有推荐?”
  
  “知道一个。”
  
  陈默挂断电话,看向坐在身旁的陆静怡。
  
  “让机组更改飞行计划。”
  
  “先去旧金山。”
  
  陆静怡显然已经从刚才的通话里听出了原因。
  
  “林启航?”
  
  陈默笑了笑。
  
  
  
  (本章未完,请点击下一页继续阅读)
『加入书签,方便阅读』
热门推荐
在木叶打造虫群科技树 情圣结局后我穿越了 修神外传仙界篇 韩娱之崛起 穿越者纵横动漫世界 不死武皇 妖龙古帝 残魄御天 宠妃难为:皇上,娘娘今晚不侍寝 杀手弃妃毒逆天