返回第三章 计划  重生2012:全球科技财阀首页

关灯 护眼     字体:

上一页 目录 下一页

pt>

    “13年显卡到来之前,必须完成三件事。“

    第一,搭建大模型基础框架——一套属于自己的深度学习框架。

    第二,Transforr架构。

    这是他最大的底牌。

    他要提前“发明“这个基于“注意力机制“的划时代模型。

    它将是未来所有大语言模型的基石。

    第三,小模型。

    基于新框架和Transforr架构,做出一个参数量在20亿到30亿的“小“模型。

    “这个方案已经是极限了。“

    陈阳在心里默念:

    “必须在13年底完成训练。2014年1月,准时发布。“

    “第三阶段:发布模型”

    有了钱和名气,他的最终目的才真正开始。

    “13年,必须完成三件事。”

    大模型基础框架:搭建一套属于自己的深度学习框架。

    陈阳在心里默念着这个计划的内核。

    深度学习框架,说白了就是AI的“作业系统“。

    它要解决两个最内核的问题:模型并行和模型通信。

    2012年,单块显卡的显存只有几个G,根本装不下一个大模型。

    唯一的办法,就是把模型“切开“——一部分放在这块显卡,一部分放在那块显卡,让它们协同工作。

    就象一本太厚的书,一个人拿不动,只能撕成几本,分给几个人同时看。

    这是模型并行。

    但问题来了——这几个人需要频繁交流,才能把内容串起来。

    显卡之间也一样,它们要不断传递数据,互相配合。

    这就是模型通信。

    如果通信效率低,几块显卡互相等待,再多显卡也没用。

    这两个技术,将是未来做大模型的内核基础。

    谁掌握了高效的模型并行和通信,谁就能训练更大的模型。

    陈阳很清楚,现在市面上,这两块几乎还是一片空白。

    他要做的,就是一套支持大规模模型并行和高效通信的框架。

    等这套框架成熟了,别人想做大模型,就得用他的“作业系统“。

    那时候,他就掌握了整个行业的底层规则。

    Transforr架构:

    这是他最大的底牌。

    为什么Transforr是跨时代的?

    两个原因。

    第一,它能理解前后关系。

    传统技术一个字一个字往后看,看到后面,前面就忘了。

    Transforr基于“注意力机制“,能看懂一句话里,哪些词和哪些词有关系。

    比如“他拿起苹果,咬了一口“——它知道“咬“和“苹果“有关联。

    这让AI第一次能真正“读懂“一段话。

    第二,它能并行处理。

    传统模型必须一个字一个字按顺序处理。

    Transforr可以同时处理所有字,效率高出几十倍。

    这两个特性,让Transforr成为未来所有大语言模型的基石。

    陈阳要提前把它“发明“出来。

    最后基于新的框架和Transforr架构,做出一个参数量在30亿(3B)的小模型。

    “30亿参数...“

    陈阳很清楚这个数字意味着什么。

    在FP32精度训练中,光是模型权重就需要12GB显存。

    但训练时,还要存储梯度、优化器状态...

    总共需要超过100GB的显存。

    “2013年11月,K40显卡发布。

    陈阳在心里盘算着时间节点。

    K40是英伟达即将推出的新一代旗舰计算卡,12GB显存,性能强悍。

    “要容纳100GB的训练显存,用12GB的K40来算...“

    陈阳在脑海中快速计算。

    “至少需要9张卡,才能勉强装下这个模型。“

    但他的眉头很快皱了起来。

    “只有9张卡,训练速度太慢了。到14年年中?恐怕到15年都训不完!“

    他的目标是4个月内完成训练。

    怎么办?

    陈阳的眼中闪过一道精光。

    “唯一的办法——数据并行。“

    把这个9卡组合的最小单元,再复制4套。

    让4个模型同时开工。

    “这样才能4个月内完成训练。“

    陈阳在心里默念。

    “必须提前订购,等11月硬件到位,立刻开始训练。“

  
本章未完,请点击下一页继续阅读>>

『加入书签,方便阅读』

上一页 目录 下一页