返回第二十章 演讲  重生2012:全球科技财阀首页

关灯 护眼     字体:

上一页 目录 下一页

的关系。

    “传统观点认为,网络越深,表达能力越强。但事实上,当网络超过一定深度后,准确率反而会下降。“

    陈阳点击翻页。

    。很多人认为这是过拟合导致的,但实际上,即使在训练集上,深层网络的表现也不如浅层网络。

    台下的学者们点头,这确实是困扰业界多年的难题。

    “那么,问题出在哪里?“

    陈阳的语气突然变得锐利:

    “问题在于,我们让网络学习的东西太难了。“

    他点击下一页,屏幕上出现了一个简单的示意图。

    左边是传统网络:输入X经过两层网络,输出H(X)。

    右边是残差网络:输入X经过两层网络得到F

    “这就是残差学习的内核思想。“

    陈阳的声音在寂静的会场里回荡:

    “与其让网络直

    “为什么这样更简单?因为在很多情况下,最优映射接近于恒等映射。也就是说,F(X)接近于0,比直接学习H(X)要容易得多。“

    台下开始有窃窃私语声。

    “太简单了……“

    “为什么我们之前没想到?“

    “等等,这真的有效吗?“

    陈阳似乎听到了这些质疑,他点击下一页。

    屏幕上出现了一系列实验结果。

    “在CIFAR-10数据集上,我们测试了不同深度的网络。“

    红色曲线代表传统网络,蓝色曲线代表残差网络。

    在20层以下,两条曲线几乎重合。

    但当层数超过20层后,红色曲线开始下降,而蓝色曲线却持续上升。

    在110层时,残差网络的准确率依然在提升。

    “这意味着什么?“

    陈阳的目光扫过台下,“这意味着,残差学习解决了退化问题。我们可以训练真正的深度网络了。“

    掌声开始零星地响起,然后越来越热烈。

    “在IgeNet上,我们构建了一个152层的残差网络。“

    大屏幕上出现了网络结构图,层层叠叠,象一座摩天大楼。

    台下响起一阵倒吸冷气的声音。

    “152层?!“

    “这怎么训练的?“

    陈阳继续说:“很多人问我,这么深的网络,需要多强大的硬件?超级计算机?“

    他点击下一页。

    “我们的集群:12块NVIDIA GTX 680显卡。“

    台下一片哗然。

    “GTX 680?“

    “那不是游戏显卡吗?“

    “2GB显存怎么可能训练152层?“

    “我知道大家在想什么。“陈阳笑了,“152层的网络,模型大小超过20GB,怎么可能在2GB显存的卡上运行?“

    他点击下一页:

    “答案是:模型并行和数据并行的混合框架。“

    屏幕上出现了一张复杂的架构图,展示了如何将模型切分到多张显卡上,同时保持高效的训练速度。

    “我们设计了一套自适应的并行策略,根据每一层的大小和计算量,动态分配到不同的GPU上。“

    “通过精心设计的显存管理和梯度累积策略,我们实现了在消费级显卡上训练超深度网络。“

    台下的学者们疯狂地记笔记。

    齐瑟曼坐在第一排,眼睛一眨不眨地盯着屏幕。

    这不只是一个天才的算法,还是一个天才的工程实现。。

    陈阳停顿了一下,目光扫过台下每一个人:

    “这不是终点,而是起点。残差网络的出现,意味着深度学习真正进入了可以实用化的阶段。“

    “它可以应用在图象识别、目标检测、语义分割等各个领域。“

    “在星城数据,我们已经将ResNet应用到了实际业务中。“

    屏幕切换到新的页面,显示着几个应用案例。

    “第一,验证码识别。。“

    “第二,证件识别。。“

    “第三,我们正在探索更多应用场景,包括人脸识别、医疗影象分析等。“

    台下开始有人窃窃私语。

    “原来他们已经在做商业化了。“

    “难怪能做出这么强的模型。“

    陈阳继续说:

    “深度学习不应该只停留在实验室里。ResNet的目标,就是让AI技术真正走进现实世界,解决实际问题。“

    他的声音坚定有力:

    “这就是星城数据的使命——让每一个
本章未完,请点击下一页继续阅读>>

『加入书签,方便阅读』

上一页 目录 下一页