关灯
护眼
字体:大 中 小
上一页
目录
下一页
的关系。
“传统观点认为,网络越深,表达能力越强。但事实上,当网络超过一定深度后,准确率反而会下降。“
陈阳点击翻页。
。很多人认为这是过拟合导致的,但实际上,即使在训练集上,深层网络的表现也不如浅层网络。
台下的学者们点头,这确实是困扰业界多年的难题。
“那么,问题出在哪里?“
陈阳的语气突然变得锐利:
“问题在于,我们让网络学习的东西太难了。“
他点击下一页,屏幕上出现了一个简单的示意图。
左边是传统网络:输入X经过两层网络,输出H(X)。
右边是残差网络:输入X经过两层网络得到F
“这就是残差学习的内核思想。“
陈阳的声音在寂静的会场里回荡:
“与其让网络直
“为什么这样更简单?因为在很多情况下,最优映射接近于恒等映射。也就是说,F(X)接近于0,比直接学习H(X)要容易得多。“
台下开始有窃窃私语声。
“太简单了……“
“为什么我们之前没想到?“
“等等,这真的有效吗?“
陈阳似乎听到了这些质疑,他点击下一页。
屏幕上出现了一系列实验结果。
“在CIFAR-10数据集上,我们测试了不同深度的网络。“
红色曲线代表传统网络,蓝色曲线代表残差网络。
在20层以下,两条曲线几乎重合。
但当层数超过20层后,红色曲线开始下降,而蓝色曲线却持续上升。
在110层时,残差网络的准确率依然在提升。
“这意味着什么?“
陈阳的目光扫过台下,“这意味着,残差学习解决了退化问题。我们可以训练真正的深度网络了。“
掌声开始零星地响起,然后越来越热烈。
“在IgeNet上,我们构建了一个152层的残差网络。“
大屏幕上出现了网络结构图,层层叠叠,象一座摩天大楼。
台下响起一阵倒吸冷气的声音。
“152层?!“
“这怎么训练的?“
陈阳继续说:“很多人问我,这么深的网络,需要多强大的硬件?超级计算机?“
他点击下一页。
“我们的集群:12块NVIDIA GTX 680显卡。“
台下一片哗然。
“GTX 680?“
“那不是游戏显卡吗?“
“2GB显存怎么可能训练152层?“
“我知道大家在想什么。“陈阳笑了,“152层的网络,模型大小超过20GB,怎么可能在2GB显存的卡上运行?“
他点击下一页:
“答案是:模型并行和数据并行的混合框架。“
屏幕上出现了一张复杂的架构图,展示了如何将模型切分到多张显卡上,同时保持高效的训练速度。
“我们设计了一套自适应的并行策略,根据每一层的大小和计算量,动态分配到不同的GPU上。“
“通过精心设计的显存管理和梯度累积策略,我们实现了在消费级显卡上训练超深度网络。“
台下的学者们疯狂地记笔记。
齐瑟曼坐在第一排,眼睛一眨不眨地盯着屏幕。
这不只是一个天才的算法,还是一个天才的工程实现。。
陈阳停顿了一下,目光扫过台下每一个人:
“这不是终点,而是起点。残差网络的出现,意味着深度学习真正进入了可以实用化的阶段。“
“它可以应用在图象识别、目标检测、语义分割等各个领域。“
“在星城数据,我们已经将ResNet应用到了实际业务中。“
屏幕切换到新的页面,显示着几个应用案例。
“第一,验证码识别。。“
“第二,证件识别。。“
“第三,我们正在探索更多应用场景,包括人脸识别、医疗影象分析等。“
台下开始有人窃窃私语。
“原来他们已经在做商业化了。“
“难怪能做出这么强的模型。“
陈阳继续说:
“深度学习不应该只停留在实验室里。ResNet的目标,就是让AI技术真正走进现实世界,解决实际问题。“
他的声音坚定有力:
“这就是星城数据的使命——让每一个
本章未完,请点击下一页继续阅读>>『加入书签,方便阅读』
上一页
目录
下一页