关灯
护眼
字体:大 中 小
上一章
目录
下一页
“刚考完期末考试,暑假了。”顾屿语气平淡,
“听少卿在飞书上汇报,说模型训练卡在强化学习这一步了。我过来看看。”
站在老王身边的林远,整个人完全处于状况外。
他看着这个穿着杰尼亚休闲卫衣、浑身上下透着股清澈大学生气质的年轻人,脑子有点转不过弯。
这里可是九天算力中心最核心的A1实验室。里面站着的,是楼天城、任少卿这种在全球计算机视觉和算法领域封神的人物。
这个年轻人不仅没刷门禁卡就进来了,还让任少卿这种级别的科研狂人摆出这种如释重负的姿态?
“王工,这位是谁?”林远用只有两人能听见的声音询问,
“公司新招的管培生?还是投资方派来的代表?”
老王转过头,眼神复杂地看了林远一眼,同样压低声音:
“什么管培生。这是回响科技的董事长,顾屿。咱们整个回响、九天算力中心,全是他的产业。”
林远眼皮狠狠跳了一下。
他回国前做过详尽的背调,知道九天背后站着一家实力恐怖的中国互联网巨头。
但他从未想过,那个豪掷数百亿现金在深山里挖空山体建算力中心的老板,居然是个看着还没毕业的大学生。
“别光看年纪。”老王看着林远的反应,轻声补了一句,
“你刚才看到白板上那个RLHF机制了吧?”
林远木讷地点头。那个极其天才的强化学习反馈架构,正是让他惊叹九天技术底蕴的核心所在。
“那个机制最初的数学逻辑,还有咱们抛出去那篇震惊硅谷的TranSfOrr架构论文,底层的自注意力机制构想,全是他提出的。”老王的声音压得极低,却字字砸在林远心坎上,
“楼教主和任工遇到走不通的死胡同,只有他能指明方向。”
林远脑子里嗡地一声。
斯坦福的骄傲在这一刻裂开了一条缝。
一个掌握百亿资本的董事长,不仅懂技术,而且在最前沿的AI理论上领跑全球最顶尖的科学家?
这种事情完全超出了他的认知常理。
“奖励黑客现象,还有模型微调带来的灾难性遗忘。”顾屿准确地念出任少卿总结的两个痛点。
楼天城蹲在椅子上,烦躁地抓着本就凌乱的头发:
“这东西太狡猾了。为了刷高奖励模型的分数,它疯狂堆砌废话,稍微约束一下,它连基础数学公式都全忘了。我们在损失函数里加了七八种正则化限制,全都没用。算力在空转,资金每天都在烧!”
顾屿看着屏幕上不断滚动的错误日志,神色平静。
这两个问题,在2016年这个全球AI界连大模型门槛都没摸到的时间节点,确实是绝症。
没有任何论文可以参考,没有任何开源代码可以借鉴。
但在后世那个百模大战、大模型开源烂大街的2024年,这不过是教科书级别的新手问题。
如果没有前世的记忆,仅凭九天现有的这群天才,哪怕有雅安无尽的算力支撑,他们至少要在黑暗中摸索七到八个月,才能靠海量的试错堆出一个勉强可用的方案。
但是顾屿站在这里,“标准答案”就在这里。
“你们给奖励模型的权力太大了,模型更新的步子也跨得太宽。”
顾屿转过身,手中的马克笔在白板上迅速写下一行全新的数学推导公式。
“在PPO算法更新参数的时候,你们不能让模型像脱缰的野马一样为了讨好奖励模型而乱跑。必须引入一个参考模型,也就是你们做微调之前的那个初始底座模型。”顾屿条理清晰地抛出解法,
“每次新模型生成回答,不仅要看奖励模型给多少分,还要实时计算它和初始模型在词元输出概率上的分布差异。”
顾屿转头看向楼天城,给出了一个形象的比喻。
“打个比方,初始模型就像一个博览群书但口无遮拦的学者,它有自己正常的说话习惯和用词规律。当它为了迎合打分系统,开始满嘴车轱辘废话或者疯狂堆砌政治正确词汇时,它的语言分布就会发生剧变。我们要做的,就是用数学工具去量化这种变化带来的偏差。”
顾屿手中的笔尖顺着公式滑动:
“如果生成的回答偏离初始模型太远,偏差过大,就直接在最终奖励里进行大幅度扣分惩罚。逼着它既要回答人类想听的,又绝对不能偏离原本正常的语言逻辑规律。”
顾屿停下笔,目光扫过实验室里的众人:
“在信息论和概率统计里,衡量两个概率分布之间差异的这把标尺,全称叫做KUllbaCk-Leibler divergenCe,也就是库尔贝克-莱布勒散度。”
顾屿手臂发力,笔尖重重地在公式尾端写下两个大写字母
本章未完,请点击下一页继续阅读>>『加入书签,方便阅读』
上一章
目录
下一页