返回第74节  首富从AI浪潮开始首页

关灯 护眼     字体:

上一页 目录 下一页



    赵文渊看了他一眼,惊奇的挑了挑眉,又转头看看正一脸茫然看向这边的张彪。

    “对,SFT,指令微调,让模型学会特定任务的模式,比如你给它一句自然语言描述,它要生成一个能跑的应用。DPO,直接偏好优化,这是第二步,让模型学会分辨什么是好的输出、什么是差的输出。”

    他在纸巾上画了个简单的流程图。

    “后训练的算力需求比预训练低一到两个数量级,三千万够启动。”

    他把笔放下,先看向张彪。

    张彪觉得自己困了,尽力睁大眼睛,眨了眨。

    赵文渊放弃让张彪理解这次谈话了,他转向韩路一。

    “后训练不拼算力,拼数据,准确的说,拼的是高质量的标注数据。”

    韩路一等他继续。

    “SFT需要大量的问题、答案配对。输入是用户的自然语言提示词,输出是可运行的应用代码,这种数据的质量直接决定模型的上限。”

    赵文渊身体前倾。

    “人工标注一条高质量数据,几十到上百块,十万条就是千万级别的成本,而且标注团队水平参差不齐,做出来的数据你还得反复清洗。”

    “我在鼎盛的时候见过,CodeSafe吃进去的用户数据量很大,但脏,噪声多,他们花了很多人力清洗,效果始终上不去。”

    “垃圾进,垃圾出。”韩路一说。

    “就是这个意思,数据质量不行,模型再大也是白搭。”赵文渊说完,看着韩路一的眼神带着试探的意味,他在等韩路一出牌。

    “数据我有。”

    赵文渊没说话,但身体坐直了。他当时就猜测过,BugKiller为什么这么强,要么有黄金数据,要么有未公开的先进算法,现在看来是前者。

    “你的数据哪来的?”他放慢语速,问道,“不会也是偷的吧?”

    这话不是玩笑,赵文渊从鼎盛出来的,就是看不惯CodeSafe偷用户代码喂大模型,这是他的底线。

    韩路一正色道:“所有的数据都是用户自愿分享的。注册时的相关选项是默认关闭的,用户必须主动选择将检测结果用于产品改进我们才能看到。协议是律师一条一条审过的,我这也有审计报告。”

    赵文渊盯着他看。

    “我绝不偷数据。”韩路一说。

    “好。”赵文渊点了点头,“那数据量够吗?”

    韩路一打开背包里的笔记本电脑,接上手机热点,先登录开物后台。

    屏幕上跳出一个数据看板。

    “开物上线到现在,累计二十三万条提示词-代码配对,”韩路一把屏幕转向赵文渊,“全部来自用户主动分享。”

    赵文渊扫了一眼总数:“二十三万条……量是够了。但有个问题,AI生成的代码本身就有Bug,直接拿来训练不还是垃圾进垃圾出?”

    “所以有第二步。”

    韩路一切换到另一个界面,BugKiller的数据管线看板。

    “开物每一条生成的代码,都会自动过一遍BugKiller的检测引擎,有Bug的标出来,能自动修复的直接修复,修不了的丢弃。”

    赵文渊凑近屏幕。

    数据流很清晰:用户提示词→原始生成代码→ BugKiller自动检测→修复后代码→入库。

    每一条数据都带着状态标签,“通过”或“已修复”,没有“未修复”。

    “原始代码通过率60%上下,经过BugKiller修复后,最终入库率96%。”

    赵文渊没说话,他伸手拿过笔记本,开始自己翻数据。

    他先看了几条“已修复”的,原始代码里确实有Bug,修复后的代码干净利落。然后他翻“通过”的那些,原始生成就没问题,代码结构清晰,变量命名规范。

    一条、两条、五条、十条。

    他逐行看修复逻辑。

    二十条、三十条。

    瑞幸店里的音乐换了几首,赵文渊都没有抬头。

    翻到五十条左右的时候,他停了。

    “这个检测引擎就是BugKiller的核心?”

    “对,核心算法是我自己写的,”韩路一说,“这是技术壁垒。”

    “你这个数据的确不可能是偷来的,客户的代码良莠不齐,偷来的没有这么高的质量。”赵文渊叹了一口气,“怪不得CodeSafe会输给你,我心服口服了。”

    “这个准确率,这种用法,”他接着说,“你手里的是一条自动化的数据清洗流水线,别人要花几千万请人标注的事,你用算法跑一遍就完了。”

    他又想了想,语速突然变快。

    “而且,BugKiller检出来的那些Bug代码和修复后的版本,这
本章未完,请点击下一页继续阅读>>

『加入书签,方便阅读』

上一页 目录 下一页