返回第三百四十四章 那到时候顾叔叔应该就不会再难过了吧  15岁,成为国宝级天才科学家首页

关灯 护眼     字体:

上一章 目录 下一页

    好不容易安抚好奶奶和王舒,肖宿这才回到了书房。

    房间里十分安静,只能听见空调送风的低鸣和肖宿踩在地板上的脚步声。

    他在书桌前坐下,重新梳理了一遍刚刚思考的问题。

    推演是一回事,真正要做出来又是另一回事。

    想要真正做到让一个人的记忆在机器人身上存在,那么他要做的,就要横跨自然语言处理、计算机视觉、知识图谱、情感计算、脑机接口和精密机械工程等所有领域,创建起一个完整的架构。

    而这些,随便选一个出来,都够一个顶尖实验室花上数十几年去啃了。

    更何况他要做的还不是单点突破,而是要把这几条线全部拧在一起,在每一个交叉节点上同时攻关,还不能让任何一条线在集成的时候掉链子,难度不知道提升了多少倍。

    这条路还没有人踏足过。

    肖宿作为第一个人,他需要自己从头设计一整套全新的架构,从跨平台数据采集与身份对齐的算法渠道,到具有长期人格一致性的新型对话模型,从多模态情感表达的统一表征框架,到适配机械躯体的低延迟交互控制系统,并且确保每一层接口在算法上和工程上都是严格兼容的。

    这个工程量比他之前做的任何一个课题都要大。

    而且他隐隐感觉到,一旦走上了这条路,要解决的就不仅仅是算法和软件的问题。

    要让这个机器人真正能够陪伴在顾叔叔身边,硬件层面也必须做出相应的改造,更长的续航、更自然的触感、更精细的表情控制。

    这些都不是一朝一夕能完成的事情,每往前推进一步,都会牵扯出更大的系统工程。

    不过技术上的难题,对肖宿来说,从来都不是难题。

    他抬了抬手,撑住了下巴,眉头微微皱起,思考起接下来的任务。

    第一个就是需要确认的关键节点,也是整条链路里他最需要摸清现状的环节,就是在个人数据集成与人格建模那边。

    目前全球范围内,个人数字足迹的全量采集能做到多完整才可行?

    不同平台之间的数据孤岛有没有被打通的先例?

    从碎片化的行为数据到结构化的人格文档,中间的建模技术目前走到了哪一步?

    有没有人尝试过把一个人的全部数字痕迹输入一个统一的大模型,训练出一个能够持续对话且人格高度一致的数字分身?

    更关键的是,这种数字分身在长期交互中的稳定性如何?会不会在数十轮对话之后出现人格漂移、记忆混乱或者情感反应失真的问题?

    这些问题在AI和算法层面他可以自己推导,但是具体的技术边界和工程现状不看文献是凭空想不出来的。

    人格模型能有多像本人,不是推导出来的,是拿真实数据训练完、让认识本人的人一个一个测出来的。

    他打开计算机,给小智下发了搜索指令,很快,屏幕上就按时间倒串行出了全球范围内与这个内容高度相关的论文、预印本、实验报告和技术白皮书。

    排在最前面的是一篇来自麻省理工学院媒体实验室的研究报告。

    他们在大约三年前激活了一个名为“长期记忆对话智能体”的项目,将一名志愿者长达八年的个人邮件、日记、社交媒体帖子集成为训练语料,结合大规模预训练语言模型与检索增强生成技术,构建了一个能够以该志愿者身份进行日常对话的数字分身。

    在为期六周的交互测试中,数字分身在事实回忆类问题上的准确率表现优异,在观点表达与语言风格上也与本人保持了高度一致。

    但报告的后半段也写得很清楚,所有测试都在文本模态下进行,不涉及语音、不涉及面部表情、不涉及肢体动作。

    而且志愿者的数据是提前完整交付的,不存在跨平台数据采集的难题。

    第六周测试结束之后,研究团队关闭了系统,模型权重存盘,没有再继续运行。

    纯粹的单模态对话实验。

    没有任何多模态交互。

    肖宿把这篇文章的关键参数保存下来,继续往下翻。

    第二篇来自国内一家人工智能公司在数字人方向的商业部署报告,标题是“基于多模态数据融合的实时数字人系统”。

    他们集成了目标个体的语音录音、视频采访素材和公开演讲文本,训练了一个能够实时语音对话、同步驱动三维面部动画的数字人。

    系统在单次发布会演示中效果惊艳,数字人的声音、口音、微表情与本人高度相似,在缺省话题范围内的对答流畅自然。

    但报告的技术附录里写得很克制,系统的长期人格一致性尚未经过充分测试,跨话题的开放域对话能力受限于训练数据的覆盖范围,且整个系统依赖高质量的结构化数据输入,对于普通个体常见的碎
本章未完,请点击下一页继续阅读>>

『加入书签,方便阅读』

上一章 目录 下一页