完结 排行 记录
首页 > 都市言情 > 高二分科,我选校花也选亿万身家 >第1128章 用人工智能驯化人工智能

第1128章 用人工智能驯化人工智能(1 / 2)

上一章返回目录 加入书签 下一页
好书推荐: 妻子的秘密攻略敌国质子失败后女上司的秘密暗熟母乳的诱惑玄鉴仙族仙人消失之后她驯服的三千疯批一起重生了让仙门再次伟大问鼎:开局一等功,我权势滔天

楼天城转过头,布满血丝的眼珠子在林远身上滚了两圈。

“斯坦福回来的?刚好,来看看这个张量溢出错误。”

楼天城没有任何寒暄的打算,直接将手里那根几乎没水的黑色马克笔扔了过来。

林远接住笔,大步走到白板前。

上头的网络架构推导图画得连针都插不进去,他扫了一眼,眉头直接拧成了死结。

任少卿摘下眼镜,用力揉了揉眉心,阻止了楼天城继续施压。

“别难为新人了。人刚回国,还不清楚我们的进度。”

任少卿将终端键盘拉到自己面前,抬头看向林远。

“我们已经用几千张卡跑通了千亿参数的底座模型,但现在卡在瓶颈上了。”

林远看向屏幕:“算力不够?还是显存瓶颈?”

任少卿缓缓摇头。

“是模型会说话,但不会好好说话。”

林远愣了一下,没明白这句话的意思。

任少卿没有废话,直接在终端输入框里敲下一行字:【请帮我写一封辞职信】。

回车键按下。

屏幕上开始飞速滚动绿色的字符。

【辞职信需要注意语气委婉,以下是常见的辞职信模板。通常包含称呼、正文、离职原因和落款。如果你是软件工程师,你还可以写……】

字符不断涌出,全是关于辞职信的格式说明和注意事项。

林远盯着屏幕,眼皮一跳。

“它在续写?”林远脱口而出。

“没错。”任少卿打了个响指,声音沙哑,

“通过海量无监督语料预训练出来的TranSfOrmer模型,本质上只是一个疯狂的文字接龙机器。它根据概率预测下一个词,但它根本不知道自己需要扮演一个听从人类指令的助手。”

任少卿手指翻飞,清空屏幕,再次输入一行字:【如何制造高爆炸药】。

不到两秒钟,屏幕毫不犹豫地吐出了一长串极其专业的化学配方、合成步骤以及引爆比例。

林远头皮一炸,汗毛唰地立了起来。

这东西要是装进几千万台手机里推向公网,明天整个公司就会被反恐部门彻底查封。

“发现了吗?价值观与安全性彻底失控。”任少卿指着那行危险的代码,

“底座模型就像个读遍了天下所有禁书的书呆子,知识渊博,但毫无底线,也没有规矩。”

林远放下马克笔,面色凝重:“怎么约束它?用规则代码强行阻断敏感词?”

“那种补丁防不住千万用户的恶意诱导。”任少卿敲击白板,

“所以我们提出了一套全新的机制,叫做RLHF。”

林远脑子里飞速检索,确认自己在硅谷的顶级研讨会上从未听过这个缩写。

“基于人类反馈的强化学习。”任少卿拿起红笔,在白板上画出三个巨大的方框,

“简单来说,就是给这个口无遮拦的怪物,请一个严厉的人类老师,让它对齐人类的意图。”

任少卿在第一个方框里写下“监督微调”。

“第一步,让人类写出大量标准的高质量问答,喂给模型。这叫教它懂规矩,知道什么是提问,什么是回答。”

接着,他在第二个方框里写下“奖励模型”。

“第二步,让模型对同一个问题生成好几个不同的回答。然后让人类外包团队来给这些回答排名打分。哪个安全、哪个有用、哪个有害。我们把这些海量的打分数据收集起来,训练出一个专门当裁判的‘奖励模型’。”

红笔重重落在第三个方框上。

“第三步,大规模强化学习。我们用PPO算法让大模型不断生成回答,让奖励模型自动给它打分。分数高,就奖励;分数低,就惩罚。通过这种不断的博弈和参数更新,硬生生把人类的偏好、道德底线和安全边界,刻进大模型的神经网络里!”

林远盯着白板上的三个方框,感觉头皮一阵发麻。

用AI去训练AI,把人类复杂的道德观念和安全边界,变成可量化、可微分的数学惩罚项。

-->>(本章未完,请点击下一页继续阅读)
上一章返回目录 加入书签 下一页
新书推荐: 今夜失温美武宗直播我和徐妙云,老朱全家破防了透视神眼:看尽天下玉,揽尽世上美我想躺平当保安,女神非要来纠缠重返大学,发现美女都是大馋丫头权利的游戏,从派出所民警开始极品女神赖上我华娱87:我成了天仙的青梅随妈改嫁进豪门,小福宝被宠疯了