首富从AI浪潮开始 第374节
「团队结构显示,项目已经从模型验证阶段转向平台化和商业交付阶段。」
最终,两个文件被保存在桌面上。
《鼎盛智能体业务研究报告.docx》
《鼎盛智能体产品预测.pptx》
「任务已完成。」
「本次任务共检索一百二十七项公开资料,最终引用四十七项。其中三十九项来自鼎盛官方、政府招投标平台和被投企业公告,八项来自媒体报道。」
「研究报告共二十六页,演示文稿共十页,已保存到桌面。」
“看来汤圆的工作已经完成了。”韩路一说道,“我先声明,这是源码公司公开产品的一次基于公开资料对上市公司进行的行业调研,不构成任何投资建议,也不代表我司的观点。”
这个免责声明又引发了一阵笑声。
韩路一打开了幻灯片,快速翻动了几页。
虽然简陋,但每一页都有信息,都能正常显示。
接着他又点开了一个来源标记。
浏览器自动打开,跳转到鼎盛今年第一季度的财报原文,并自动定位到了对应段落。
“看来运气还不错,没在大家面前翻车。”韩路一笑着关掉文件。
台下马上有人喊道:“韩总,这叫运气吗?”
又有人跟着起哄:“再来一个!”
“别,别。”韩路一笑着摆了摆手,“再演示下去,发布会要变成现场办公了,到时候我的员工发现,原来老板的活儿全是AI在干——那我可就麻烦了。”
这次的笑声反而不如上次热烈。
可能大家真的感受到工作不保的恐惧了。
等声音过去,韩路一转过身,看向大屏幕上刚才的执行记录。
“大家刚才看到的,是汤圆Chat桌面端的一次完整任务。”
“用户只需要描述目标,汤圆会自己制定计划,搜索资料,使用工具,处理文件,最后交付结果。”
“在执行过程中,用户可以随时查看进度,也可以修改计划、暂停任务,或者自己接管电脑。”
韩路一又转过来,面对台下的观众和摄像头。
“我们当然可以让它跑得更快,也可以把中间的过程全部藏起来,只给用户看最终结果。”
他顿了顿,才说道。
“但我们没有这么做。”
然后韩路一按下控制器,大屏幕上电脑的投影被切回原本的幻灯片。
现在上面写着四个词。
可查看、可接管、可纠正、可回溯。
“我想大家都听说过一句话:能力越大,责任越大。”
“如果一个AI只能聊天,那么它能造成的危害可能是有限的。”韩路一说着指了指旁边的电脑,“但是当一个AI可以操作电脑、发送邮件、支付费用,那么每一步操作都必须慎之又慎,在我们现在的设计中,汤圆会根据不同的任务区分不同的风险等级,读取类的操作要求的权限较低,但是如付款、发送、公开发布这些高风险操作,则需要经过用户的即时授权。”
“并且汤圆所有的行动记录对用户都是可追溯的,做过什么,经过了什么样的思考,为什么选择做出这样的行动。收集这些信息既有助于帮助用户了解自己的AI助手做过什么,也有助于我们持续对汤圆的能力进行提升。”
说到这,韩路一的表情也严肃起来。
“但我必须提前告诉大家,这是我们为了性能而不得不对隐私性进行的牺牲。源码和源智承诺不会主动阅读任何和用户隐私有关的信息,同时我们也希望用户能够注意到这点,避免把隐私和机密的信息告诉汤圆。”
韩路一的一番话让台下的不少人惊讶。
隐私问题很少在中国的发布会上被提到。
一般爱讲这件事的是苹果。
大家依然对某些互联网名人发表的那句“为了获得便利,中国人是愿意牺牲一些隐私的”而记忆犹新。
但此时此刻,韩路一却表现出了完全不同的态度。
在韩路一身后,大屏幕上的字体缓缓收拢到一起,变成了五个大字。
可信智能体。
韩路一再次开口:“这就是我们对汤圆Chat的定义。”
“——可信,是回答不能欺骗或误导用户。”
“——智能体,是结果不能只停留在回答。”
这两句话,是姜亦心在内部汇报会上说的原话,韩路一借用了过来。
因为这两句话真正道出了汤圆Chat的定位。
是它和市面上所有的聊天机器人不同的地方。
随着韩路一的话音落下,场下响起雷鸣般的掌声。
即使不是所有人都能清楚地说出什么是“智能体”的定义,所谓的智能体又和其他的AI产品有什么技术差别。
但是刚才的两个演示已经把这个差别摆到眼前了。
别的AI可以告诉你信息。
但汤圆Chat能帮你把事情办好。
但是发布会还没有结束。
韩路一按了一下控制器,幻灯片切换到了下一页。
七张榜单同时出现在屏幕上。
综合知识、复杂推理、数学能力、代码能力、长文本理解、多轮指令执行、工具使用。
汤圆排在每一张榜单的第一名。
下面列着GPT-V、Gemini、金星、坤元等国内外主流模型的成绩。
场内又响起了一片快门声。
月初的时候,汤圆0.9仓促发布,当时韩路一的幻灯片上只有分数,没有排名。
在模型能力天天在卷,基本上每个月都有新模型发布的现在,汤圆0.9能在这个榜单上稳稳地排在第一名,整整一个月,让所有业内人士都惊讶。
现在,七个第一名并排出现在大屏幕上,视觉冲击力依旧很强。
霸气外露。
韩路一没有在这些数字上停留太久。
“汤圆目前在主流公开评测中取得了不错的成绩。”
一句“不错”,让台下不少人嘴角抽了一下。
七个榜单第一。
这叫不错。
韩总,你的标准是不是有点儿太高了?
过度的谦虚就叫装逼。
“评测成绩能说明一部分模型能力,但用户平时不会拿着测试题和AI聊天。”
“很多任务没有标准答案,用户给出的要求也经常很模糊。”
韩路一切换到了下一页。
屏幕上出现了一句话。
「帮我把上次那个客户要的东西整理一下,发给他,语气别太硬。」
下面列出了模型需要理解的问题。
——“上次”指哪一次?
——“那个客户”是谁?
——“要的东西”包含哪些文件?
——“发给他”使用邮件还是其他沟通工具?
——“语气别太硬”需要修改到什么程度?
背对着大屏幕,韩路一开始说话。
“人类在说话的时候,会默认对方了解上下文。”
“传统软件要求用户把每一项都填写清楚。AI产品需要在信息不完整的情况下理解意图,主动补充必要条件,同时避免自作主张。”
屏幕上又出现了一张内部测试榜单。
复杂意图理解准确率。
汤圆,百分之八十九点三。
第二名,百分之七十九点六。
领先了接近十个百分点。
上一篇:这个导演不讲规矩
下一篇:我在中东造军火,被全球通缉?
