首页 > 事业单位公告 > 单位福利 > 谷歌对垒OpenAI,谁更胜一筹?

谷歌对垒OpenAI,谁更胜一筹?

发布时间:2024-05-17 23:13:19来源: 152102

中国战略新兴产业融媒体记者 艾丽格玛

当地时间5月14日,谷歌在2024 Google I/O大会上展示了其在AI技术上的一系列突破。就在一天前,OpenAI发布的GPT-4o已经引发了一波热议,而发布时间仅差一天的两个技术产品被视为是这两家科技企业在AI领域真刀明枪的激烈对垒。

谷歌和OpenAI的发布会,不约而同地强调了AI与现实世界的真正交互——例如用摄像头感知环境、识别内容和互动。不过,在产品功能重点方面,两家公司各有千秋。

那么,最新的AI大模型到底能做到什么程度?它们能带来生产力的质变,还是仅仅停留在概念性的炒作?

01

各有侧重的阶段性更新

当地时间5月13日,OpenAI通过直播展示了产品更新。

这次,OpenAI并未推出搜索引擎,也未推出GPT-4.5或GPT-5,而是发布了GPT-4系列新模型GPT-4o以及AI聊天机器人ChatGPT的桌面版本。这可以看作是对GPT-4的一次阶段性更新,而根据OpenAI官方网站介绍,GPT-4o中的“o”代表Omni,也就是“全能”的意思。

据介绍,GPT-4o文本、推理、编码能力达到GPT-4 Turbo水平,速度是上一代AI大模型GPT-4 Turbo的两倍,但成本仅为GPT-4 Turbo的一半,视频、音频功能得到改善。OpenAI公司CEO山姆·奥尔特曼在博客中表示,ChatGPT免费用户也能用上新发布的GPT-4o。此外,OpenAI还与苹果走到一起,推出了适用于macOS的桌面级应用。

OpenAI技术负责人Mira Murati在直播中表示:“这是我们第一次在易用性方面真正迈出的一大步。”

OpenAI将GPT-4o定位为GPT-4性能级别的模型。据介绍,GPT-4o在传统基准测试中,文本、推理、编码能力达到GPT-4 Turbo的水平。该模型接收文本、音频和图像输入时,平均320毫秒响应音频输入,与人类对话中的响应时间相似,英文文本和代码能力与GPT-4 Turbo相当,在非英文文本上有改善,提高了ChatGPT针对50种不同语言的质量和速度,并通过OpenAI的API提供给开发人员,使其即时就可以开始使用新模型构建应用程序。

与之形成对比的是,谷歌终于将自己在搜索领域的强项融入了AI产品:比如“Ask with video”,利用Gemini的多模态能力与Google Lens相结合,可以实现视频搜索——录制一段视频,就能知道用户使用唱片机,甚至维修照相机;Google Photos中还推出了新的AI功能“Ask Photos”,可以通过简单的提问在大量照片中找出“孩子多年来学习游泳的历程”。

谷歌版 AI 搜索的输出结果不再是网址的罗列,而是一个全新的整合页面——它更像一份针对用户提问而形成的报告,不仅包括对问题本身的回答,也包括对用户可能忽略问题的猜测和补充。

在大会上,谷歌搜索部门负责人Liz Reid表示,“生成式AI搜索将为你做的比你想象更多。不管你脑子里在想什么,或者你需要做什么,只要问,谷歌就会为你搜索。”她解释说,AI概述在收到一个一般查询后会提供一系列潜在答案,并链接到更深入的内容。它还能通过在搜索中使用“多重推理”在几秒钟内回答更复杂的问题和子问题。

谷歌同样展示了现实交互功能,其一款名为Project Astra的多模式AI助手,可以观看并理解通过设备摄像头看到的内容,记住用户的东西在哪里,帮用户在现实世界搜索物品,或是完成其他任务。

但是,相比于OpenAI简单直接的视频说明,谷歌在现场演示的AI工具却遭遇“翻车”。

开场时,一位从舞台上的茶杯中钻出的DJ,在台上使用谷歌内部开发的一款AI DJ小工具 MusicFX DJ,在舞台上现场用随机生成的关键词,来创造出一首曲目——很可惜,创造出的曲调有点糟糕。

不过,相比于2023年在演示Gemini后的“群嘲”,今年谷歌DeepMind推出的Project Astra使用视频显得更加可信:操作者以智能手机为媒介,让大模型实时收集环境中的各种信息,并在围绕着办公室转了一圈后突然提问:“你记得眼镜在哪里吗?”AI从环境信息中捕捉到了眼镜的位置,并给出了正确的方位提示。

02

多模态成为重点

在直播中,OpenAI演示了一段员工与GPT-4o对话的视频,模型反应速度与人类相近,GPT-4o可利用手机摄像头描述其“看到”的东西。另一段展示视频里,GPT-4o被装在两个手机上,其中一个代表人类与电信公司打电话沟通设备更换事项,另一个GPT-4o扮演电信公司客服人员。OpenAI还展示了GPT-4o搭载在手机上的实时翻译能力。

GPT-4o的发布,标志着OpenAI在多模态AI领域的重大突破。这款新模型不仅能够实时对音频、视觉和文本进行推理,还能够生成文本、音频和图像的任意组合输出,大大提升了与人类的交互体验。GPT-4o的响应速度极快,音频输入的平均响应时间仅为320毫秒,与人类对话中的自然反应时间相当。此外,GPT-4o在多语言处理、视觉和音频理解方面的能力也有显著提升,创下了多项新的行业纪录。

根据OpenAI介绍,GPT-4o与GPT-3.5、GPT-4的语音对谈机制不同。GPT-3.5和GPT-4会先将音频转换为文本,再接收文本生成文本,最后将文本转换为音频,经历这三个过程,音频中的情感表达等信息会被折损,而GPT-4o是跨文本、视觉和音频的端到端模型,是OpenAI第一个综合了这些维度的模型,可更好进行对谈。

而如前所述,谷歌本次发布的AI Overview,也在多模态的问题上做足了文章。

那么,“多模态”到底是什么?

多模式深度学习,是一个机器学习的子领域,旨在训练人工智能模型来处理和发现不同类型数据——也就是模式之间的关系,通常是图像、视频、音频和文本。通过结合不同的模态,深度学习模型可以更普遍地理解其环境,因为某些线索仅存在于某些模态中。

例如一个能够识别人类面部情绪的任务,它不仅需要AI看一张人脸(视觉模态),还需要关注人声音(音频模态)的音调和音高,这些内容编码了大量关于他们情绪状态的信息,这些信息可能无法通过他们的面部表情看到,即使他们经常是同步的。

在多模态深度学习中,最典型的模态是视觉(图像、视频)、文本和听觉(语音、声音、音乐)。其他不太典型的模式包括3D视觉数据、深度传感器数据和LiDAR 数据,这是在自动驾驶汽车中经常用到的典型数据。

此外,在临床实践中,成像方式包括计算机断层扫描(CT)扫描和X射线图像,而非图像方式包括脑电图(EEG)数据。传感器数据,如热数据或来自眼动追踪设备的数据也可以包含在列表中。

多模态神经网络通常是多个单模态神经网络的组合。例如,视听模型可能由两个单峰网络组成,一个用于视觉数据,一个用于音频数据。这些单峰神经网络通常分别处理它们的输入。这个过程称为编码。在进行单峰编码之后,必须将从每个模型中提取的信息融合在一起。已经提出了多种融合技术,范围从简单的连接到注意机制。多模态数据融合过程是最重要的成功因素之一。融合发生后,最终的“决策”网络接受融合后的编码信息,并接受最终任务的训练。

可以看出,要想让停留在“画画写字唱歌”程度的AI们真正与现实世界产生交互并影响生产过程,多模态研发是必经之路。

单位福利更多>>

别克昂科威家族5月销量14109辆,昂科威Plus连续8个月同比翻番 为何说买高品质纯电SUV,一定要看广汽本田P7?看完就懂了! 定位硬派越野SUV!全新丰田FJ 酷路泽专利图曝光! 吉利银河A7官图发布,搭1.5升插混,家轿市场迎来“新卷王”? 小鹏G7将搭载华为XHUD?6月新车还有哪些看点? 儿子变成爹?丰田自动织机称正讨论丰田汽车收购要约 外部质疑看衰声音对销量影响逐年增加?蔚来内部构建横向组织“车型产品线” 蔚来汽车 2025 年 Q1 营收 120.35 亿元同比增长 21.39%,新车交付 4.21 万台同比增长超 40% 蔚来2025年第一季度营收超120亿元 数字供销赋能时堰模式 “一键”开启夏收“加速度”! 无需太贵!618重点考虑16GB+512GB手机,4款都不超2500元,性价比超高 世名科技与TCL成立合资公司,主营显示光刻胶色浆业务 “奥迪+华为第一车”开启预售,传统豪华品牌反向拥抱中国技术 2025粤港澳车展重磅新车盘点:华为系崛起,百万国产豪车成真! 上汽自营船队“安吉安盛” 轮开启欧洲首航 蔚来世界模型NWM首个版本正式推送:四大场景升级 更安全 不起火、不爆炸 比亚迪动力电池通过新国标认证 AI感知与行动:这家福布斯上榜企业发布空间智能世界模型,让AI走进物理世界 东风汽车:东风纳米06在武汉上市 配备2颗Orin-X芯片不到13万元!小鹏MONA M03 Max版“上市交付” 欲以智能辅助驾驶对抗比亚迪? 高管现场喝“皮子水”!悦意07上市背后,一汽奔腾的“背水一战” 智能辅助媲美别家50万旗舰 小鹏MONA M03 Max上市:12.98万起 零百5.3秒,续航530公里,极速补能,领克Z20深度体验 长安汽车董事长朱华荣:预计不超2年,汽车行业竞争将回归良性 N7大定锁单破万,东风日产新能源转型告捷 家庭出行必备!埃安UT实测续航1:1,高速带娃不焦虑,某愿够用吗? 亲民价邂逅尖端科技!五菱星光25款EV蓄势待发,重塑出行性价比标杆 比亚迪:进军两轮市场,32款新品齐发,长寿命,使用成本比铅酸低 理性的选择 任性的权力 凯迪拉克XT4上市 腾势N9:10000辆里程碑下的悬浮美学与科技革新!