科技

刚和豆包视频完的我,已经开始重新认识AI了。

来源:丹巴新文网
刚和豆包视频完的我,已经开始重新认识AI了。

也许每个人在尝试与 AI 沟通时,都有类似的体验,总感觉哪里不够顺畅。

特别是当通过语音与 AI 对话时,那种差异尤为明显。

现在的 AI 语音交互,更像是在进行回合制游戏,你说话它停下,它回应你时你又得安静倾听。

无法自然地暂停或插话,AI 也无法准确区分你在对它说话,还是在和旁边的人交谈。

这种交互上的不足,让 AI 的应用局限在答题机和代码工具的特定领域。

就在上个月,OpenAI 发布了 GPT-Live,实现了边说边听的功能,获得不少关注。

但不少人觉得这算不上的什么创新,因为早在今年 4 月,豆包的语音通话模式就已经具备类似功能了。

前两天,豆包进一步升级了自己的视频通话能力,引入了原生音视频多模态全双工大模型 SeedRealtime,声称可以提高音视频理解能力,增强抗干扰和打断识别功能。

所谓的全模态全双工交互模型,核心就是解决前面提到的这些问题,打破回合制对话的限制。

听起来很有潜力,于是我们也挑选了几个实际场景进行了测试。

毕竟技术再先进,最终还是要看实用性和便捷性,以及在关键时刻能否提供有效帮助。

先从一个基础功能开始,看看新版豆包视频通话是否还停留在回合制阶段。

不得不说,新版豆包的表现确实进步明显。

以前进行视频通话时,它就像一个单线程的程序,要么在听,要么在说,无法同时处理两种任务。

但现在不同了,即使在持续讲话时,只要检测到你说话的声音,它会立即暂停对话,并根据你的新问题调整回应内容。

从测试视频中也能看出,它对人类语言的提问和断句理解更到位了。

过去可能因为短暂的停顿或中断,AI 无法判断你是否在完成一个句子,从而提前给出答案。

但现在,它基本能够准确判断对话的连贯性,交流过程更像与真人面对面交谈。

不仅如此,新版豆包的抗干扰能力也有显著提升。

以前它容易因为周围环境中的杂音而误判指令,但现在通过声纹识别技术,能够更精准地与你进行一对一对话。

还有测试显示,新版豆包的视频识别速度非常快。

比如在玩一个选择武将的小游戏时,即使我们的滑动速度很快,豆包的识别依然精准无误。

在编辑部的测试中,即使有多人同时参与对话,豆包也能轻松应对。

它能实时捕捉每个人的发言,准确区分对话对象和内容。

连同事小声的嘀咕“怎么冲刺”,都被豆包敏锐地捕捉到并标记。

接下来我们加大了测试难度,让豆包扮演装机指导的角色。

结果它仅用一眼扫视,就能掌握测试平台的安装进度。

更令人惊喜的是,豆包不仅能在安装过程中提供指导,还能在出现误操作时主动提醒。

它甚至能像人一样观察手部动作,在安装内存条时提前警示方向和力度问题。

豆包在处理这种复杂任务时展现了出色的记忆力和全程跟踪能力。

当我们以为安装显卡大功告成时,它竟然发现显卡的供电线未接。

就连最容易被忽略的主板 CPU 供电线,也没有逃过它的注意。

整个过程显示,豆包足以应对这种需要多步骤的任务。

并且,我们测试时全程开启视频

相关推荐

网友评论

登录后发表评论
暂无评论,抢沙发吧~