Grok4.6,跻身美国大模型第一阵营。
AIX财经(AIXcaijing)原创
作者 | 陈丹
编辑 | 魏佳
马斯克的目标很明确:让Grok在今年岁末完成一部《奥德赛》。
这无疑是个典型的马斯克式挑战:用AI挑战诺兰、好莱坞乃至2.5亿美元的制片投入。不过,真正让人好奇的,并非Grok能否在五个月内生成数以千计的镜头,而是它是否已具备将复杂任务全程独立完成的能力。
Grok 4.6问世,让这个问题有了清晰答案。
最新一轮的模型较量里,它已跻身美国大模型的顶尖行列:其表现力逼近OpenAI和Anthropic的旗舰产品,编程能力在部分榜单上反超对手,而API定价却显著更低。但与此同时,它在长链条Agent任务上仍存不足——虽能理解任务、构建框架、迅速启动,却总在收尾环节显得不稳。
这恰恰是大模型竞争现状的真实写照。
当能力鸿沟逐渐缩小、Token成本日益降低,决定商业成败的,已不仅是“模型有多智能”,更在于能否稳定完成任务,以及单次任务的成本控制。
对一年投入超百亿美元AI研发的马斯克而言,Grok不能只是昙花一现。它必须持续保持竞争力,并将算力、数据和渠道真正转化为营收。
01.Grok 4.6虽入榜,却未至《奥德赛》水准
诺兰的《奥德赛》公映前,马斯克就反复批评这部作品:指责选角不当,抱怨改编失真,甚至嫌诺兰为奥斯卡奖项“亵渎荷马”。电影上映后,他在X上立下豪言,要求Grok Imagine在今年底前推出一部“符合历史、忠于荷马美学”的完整版《奥德赛》。
马斯克转发的那三分钟《奥德赛》预告片确实令人眼前一亮。盔甲细节、海岸景象、人物特写都具备电影预告片的质感,但从三分钟精修短片到九十分钟长片,仍隔数千镜头与AI演员的演绎。
Grok 4.6发布之际,我们没有再测试视频生成能力,而是向它提出两道更适配语言模型的挑战。第一题,考察其解读《奥德赛》的能力。第二题,看它能否构建出将三分钟样片扩展为九十分钟长片的制片体系。
第一题,Grok的表现超出马斯克的预期。
“符合历史”与“忠于荷马”看似简单,实则极难兼顾。《奥德赛》源自数百年口述传承,青铜时代的器物、铁器时代的习俗和诗人的神话想象相互交织。可考证奥德修斯的佩剑与坐船,却无法从考古遗迹中寻觅到独眼巨人、女神与冥界。
Grok将难题分解为四个层面:青铜时代考古学、荷马史诗中的时间层叠、作品自身的诗学维度,以及诺兰的现代改编手法。
它的解决方案是:让考古研究约束器物、服装和地理元素,让荷马史诗主导人物塑造、叙事脉络与诗学风格。此外,它还纠正了一个长期流传的误解——那句描绘千帆竞发的诗句出自马洛,而非荷马。
这道题显示Grok 4.6不仅能查阅资料,更能分析具有内在矛盾的命题,并分别为其构建最有力的论证框架。
第二题考验更接近真实的制片流程。
Grok开发了一个《奥德赛》制片评估工具,将成片时长、单镜头平均时长、首轮产出率、复杂镜头比例、并发任务数、人工审核周期、预算成本和工期全部设为可调整参数。
Grok4.6生成的电影制片系统示意图
按照系统默认参数,制作一部90分钟长片需约208个工作日。Grok完成计算后自感压力巨大,随即建议一条务实方案:制作12至20分钟的荷马经典选段集。
当然,208天并非实际测算数据。首轮产出率、连续性失败率、每条镜头的生成次数都是模型预设的假设值。该工具只能证明Grok具备拆解工程需求、建立公式模型和搭建生产流程的能力,却无法验证这套流程真的能在208天内交付成果。
它同时揭示了AI电影的瓶颈所在。现在生成炫目镜头已非难事。真正的挑战在于,如何让数千镜头中的人物表情、衣饰、船只造型、环境空间和叙事逻辑保持高度统一,并有效控制废片率、重制需求和人工干预成本。








网友评论