Back to Home
RadarAI··Papers & Tech

#569. 深入 xAI:三个月打造 Grok Imagine、视频生成与世界模型之争,以及视频智能体

中文摘要

前xAI研究员Ethan He复盘Grok Imagine开发历程。他认为视觉智能源于语言模型,世界模型是实时可交互长视频,并展望视频智能体未来。

English Summary

Former xAI researcher Ethan He reviews building Grok Imagine in 3 months. He posits visual AI from language models, world models as interactive long videos, and envisions Video Agents' future.

Original Excerpt

📌 一句话摘要 前 xAI 研究员 Ethan He 深度复盘从零打造 Grok Imagine 的历程,提出“视觉智能源自语言模型”、“世界模型即实时可交互的长视频”等核心判断,并展望了 Video Agent 的未来。 📝 详细摘要 本期节目是一场关于 AI 视频生成技术的高密度深度访谈。嘉宾 Ethan He 曾就职于 Nvidia 和 xAI,他详细复盘了 xAI 如何在基础设施、数据、模型“三无”的情况下,凭...