智象未来发布首款视频生成模型HD-V1

       9月15日,合肥人工智能企业智象未来正式发布首个原生全模态视频生成模型HiDream-O1-Video-1.0(简称HD-V1)。该模型支持文本、图片、视频等多种模态输入,可一键生成5至20秒1080P视频,并在意图理解、物理规律理解、叙事规划和音画一体化生成等方面实现升级。



  发布同期,HD-V1在两项国际第三方评测榜单中进入全球前列。其中,在Artificial Analysis Image to Video Leaderboard(With Audio)榜单中位列全球第四,在Arena.ai Image-to-Video榜单中排名第八。


  相比单纯追求画质提升,HD-V1进一步强化了对用户意图和真实世界物理规律的理解。面对口语化、碎片化的用户指令,模型能够对镜头、场景、人物动作、运镜、台词和声音等内容进行自主规划,并根据事件发展逻辑和动作周期,自主决定5至20秒的视频生成时长。


  在物理规律理解方面,HD-V1进一步学习重力、碰撞、惯性、光影变化、空间连续性等真实世界规律,让生成画面中的物体运动和交互更加自然。同时,模型对文本、视频、音频信号进行联合建模,可同步生成画面与声音,使人物口型、环境声、物体碰撞声等与视频内容保持更好的一致性。


  智象未来CTO姚霆表示,视频生成的进一步发展,不仅在于像素提升和时长延续,更在于模型能否真正理解创作者的意图和真实世界的物理规律。HD-V1从架构设计之初便面向文本、视频与音频的统一表征,推动视频生成模型向“听得懂、表现连贯”发展。


  据了解,自今年4月发布原生全模态世界模型架构HiDream-O1以来,智象未来已陆续推出图像生成、交互式世界模型和具身世界模型等系列产品。随着此次视频模型发布,其模型矩阵进一步覆盖图像、视频、3D交互和具身动作等方向。“我们所构建的是一套以统一技术架构为底座、面向世界模型持续进化走向可落地的原生全模态体系。”智象未来创始人梅涛表示。


  当天,智象未来还宣布完成C+轮融资,本轮投资方为新微资本、交子资本、工银资本。


  交子资本相关负责人表示,智象未来推动图像、视频、3D交互与具身四大模型同源演进,HD-V1的发布补齐了模型矩阵的关键一环。未来将发挥国有产业资本的长期资本和资源协同作用,助力企业进一步发展,并带动相关人工智能产业生态建设。