MiniMax H3开源驱动视频AI迈向生产力时代

时间:2026年08月07日 09:41:35 中财网
  近日MiniMax正式开放H3基础模型权重。该模型实现文本、图像、视频、音频多模态统一理解,可生成最长15秒、最高2K分辨率并带原生立体声音频的视频内容。信息显示,与传统拆分式任务不同,H3支持用户通过自然语言直接描述素材关系,在单一模型内完成主体保持、动作迁移、声音参考和内容编辑。

  
  一份研报观点认为,视频模型竞争正从单次生成转向理解完整创作意图,并深度参与广告、电商、游戏和设计等生产流程。研报指出,H3采用Contextual Omni Representation架构,通过33B参数单流Transformer联合预测视频与音频,H3-VAE高压缩率带来4倍序列长度收益,端到端训练吞吐提升近30%。在2K生成环节,模型将768p结果与原始上下文重新输入以提升文字和细节还原能力,这些技术协同使复杂多模态生成转化为低成本可规模化产品。

  
  研报认为,开放基础模型加快生态扩散。开放后24小时内,华为昇腾、摩尔线程等9家芯片厂商完成适配,超过100家开发者社区和云平台快速接入。这种“开放基础+保留高价值API服务”的策略,既扩大生态影响力,也为商业化提供清晰入口。

  
  同时近两周行业模型密集上新,OpenAI大幅下调GPT-5.6 Luna价格,Anthropic推出Claude Opus 5,国内Qwen3.8-Max和DeepSeek-V4-Flash也相继发布。研报认为,竞争已转向模型分层、全模态生成、Agent能力和单位成本的综合比拼,国产大模型进入推理效率与开源生态并重的新阶段。这将显著推动AI在工业、设计和企业服务领域的渗透,为国产算力、大模型、AI Infra以及AI+应用相关上市公司带来持续发展机遇。

  中财网
各版头条