AI日报:MiniMax发布全模态模型H3,DeepSeek-V4-Flash正式版上线

AI日报配图
AI日报配图

MiniMax刚刚发布了通用全模态模型H3,这个模型牛的地方在于它能同时处理文本、图像、视频和音频,实现了统一理解与生成。这意味着你不用再切换不同工具,一个模型搞定所有模态。

H3在广告、电商、游戏这些商业场景里已经能稳定输出,支持原生双声道音视频,最高能生成15秒2K分辨率的内容。更关键的是,MiniMax还打算开源这个模型,这对国内AI生态是个大利好。

字节跳动的Seedance 2.5也来了,视频生成时长直接拉到30秒,支持多镜头叙事。以前AI视频就几秒,现在能讲完整故事了,还能保持人物和场景的一致性。

DeepSeek-V4-Flash正式版也上线了,激活参数只有130亿,但性能逼近旗舰模型。它支持OpenAI的API格式,开发者迁移起来很方便。DeepSeek还推出了自研的Agent框架,看来要在智能体赛道发力了。

另外几条值得关注的:

  • DeepMind发布Gemini Robotics ER 2,首次实现多机器人协同作业
  • 华为开源了5050亿参数的openPangu-2.0-Pro模型
  • 阿里千问的语音识别模型Qwen-Audio-3.0-ASR-Flash在医疗场景专业词召回率达到95.36%
  • 特斯拉中国车机正式接入豆包大模型

今天的AI圈,多模态和Agent是两大主线,各家公司都在抢入口。

本文地址:https://www.163264.com/14541

(0)
上一篇 6小时前
字节跳动ToB大调整:飞书并入豆包,争夺AI办公入口
下一篇 2小时前

相关推荐