
欢迎来到今天的AI日报!每天为你精选AI领域最值得关注的动态,帮你快速了解技术趋势和创新产品。
MiniMax发布通用全模态模型H3
MiniMax最近放了个大招——发布了通用全模态模型H3。这个模型牛在哪?它能同时理解并生成文本、图像、视频和音频,相当于一个”全能选手”。
以前的多模态模型大多是”专才”,有的擅长生图,有的擅长做视频,各干各的。H3则打破了这种壁垒,用自然语言作为连接各种模态的通用桥梁。这意味着你可以用文字描述,直接得到视频、音频或图像输出,流程更顺畅。
实际应用上,H3在广告制作、电商展示、游戏开发和UI设计等商业场景已经能稳定输出。它支持原生双声道音视频,最高能生成15秒2K分辨率的内容。更关键的是,MiniMax还打算在合规前提下开源H3的模型权重,这对国内AI生态来说是个好消息。
字节跳动Seedance 2.5:AI视频开始会讲故事了
字节跳动的视频生成模型Seedance升级到了2.5版本,这次最大的突破是单次生成时长提升到了30秒,而且支持多镜头叙事。
什么意思?以前的AI视频大多是单镜头”怼脸拍”,画面之间没什么逻辑关联。Seedance 2.5能组织多个镜头,让视频有起承转合,真正开始”讲故事”了。
另外它还支持多轮延长,你可以不断续写视频,同时保持人物、场景、风格和音效的一致性。输入方面也很灵活,最多支持30张图片、10段视频加音频,多人出镜和声音还原都能搞定。
DeepSeek-V4-Flash正式版上线,专攻Agent场景
DeepSeek的V4-Flash正式版开始公测了。这个模型的亮点是用130亿激活参数就做到了接近旗舰模型V4-Pro的性能,性价比极高。
对于Agent(智能体)应用来说,成本和响应速度是关键。V4-Flash在这方面优势明显,而且还自带了DeepSeek Harness Agent框架,同时兼容OpenAI的Responses API格式,开发者迁移起来很方便。
其他值得关注的消息
- 谷歌把Nano Banana2图像生成模型塞进了Google Earth,现在可以直接用文字描述生成地理场景图像,教育、城市规划等领域会很实用。
- 华为开源了5050亿参数的openPangu-2.0-Pro模型,基于昇腾NPU训练,支持512K超长上下文,代码和权重全开放。
- 阿里千问发布了Qwen-Audio-3.0-ASR-Flash语音识别模型,专攻专业场景,医疗术语召回率95.36%,支持30多种语言。
- 特斯拉中国车机系统正式接入豆包大模型,不过需要开通高级车载娱乐服务才能用。
以上就是今天的AI日报,明天见!
本文地址:https://www.163264.com/14529


微信扫一扫,鼓励一下~