AI日报:MiniMax发布全模态模型H3;Seedance 2.5支持30秒视频;DeepSeek-V4-Flash正式上线

AI日报

欢迎来到今天的AI日报!这里是你每天探索人工智能世界的指南,聚焦AI领域的热点内容,助你洞悉技术趋势、了解创新AI产品应用。

1、MiniMax发布通用全模态模型H3

MiniMax刚刚发布了通用全模态模型H3,这是一个能同时理解和生成文本、图像、视频、音频的全能选手。

亮点包括:

  • 支持原生双声道音视频输出,最高可生成15秒2K分辨率内容
  • 引入Contextual Omni Representation技术,让自然语言成为连接各类模态的通用桥梁
  • 在设计初期就考虑了多款国产芯片的兼容性

更重磅的是,MiniMax宣布将在符合相关法律法规的前提下开源H3模型权重,这将进一步降低国内企业在多模态AI应用上的技术门槛。

2、字节跳动Seedance 2.5发布:AI视频开始会讲故事了

字节跳动的Seedance 2.5视频生成模型来了,这次直接把单次视频生成时长拉到了30秒

不只是时长增加,Seedance 2.5还具备:

  • 长叙事能力,支持多镜头叙事和逻辑关联的镜头组织
  • 多轮延长能力,保持人物主体、场景、画面风格及音效一致性
  • 支持输入最多30张图片、10段视频和音频,精准还原多人形象与声音

AI视频终于从片段进化到故事了。

3、DeepSeek-V4-Flash正式版上线

DeepSeek-V4-Flash正式版API公测上线,激活参数仅130亿,但性能逼近旗舰模型V4-Pro。

关键特性:

  • 成本优势显著,特别适合Agent场景应用
  • 自研Agent框架DeepSeek Harness首次亮相
  • 支持OpenAI的Responses API格式,便于开发者迁移应用

4、DeepMind发布Gemini Robotics ER 2

DeepMind发布了新一代具身推理模型Gemini Robotics ER2,首次实现了多机器人协同作业

该模型在实时决策和持续任务监控方面取得重大突破,标志着具身智能向规模化商用迈出了坚实一步。

5、谷歌将Nano Banana2集成至Google Earth

谷歌把最新的Nano Banana2 AI图像生成模型塞进了Google Earth,现在用户可以通过输入场景描述生成高精度自定义图像。

应用场景包括教育、城市规划、建筑设计等,生成式AI进一步融入数字地图和空间计算平台。

6、华为开源5050亿参数openPangu-2.0-Pro模型

华为正式开源盘古AI模型品牌openPangu旗下openPangu-2.0-Pro大模型,同步开放模型权重、基础推理代码及技术报告。

核心参数:

  • 总参数规模约505B(5050亿)
  • 支持512K上下文长度
  • 训练数据规模约34T Tokens

进一步推进昇腾AI生态建设。

7、阿里千问发布Qwen-Audio-3.0-ASR-Flash

阿里千问发布Qwen-Audio-3.0-ASR-Flash,语音识别攻克专业场景最后一公里。

五大升级:

  • 长音频上下文记忆,几小时会议中的人名、技术概念全程保持一致
  • 内置多行业词库,医疗场景专业词召回率达95.36%
  • 分级热词定制
  • 集成语音润色
  • 一套模型覆盖30余种语言

8、特斯拉中国车机正式接入豆包大模型

特斯拉中国推送2026.14.13版本车机软件更新,引入了豆包大模型,提升智能交互体验。

不过需要注意,该功能需要用户开通高级车载娱乐服务才能使用。

本文地址:https://www.163264.com/14549

(0)
字节跳动ToB业务大调整:飞书与豆包、火山引擎整合,争夺AI时代企业入口
上一篇 19小时前
字节ToB大调整:飞书并入豆包,争夺AI时代企业入口
下一篇 13小时前

相关推荐