
欢迎来到今天的AI日报!这里是你每天探索人工智能世界的指南,聚焦AI领域的热点内容,助你洞悉技术趋势、了解创新AI产品应用。
1、MiniMax发布通用全模态模型H3
MiniMax刚刚发布了通用全模态模型H3,这是一个能同时理解和生成文本、图像、视频、音频的全能选手。
亮点包括:
- 支持原生双声道音视频输出,最高可生成15秒2K分辨率内容
- 引入Contextual Omni Representation技术,让自然语言成为连接各类模态的通用桥梁
- 在设计初期就考虑了多款国产芯片的兼容性
更重磅的是,MiniMax宣布将在符合相关法律法规的前提下开源H3模型权重,这将进一步降低国内企业在多模态AI应用上的技术门槛。
2、字节跳动Seedance 2.5发布:AI视频开始会讲故事了
字节跳动的Seedance 2.5视频生成模型来了,这次直接把单次视频生成时长拉到了30秒。
不只是时长增加,Seedance 2.5还具备:
- 长叙事能力,支持多镜头叙事和逻辑关联的镜头组织
- 多轮延长能力,保持人物主体、场景、画面风格及音效一致性
- 支持输入最多30张图片、10段视频和音频,精准还原多人形象与声音
AI视频终于从片段进化到故事了。
3、DeepSeek-V4-Flash正式版上线
DeepSeek-V4-Flash正式版API公测上线,激活参数仅130亿,但性能逼近旗舰模型V4-Pro。
关键特性:
- 成本优势显著,特别适合Agent场景应用
- 自研Agent框架DeepSeek Harness首次亮相
- 支持OpenAI的Responses API格式,便于开发者迁移应用
4、DeepMind发布Gemini Robotics ER 2
DeepMind发布了新一代具身推理模型Gemini Robotics ER2,首次实现了多机器人协同作业。
该模型在实时决策和持续任务监控方面取得重大突破,标志着具身智能向规模化商用迈出了坚实一步。
5、谷歌将Nano Banana2集成至Google Earth
谷歌把最新的Nano Banana2 AI图像生成模型塞进了Google Earth,现在用户可以通过输入场景描述生成高精度自定义图像。
应用场景包括教育、城市规划、建筑设计等,生成式AI进一步融入数字地图和空间计算平台。
6、华为开源5050亿参数openPangu-2.0-Pro模型
华为正式开源盘古AI模型品牌openPangu旗下openPangu-2.0-Pro大模型,同步开放模型权重、基础推理代码及技术报告。
核心参数:
- 总参数规模约505B(5050亿)
- 支持512K上下文长度
- 训练数据规模约34T Tokens
进一步推进昇腾AI生态建设。
7、阿里千问发布Qwen-Audio-3.0-ASR-Flash
阿里千问发布Qwen-Audio-3.0-ASR-Flash,语音识别攻克专业场景最后一公里。
五大升级:
- 长音频上下文记忆,几小时会议中的人名、技术概念全程保持一致
- 内置多行业词库,医疗场景专业词召回率达95.36%
- 分级热词定制
- 集成语音润色
- 一套模型覆盖30余种语言
8、特斯拉中国车机正式接入豆包大模型
特斯拉中国推送2026.14.13版本车机软件更新,引入了豆包大模型,提升智能交互体验。
不过需要注意,该功能需要用户开通高级车载娱乐服务才能使用。
本文地址:https://www.163264.com/14549


微信扫一扫,鼓励一下~