AI日报:京东开源实时视频编辑模型,Qwen-Image-3.0正式上线,腾讯混元语音识别再升级

AI日报封面

欢迎来到今天的AI日报。今天有多条重磅消息:京东开源了能边播边改的视频编辑模型,阿里Qwen-Image-3.0正式上线,腾讯混元语音识别迎来3.0版本,还有字节、马斯克、影石、Mistral和宇树科技的新动态。一文带你快速过一遍。

京东开源JoyAI-Video-Edit:视频边播边改成为现实

京东今天开源了自研的实时流式视频编辑模型 JoyAI-Video-Edit。这个模型的核心亮点是「边看边改」——你在看视频的同时,模型就在实时处理画面。720P分辨率下能做到每秒30帧的推理速度,延迟低到可以忽略不计。

更值得关注的是,这个模型还为机器人训练数据的合成提供了一条新路径。以后机器人学习新动作,可能不需要再海量采集真实视频了,直接用JoyAI-Video-Edit生成就行。

阿里Qwen-Image-3.0上线:国内文生图第一,0.18元/张

阿里巴巴的千问图像生成模型 Qwen-Image-3.0 今天全量开放,API也同步上线。这个模型在文生图榜单里排国内第一,有几个硬指标值得关注:

  • 支持超长文本理解,最高能处理4.5k token的指令输入
  • 覆盖100多种艺术风格,12国语言原生渲染
  • Standard版定价0.18元/张,性价比不错

对于做设计、做内容的同学来说,这个定价基本可以做到「文生图自由」了。

腾讯混元Hy ASR 3.0:语音识别开始「听懂语境」

腾讯混元发布的 Hy ASR 3.0 preview 不再只是「把声音转成文字」这么简单,而是真正开始理解语境。多语言词错误率(WER)显著降低,专业场景适配也做了优化,还支持热词注入增强。

简单来说,以前的语音识别是「听到什么转什么」,现在变成了「听到什么、理解什么意思、再转出来」。对会议记录、字幕生成这些场景,体验会好很多。

字节SeedRealtime:音视频全双工大模型上车豆包

字节Seed团队推出的 SeedRealtime 是一个原生融合音视频和文本的全双工大模型,已经在豆包App上线。和传统「先听→再想→再说」的级联方案不同,SeedRealtime是端到端的,能同时处理音频、视频和文本。

实际体验上,最明显的改善是「说话节奏」——不会再出现你说完话、模型还在想、然后突然插进来的尴尬停顿。模型还会主动提醒、自然停顿,交互感更像真人。

马斯克:Grok 4.6下周发布,SpaceX数据全部灌入训练

马斯克在SpaceX首次财报电话会上放话:Grok 4.6下周登场,几周内再发4.7。更狠的是,SpaceX的全部历史数据都会灌入Grok的训练——火箭发射记录、卫星轨道数据、星舰测试参数,这些私有数据公开模型根本拿不到。

这意味着Grok在航天、工程、物理这些领域的回答质量可能会甩开其他模型一截。

影石×阿里千问:Go Ultra口袋相机装上AI语音助手

影石Insta360的Go Ultra系列口袋相机即将搭载AI语音助手 Kira。Kira结合了影石自研技术和阿里千问多模态模型,支持声纹识别和云端问答。

有意思的是,不同地区会用不同的大模型——国内用千问,海外可能换别的。这种「因地制宜」的做法挺务实,至少翻译和播报的准确性有保障。

Mistral Shieldstral:3B小模型拿下开源内容审核SOTA

Mistral AI发布了 Shieldstral,一个30亿参数的内容审核模型。亮点很直接:

  • Apache 2.0开源,单张16GB GPU就能跑
  • 支持12种语言
  • 审核政策直接写入输入,灵活度高
  • 覆盖提示词分类、回答审核、毒性检测、多模态审核

对于想做内容安全又没钱买大厂方案的团队,这个模型可能是目前最好的开源选择。

宇树科技冲击科创板:发行价预估超百元

国内人形机器人独角兽 宇树科技 正式开启科创板IPO,预计募资超40亿元,发行价可能达到104元/股。如果成功,宇树将成为「A股人形机器人第一股」,具身智能赛道的资本化进程明显在提速。


以上就是今天的AI日报。技术更新很快,但核心逻辑没变:模型越来越大、越来越快、越来越便宜,真正能用起来的场景也在变多。明天见。

本文地址:https://www.163264.com/14686

(0)
上一篇 1天前
当AI把门槛降到地板,创作者拿什么拼出”人味儿”?
下一篇 1天前

相关推荐