AI日报:京东开源实时视频编辑模型,Qwen-Image-3.0正式上线

AI日报

欢迎来到今天的AI日报!今天AI圈又发生了不少大事,从视频编辑到图像生成,从语音识别到多模态交互,各家都在秀肌肉。来,一起看看。

京东开源JoyAI-Video-Edit:边看边改,30帧秒级推理

京东今天开源了自家研发的实时流式视频编辑模型 JoyAI-Video-Edit。这玩意儿最牛的地方在于——它能边播放边修改,720P分辨率下能做到每秒30帧的推理速度。

以前改视频得等渲染,现在看着画面直接调,体验接近实时。更狠的是,它还能用来合成机器人训练数据,给具身智能领域提供了新思路。

阿里Qwen-Image-3.0上线:0.18元/张,国内文生图第一

阿里巴巴的千问图像生成模型 Qwen-Image-3.0 今天全量开放了,API定价0.18元/张起。

这模型支持4.5k token的超长文本理解,能处理复杂的多轮指令。风格覆盖100+种,支持12国语言原生渲染。在文生图榜单里排国内第一,商业化工作流可以直接上了。

腾讯混元Hy ASR 3.0:语音识别开始”听懂”语境

腾讯混元发布了 Hy ASR 3.0 preview,这次不是简单的语音转文字,而是把语音识别和语义理解深度融合

多语言词错误率显著降低,专业场景支持热词注入。简单说,它不再逐字硬转,而是结合上下文理解你在说什么。做字幕、会议纪要的朋友应该会很开心。

字节SeedRealtime上车豆包:音视频全双工,不再卡拍

字节Seed团队推出了 SeedRealtime,一个原生融合音视频+文本的全双工大模型,已经在豆包App上线。

跟传统级联方案比,端到端架构解决了说话节奏对不齐的问题,交互更自然。它还能在对话中主动提醒、自然停顿,分寸感拿捏得不错。

马斯克放话:Grok 4.6下周来,SpaceX数据全灌入

马斯克在SpaceX首次财报电话会上透露,Grok 4.6下周发布,4.7随后几周跟上。

更重磅的是,SpaceX的全部历史数据将用于Grok训练——这意味着下一代Grok将拥有大量私有航天数据,而不是只靠公开语料。xAI的护城河正在形成。

影石Insta360 × 阿里千问:Go Ultra装上语音助手Kira

影石Insta360把AI语音助手 Kira 装进了Go Ultra口袋相机,底层用的是阿里千问多模态模型。

支持声纹识别和云端问答,不同地区还会切换不同大模型确保翻译准确。硬件+大模型的结合越来越紧密了。

Mistral Shieldstral:3B小模型,单卡16GB跑多模态审核

Mistral发布了内容审核模型 Shieldstral,30亿参数,Apache 2.0开源,支持12种语言。

特点是把审核政策写入输入,灵活适配不同场景。提示词分类、回答审核、毒性检测、多模态内容审核都能做,号称开源SOTA。

宇树科技冲刺科创板:发行价预估超百元

人形机器人独角兽宇树科技今天开启科创板IPO询价,预计募资42亿元,发行价约104元/股。

作为”A股人形机器人第一股”,这标志着具身智能产业链的资本化进程正在全面提速。机器人赛道,真的要起飞了。

以上就是今天的AI日报。技术迭代越来越快,每天都有新东西冒出来。保持关注,明天见。

本文地址:https://www.163264.com/14692

(0)
上一篇 1天前
AI创作泛滥的时代,”人味儿”才是真正的护城河
下一篇 19小时前

相关推荐