
欢迎来到今天的AI日报!今天AI圈又发生了不少大事,从视频编辑到图像生成,从语音识别到多模态交互,各家都在秀肌肉。来,一起看看。
京东开源JoyAI-Video-Edit:边看边改,30帧秒级推理
京东今天开源了自家研发的实时流式视频编辑模型 JoyAI-Video-Edit。这玩意儿最牛的地方在于——它能边播放边修改,720P分辨率下能做到每秒30帧的推理速度。
以前改视频得等渲染,现在看着画面直接调,体验接近实时。更狠的是,它还能用来合成机器人训练数据,给具身智能领域提供了新思路。
阿里Qwen-Image-3.0上线:0.18元/张,国内文生图第一
阿里巴巴的千问图像生成模型 Qwen-Image-3.0 今天全量开放了,API定价0.18元/张起。
这模型支持4.5k token的超长文本理解,能处理复杂的多轮指令。风格覆盖100+种,支持12国语言原生渲染。在文生图榜单里排国内第一,商业化工作流可以直接上了。
腾讯混元Hy ASR 3.0:语音识别开始”听懂”语境
腾讯混元发布了 Hy ASR 3.0 preview,这次不是简单的语音转文字,而是把语音识别和语义理解深度融合。
多语言词错误率显著降低,专业场景支持热词注入。简单说,它不再逐字硬转,而是结合上下文理解你在说什么。做字幕、会议纪要的朋友应该会很开心。
字节SeedRealtime上车豆包:音视频全双工,不再卡拍
字节Seed团队推出了 SeedRealtime,一个原生融合音视频+文本的全双工大模型,已经在豆包App上线。
跟传统级联方案比,端到端架构解决了说话节奏对不齐的问题,交互更自然。它还能在对话中主动提醒、自然停顿,分寸感拿捏得不错。
马斯克放话:Grok 4.6下周来,SpaceX数据全灌入
马斯克在SpaceX首次财报电话会上透露,Grok 4.6下周发布,4.7随后几周跟上。
更重磅的是,SpaceX的全部历史数据将用于Grok训练——这意味着下一代Grok将拥有大量私有航天数据,而不是只靠公开语料。xAI的护城河正在形成。
影石Insta360 × 阿里千问:Go Ultra装上语音助手Kira
影石Insta360把AI语音助手 Kira 装进了Go Ultra口袋相机,底层用的是阿里千问多模态模型。
支持声纹识别和云端问答,不同地区还会切换不同大模型确保翻译准确。硬件+大模型的结合越来越紧密了。
Mistral Shieldstral:3B小模型,单卡16GB跑多模态审核
Mistral发布了内容审核模型 Shieldstral,30亿参数,Apache 2.0开源,支持12种语言。
特点是把审核政策写入输入,灵活适配不同场景。提示词分类、回答审核、毒性检测、多模态内容审核都能做,号称开源SOTA。
宇树科技冲刺科创板:发行价预估超百元
人形机器人独角兽宇树科技今天开启科创板IPO询价,预计募资42亿元,发行价约104元/股。
作为”A股人形机器人第一股”,这标志着具身智能产业链的资本化进程正在全面提速。机器人赛道,真的要起飞了。
以上就是今天的AI日报。技术迭代越来越快,每天都有新东西冒出来。保持关注,明天见。
本文地址:https://www.163264.com/14692


微信扫一扫,鼓励一下~