
欢迎来到今天的AI日报,这里是你每天了解人工智能最新动态的窗口。今天的内容涵盖了开源大模型、视频生成、图像编辑、金融AI、智能编程、搜索升级、自动驾驶和物理AI等多个热点领域。
1、腾讯混元开源旗舰模型Hy4preview:770B参数,上下文1M
腾讯混元正式发布开源旗舰模型Hy4preview,总参数达到770B,支持1M上下文长度。这个模型定位真实生产力场景,已经在多个平台上线。
从实际表现来看,Hy4preview在软件工程、办公场景、游戏开发和科研领域都有显著进展。内部盲测数据显示,它的性能优于GLM-5.3和Kimi K3。腾讯这次选择开源策略,也反映了大模型竞争正在从单纯的参数竞赛转向实际生产力验证。
2、谷歌Gemini Omni 1.1 Flash:直出4K视频生成
谷歌发布了全新的Gemini Omni 1.1 Flash视频生成模型,在多模态视频生成领域实现了重要突破。这个模型有几个值得关注的功能:
- 场景扩展:可以在已有视频结尾无缝衔接生成后续画面,每次扩展10秒,累计最长可达40秒
- 运镜控制:通过指定起始帧和结束帧,实现平滑转场和专业运镜效果
- 参考视频:支持引入最长3秒的参考视频片段,保持画面上下文和角色一致性
模型还提供多种分辨率选项,采用阶梯式定价,降低了使用门槛。
3、Midjourney V8.2上线图像编辑模型
Midjourney V8.2带来了图像编辑模型的重大升级,让AI绘画更加精准可控:
- 指令编辑:通过文本指令直接修改已有图像
- 多图参考:单次最多融合4张图片作为参考
- 局部重绘与画布扩展:细节调整和尺寸延展更加灵活
4、蚂蚁集团×中金公司:金融增强大模型Ling-3.0-flash-Fin
蚂蚁集团和中金公司合作推出了专门针对金融场景的大模型Ling-3.0-flash-Fin。这个模型在专业金融语料训练下,投研能力显著提升,在信息检索等核心能力上表现优异。
双方还推出了FinFIRST金融搜索基准,并计划开源模型权重和提供免费API调用,推动金融AI生态发展。
5、阿里Qoder升级:从编程工具到智能体工作台
阿里发布的全新Qoder完成了从AI编程工具到智能体工作台的升级。新版本将工作对象从”代码工程”转向”智能体任务”,支持”读—改—验证—迭代”的自主闭环,具备跨文件编辑能力。
产品提供编程模式和通用模式双入口,让非技术用户也能参与开发工作。
6、谷歌搜索AI模式升级:支持300+平台机票追踪和酒店预订
谷歌的对话式搜索”AI模式”迎来重大升级,新增航班价格追踪、酒店预订辅助和积分/里程价格查看等功能,正在向全流程AI旅行代理演进。
目前支持整合300多家航空公司及旅行网站的价格和推荐方案,酒店场景可以基于用户偏好推荐附带评价的房源,并直接跳转完成支付。
7、小鹏第二代VLA大模型升级:安全能力暴增20倍
小鹏第二代VLA大模型迎来首次重大升级,核心突破是让AI真正理解时间,实现从静态3D空间到动态4D时空的跃迁。
升级亮点包括:引入Infini-VLA长时序架构提升时间理解能力;推理效率提升,实现”边看、边想、边行动”的并行处理;首次推出Master Agent,实现VLA与VLM的驾舱融合;并将Robotaxi的L4级体验下放至量产车型。
8、Anthropic推出MHS硬件标准:首次进军物理AI
Anthropic发布了模型硬件标准(MHS),标志着其首次公开进军具身智能和物理AI领域。MHS是一套统一的控制与通信标准,让AI智能体能够操控多种物理设备。
在生物医药领域,MHS已经展现出显著缩短实验开发与运行周期的能力。Anthropic这一步,把大模型竞争从对话层面延伸到了动手操作层面。
以上就是今天的AI日报。从开源大模型到视频生成,从金融AI到物理世界,AI正在加速渗透各个领域。如果你对某个话题感兴趣,欢迎在评论区讨论。
本文地址:https://www.163264.com/15343


微信扫一扫,鼓励一下~