AI日报:腾讯开源770B参数旗舰模型;Midjourney V8.2上线;谷歌Gemini Omni视频模型登场

AI日报

欢迎来到今天的AI日报,这里是你每天了解人工智能最新动态的窗口。今天的内容涵盖了开源模型、视频生成、图像编辑、金融AI、智能编程、搜索升级、自动驾驶和物理AI等多个热点领域。

1、腾讯混元开源旗舰模型Hy4preview:770B参数,上下文1M

腾讯混元正式发布开源旗舰模型Hy4preview,总参数达到770B,支持1M上下文长度。这个模型定位真实生产力场景,已经在多个平台上线。

从实际表现来看,Hy4preview在软件工程、办公场景、游戏开发和科研领域都有显著进展。内部盲测数据显示,它的性能优于GLM-5.3和Kimi K3。腾讯这次选择开源策略,也反映了大模型竞争正在从单纯的参数竞赛转向实际生产力验证。

2、谷歌Gemini Omni 1.1 Flash:直出4K视频生成

谷歌发布了全新的Gemini Omni 1.1 Flash视频生成模型,在多模态视频生成领域实现了重要突破。这个模型有几个值得关注的功能:

  • 场景扩展:可以在已有视频结尾无缝衔接生成后续画面,每次扩展10秒,累计最长可达40秒
  • 运镜控制:通过指定起始帧和结束帧,实现平滑转场和专业运镜效果
  • 参考视频:支持引入最长3秒的参考视频片段,保持画面上下文和角色一致性

模型还提供多种分辨率选项,采用阶梯式定价,降低了使用门槛。

3、Midjourney V8.2上线图像编辑模型

Midjourney V8.2带来了图像编辑模型的重大升级,让AI绘画更加精准可控:

  • 指令编辑:通过文本指令直接修改已有图像
  • 多图参考:单次最多融合4张图片作为参考
  • 局部重绘与画布扩展:细节调整和尺寸延展更加灵活

4、蚂蚁集团×中金公司:金融增强大模型Ling-3.0-flash-Fin

蚂蚁集团和中金公司合作推出了专门针对金融场景的大模型Ling-3.0-flash-Fin。这个模型在专业金融语料训练下,投研能力显著提升,在信息检索等核心能力上表现优异。

双方还推出了FinFIRST金融搜索基准,并计划开源模型权重和提供免费API调用,推动金融AI生态发展。

5、阿里Qoder升级:从编程工具到智能体工作台

阿里发布的全新Qoder完成了从AI编程工具到智能体工作台的升级。新版本将工作对象从”代码工程”转向”智能体任务”,支持”读—改—验证—迭代”的自主闭环,具备跨文件编辑能力。

产品提供编程模式和通用模式双入口,让非技术用户也能参与开发工作。

6、谷歌搜索AI模式升级:支持300+平台机票追踪和酒店预订

谷歌的对话式搜索”AI模式”迎来重大升级,新增航班价格追踪、酒店预订辅助和积分/里程价格查看等功能,正在向全流程AI旅行代理演进。

目前支持整合300多家航空公司及旅行网站的价格和推荐方案,酒店场景可以基于用户偏好推荐附带评价的房源,并直接跳转完成支付。

7、小鹏第二代VLA大模型升级:安全能力暴增20倍

小鹏第二代VLA大模型迎来首次重大升级,核心突破是让AI真正理解时间,实现从静态3D空间到动态4D时空的跃迁。

升级亮点包括:引入Infini-VLA长时序架构提升时间理解能力;推理效率提升,实现”边看、边想、边行动”的并行处理;首次推出Master Agent,实现VLA与VLM的驾舱融合;并将Robotaxi的L4级体验下放至量产车型。

8、Anthropic推出MHS硬件标准:首次进军物理AI

Anthropic发布了模型硬件标准(MHS),标志着其首次公开进军具身智能和物理AI领域。MHS是一套统一的控制与通信标准,让AI智能体能够操控多种物理设备。

在生物医药领域,MHS已经展现出显著缩短实验开发与运行周期的能力。Anthropic这一步,把大模型竞争从对话层面延伸到了动手操作层面。


以上就是今天的AI日报。从开源大模型到视频生成,从金融AI到物理世界,AI正在加速渗透各个领域。如果你对某个话题感兴趣,欢迎在评论区讨论。

本文地址:https://www.163264.com/15343

(0)
AI日报:腾讯开源770B参数Hy4preview模型;Midjourney V8.2上线图像编辑功能;谷歌Gemini Omni 1.1 Flash登场
上一篇 10小时前
下一篇 2026年4月14日 下午3:04

相关推荐