模型框架
-
Stability AI 发布Stable Diffusion 3.5 Medium 模型,免费开放商用
高性能与普及性完美平衡,免费开放商用,人人可用的AI绘画工具。 Stable Diffusion 3.5 Medium 是由 Stability AI 发布的最新 AI 图像生成模型,旨在为用户提供更高质量和更灵活的图像生成体验。该模型于2023年10月29日正式发布,具备25亿参数,采用了改进的MMDiT-X架构,能够在消费级硬件上快速运行,支持生成分辨率从0.25百万到2百…
-
输入视频就能构建出还原服装细节的3D模型-DressRecon
DressRecon 通过结合图像基础的先验知识,捕捉衣物的细微几何特征,生成高保真的三维模型。这个模型不仅细致,而且可以从任意角度进行渲染,让最终的可视化体验更加真实生动。这项技术为服装设计、虚拟试穿等领域提供了强大的技术支持,也让 3D 模型构建进入了新的高度。 项目地址: https://jefftan969.github.io/dressrecon
-
字节跳动发布 GR-2 机器人 AI 大模型:任务平均完成率 97.7%,模拟人类学习处理复杂任务
项目地址: https://gr2-manipulation.github.io
-
超高清视频生成模型Pyramid-Flow
Pyramid-Flow是一款超高清视频生成模型,由快手、北京大学和北京邮电大学研究团队联合开源。该模型能够生成10秒、1280×768分辨率、24帧的视频,质量出色。 项目地址: https://pyramid-flow.github.io
-
OpenAI 发布了新的模型 o1 的预览版,也就是传闻中新模型草莓 strawberry,API 的价格和 GPT-4 的价格差不多
全文总结2024 年 9 月 12 日,OpenAI 推出新系列推理模型 OpenAI o1。该系列模型在回复前会花更多时间思考,能解决科学、编码和数学等领域的复杂问题。9 月 12 日在 ChatGPT 和 API 中发布了该系列的第一个模型,这是预览版,后续会有更新和改进,还包括了下一次更新的评估。新模型的工作原理是像人一样在回答问题前进行更多思考,通过训练学会改进思维过程…
-
一款开源多模态大型语言模型Mini-Omni,具有实时语音处理能力和边思考边说话的独特能力
Mini-Omni是一款开源多模态大型语言模型,具有实时语音处理能力和边思考边说话的独特能力,为用户带来自然交互体验。它支持多种输入模态,包括语音和文本,展现出全面的实力和强大的潜力。Mini-Omni的 Any Model Can Talk 功能使得其他AI模型能够集成其实时语音能力,扩展了AI应用的可能性。 项目地址: https://github.com/gpt-omni…
-
Qwen2-Math 开源 AI 模型发布,基于 Qwen2 LLM 构建、专门用于数学解题的语言模型
全文总结这段文本主要介绍了多个数学问题及相应的求解过程,包括关于 Qwen2–Math 系列模型在数学推理能力方面的表现和评估,以及一系列不同类型的数学函数问题的求解。重要亮点 求解方法与思路:在解决问题时,通常先进行条件分析和代入特定值,然后探索规律、假设函数形式并进行验证,以得出最终结论。 Qwen2-Math 模型介绍:Qwen2-Math 是基于 Qwen2…
-
Meta的Llama 3.1正式发布,包含8B、70B、405B 三个型号
Meta 致力于开放可访问的 AI,发布了 Llama 3.1 405B 等一系列模型,并在模型架构、训练优化、功能改进、安全措施、开放生态等方面取得了重要进展。 重要亮点
-
Hugging Face 推出“”小语言 Python 编程模型
Hugging Face 公布了“SmolLM”小语言模型家族,其中包含 1.35 亿、3.6 亿及 17 亿参数模型 地址: https://huggingface.co/blog/smollm
-
GPT-3.5退役,GPT-4o mini来了,成本骤降
OpenAI突发新模型,全面取代老去的GPT-3.5。 GPT-4o mini,能力接近原版GPT-4,价格却要便宜一个数量级: 对应的API也已经开放,支持128k输入tokens(图像和文本),更令人瞩目的是支持16k输出tokens。 相比之下,隔壁Claude3.5Sonnet几天前刚刚升级8k输出tokens。 以其低成本和低延迟特性,官方推荐用于多种场景: 原文:h…
