模型框架

  • 阿里通义音频生成大模型 FunAudioLLM

    该项目包括两个核心模型: SenseVoice和CosyVoice,分别致力于语音生成和语音识别。FunAudioLLM支持多种人机交互应用场景,如多语言翻译、情绪语音对话、互动播客和有声读物等。 地址: https://fun-audio-llm.github.io 在线体验地址: https://www.modelscope.cn/studios/iic/CosyVoice…

    2024年7月9日
  • Meta 发布名为 Meta 3D Gen(3DGen)的全新 AI 模型:1 分钟内生成高质量 3D 内容

    第一阶段 根据用户提供的文本提示,第一阶段使用 Meta 的三维资产生成模型(AssetGen)创建初始 3D 资产。该步骤生成一个带有纹理和 PBR 材质贴图的 3D mesh。推理时间约为 30 秒。 第二阶段 根据阶段 1 生成的三维资产和初始文本提示,阶段 2 将为该资产生成更高质量的纹理和 PBR 贴图。它使用 Meta 的文本到纹理生成器 Meta 3D Textu…

    2024年7月3日
  • 完美支持中英日语言的开源TTS模型来了:Fish Speech

    Fish Speech是一个开源的TTS模型,支持中英日语言,语音处理接近人类水平。模型使用约十五万小时的三语数据训练,对中文支持非常完美。 项目地址: https://github.com/fishaudio/fish-speech 体验地址: https://fish.audio/zh-CN/text-to-speech 这是邓紫棋的声音:

    2024年7月3日
  • Google 开源了 Gemma 2 的 9B 和 27B 版本,同时Gemini 1.5 Pro 上 200 万 Token 上下文向所有开发者开放

    Google 开源了 Gemma 2 的 9B 和 27B 版本,同时Gemini 1.5 Pro 上 200 万 Token 上下文向所有开发者开放Google 开源了 Gemma 2 的 9B 和 27B 版本,同时Gemini 1.5 Pro 上 200 万 Token 上下文向所有开发者开放Google 开源了 Gemma 2 的 9B 和 27B 版本,同时Gemini 1.5 Pro 上 200 万 Token 上下文向所有开发者开放Google 开源了 Gemma 2 的 9B 和 27B 版本,同时Gemini 1.5 Pro 上 200 万 Token 上下文向所有开发者开放

    Gemma 2是一款高性能的AI模型,具有出色的推断效率和成本效益。通过优化的架构设计,Gemma 2在27B参数规模下表现出色,提供了与两倍大小的模型竞争力相当的性能。而9B参数规模的Gemma 2模型在其类别中也表现卓越,超越了其他同规模的开源模型。 Gemma 2的推断效率和成本节约优势显著,27B模型设计能够在单个Google Cloud TPU主机、NVIDIA A1…

    2024年6月28日 开源项目
  • 图片高清修复模型AuraSR开源,可放大4倍并补充细节

    AuraSR 是基于 GAN 的 Super-Resolution 模型,通过图像条件化增强技术,提升生成图像的质量。该模型采用 GigaGAN 论文的变体实现,并使用 Torch 框架。AuraSR 的优势在于能够有效提高图像的分辨率和质量,适用于图像处理领域。 这里可以在线体验: https://fal.ai/models/fal-ai/aura-sr/playground…

    2024年6月27日
  • 科大讯飞正式推出了全新的讯飞星火大模型V4.0

    科大讯飞正式推出了全新的讯飞星火大模型V4.0科大讯飞正式推出了全新的讯飞星火大模型V4.0科大讯飞正式推出了全新的讯飞星火大模型V4.0科大讯飞正式推出了全新的讯飞星火大模型V4.0

    七大核心能力全新升级,全面对标GPT-4 Turbo 多模理解 上传图片素材,大模型完成识别理解,返回关于图片的准确描述 视觉问答 围绕上传图片素材,响应用户的问题,大模型完成回答 多模生成 根据用户的描述,生成符合期望的合成音频和视频 虚拟人视频 描述期望的视频内容,整合AI虚拟人,快速生成匹配视频 代码生成 智能生成单行或函数级代码建议;根据注释、函数名自动生成代码 代码解…

    2024年6月27日 模型框架
  • 斯坦福大模型评测榜 Claude 3 排名第一

    尽管Massive Multitask Language Understanding(MMLU)基准测试备受关注,但模型创建者报告的MMLU分数经常以不一致或有问题的方式产生,这阻碍了它们的可比性。为了解决这个问题,我们引入了HELM MMLU,一个排行榜,展示了评估各种语言模型在MMLU上的结果。我们的评估结果包括简单和标准化的提示,每个57个主题的准确性分解,以及所有原始提…

    2024年6月24日
  • Groq上线whisper-large-v3模型,140x speed factor,转录速度飞快

    Groq最近推出了全新的Whisper Large-V3模型,支持多种语言的语音转录和翻译功能,并提供免费开放的体验。该模型转录速度极快,用户上传视频后仅需几秒钟即可完成转录,极大提高了工作效率。Whisper API还提供了便捷的功能集成和灵活的开发方式,为用户带来更高效和准确的语音处理方案。Groq的这一创新将吸引更多用户体验,为开发者提供更多可能性,进一步提升生活质量和工…

    2024年6月21日
  • Anthropic 发布了 3.5 Sonnet——其迄今为止最智能的模型

    这是 3.5 型号系列中的第一个版本。 Sonnet 现在在关键评估方面优于竞争对手模型,其速度是 Claude 3 Opus 的两倍,而成本却是 Claude 3 Opus 的五分之一。 Anthropic AI 今天除了发布了新模型 Claude 3.5 Sonnet,还在网页版推出新的 Artifacts 新功能,简单来说是一个将输出的代码显示成网页的功能,所以可以将生成…

    2024年6月21日
  • ToonCrafter:可自动生成卡通动画的中间帧 ,并根据参考图像对动画草图自动上色

    ToonCrafter,它可以通过预训练的图像到视频扩散先验来插值两幅卡通图像。项目支持生成512×320分辨率的视频,推荐使用Anaconda安装环境并通过命令行或本地Gradio演示进行推理。需要注意的是,由于生成视频先验的多样性,成功率并不保证。 ToonCrafter 通过生成性插值方法,在卡通动画帧之间生成自然、连贯的中间帧。能够处理复杂的非线性运动和遮挡问…

    2024年5月31日