开源项目

  • 可将动态涂鸦融入视频中的编辑技术VideoDoodles

    可将动态涂鸦融入视频中的编辑技术VideoDoodles https://em-yu.github.io/research/videodoodles/ 这项技术能够在视频中的物体上添加动态涂鸦,并且涂鸦能够随着物体的移动而移动,并以适当的透视和遮挡进行表达。使用这项技术可以轻松地创造出独特而令人印象深刻的视频,而无需专业技能或大量时间。 来源:https://mp.weixin…

    2024年7月12日
  • 阿里通义音频生成大模型 FunAudioLLM

    该项目包括两个核心模型: SenseVoice和CosyVoice,分别致力于语音生成和语音识别。FunAudioLLM支持多种人机交互应用场景,如多语言翻译、情绪语音对话、互动播客和有声读物等。 地址: https://fun-audio-llm.github.io 在线体验地址: https://www.modelscope.cn/studios/iic/CosyVoice…

    2024年7月9日
  • 快手文生图大模型“可图”宣布开源,现已上线微信小程序和网页版

    快手“可图”大模型于今年 5 月对外开放,目前已经上线网页版和微信小程序,支持文生图和图生图两类功能,可用于 AI 创作图像以及 AI 形象定制。 在 AI 创作模块,用户只需输入描述文字并选择期望的画作风格,即可快速获取专属的 AI 画作。其中,画作风格可以选择默认、皮克斯、卡通盲盒、新海诚、动漫 3D、怀旧动漫、电子游戏、水彩插画、莫奈油画、高清写实等。 此外,用户还可以上…

    2024年7月6日
  • 一款使用AI来解析PDF的开源工具:gptpdf

    1、使用 PyMuPDF 库,对 PDF 进行解析出所有非文本区域,并做好标记 2、使用视觉大语言模型(如 GPT-4o)将 PDF 解析为 markdown。 我们的方法非常简单(只有293行代码),但几乎可以完美地解析排版、数学公式、表格、图片、图表等。 每页平均价格:0.013 美元 项目地址: https://github.com/CosmosShadow/gptpdf

    2024年7月3日
  • 微软在官网开源了基于图的RAG(检索增强生成)——GraphRAG

    微软在官网开源了基于图的RAG(检索增强生成)——GraphRAG,通过构建知识图谱来增强大模型的搜索、问答、摘要、推理等能力。Graph RAG的核心是通过两阶段构建基于图谱的文本索引,帮助大模型更好地捕捉文本中的复杂联系和交互。该方法在处理大规模数据集时表现出色,提升了信息检索和生成的协同工作,适用于处理复杂问题和解读PDF、Word等文档。 项目地址: https://g…

    2024年7月3日
  • 完美支持中英日语言的开源TTS模型来了:Fish Speech

    Fish Speech是一个开源的TTS模型,支持中英日语言,语音处理接近人类水平。模型使用约十五万小时的三语数据训练,对中文支持非常完美。 项目地址: https://github.com/fishaudio/fish-speech 体验地址: https://fish.audio/zh-CN/text-to-speech 这是邓紫棋的声音:

    2024年7月3日
  • 腾讯发布了一个根据图片生成跳舞视频的项目MimicMotion

    该研究提出了一种名为MimicMotion的可控视频生成框架,可以生成任意长度的高质量视频,并具有自信的姿势引导。该方法结合了图像到视频扩散模型和新颖的自信姿势引导,通过这种方式,视频的生成质量和流畅度得到了显著提高。研究表明,MimicMotion在多个方面都比以往方法有显著改进,是视频生成领域的重要进展。 项目地址: https://tencent.github.io/Mi…

    2024年7月2日
  • Dify-FeiShu-bot:可以非常方便的支持利用Dify接入飞书搭建飞书机器人

    Dify-FeiShu-bot是一个使用python FastAPI框架编写的后端,可以非常方便的支持利用Dify接入飞书搭建飞书机器人,并且充分利用飞书消息卡片,可以搭建出漂亮的UI界面。 项目特点: 项目地址: https://github.com/Mr-KID-github/Dify-FeiShu-bot

    2024年6月29日
  • Google 开源了 Gemma 2 的 9B 和 27B 版本,同时Gemini 1.5 Pro 上 200 万 Token 上下文向所有开发者开放

    Google 开源了 Gemma 2 的 9B 和 27B 版本,同时Gemini 1.5 Pro 上 200 万 Token 上下文向所有开发者开放Google 开源了 Gemma 2 的 9B 和 27B 版本,同时Gemini 1.5 Pro 上 200 万 Token 上下文向所有开发者开放Google 开源了 Gemma 2 的 9B 和 27B 版本,同时Gemini 1.5 Pro 上 200 万 Token 上下文向所有开发者开放Google 开源了 Gemma 2 的 9B 和 27B 版本,同时Gemini 1.5 Pro 上 200 万 Token 上下文向所有开发者开放

    Gemma 2是一款高性能的AI模型,具有出色的推断效率和成本效益。通过优化的架构设计,Gemma 2在27B参数规模下表现出色,提供了与两倍大小的模型竞争力相当的性能。而9B参数规模的Gemma 2模型在其类别中也表现卓越,超越了其他同规模的开源模型。 Gemma 2的推断效率和成本节约优势显著,27B模型设计能够在单个Google Cloud TPU主机、NVIDIA A1…

    2024年6月28日 开源项目
  • 图片高清修复模型AuraSR开源,可放大4倍并补充细节

    AuraSR 是基于 GAN 的 Super-Resolution 模型,通过图像条件化增强技术,提升生成图像的质量。该模型采用 GigaGAN 论文的变体实现,并使用 Torch 框架。AuraSR 的优势在于能够有效提高图像的分辨率和质量,适用于图像处理领域。 这里可以在线体验: https://fal.ai/models/fal-ai/aura-sr/playground…

    2024年6月27日