开源项目
-
【开源推荐】PersonalAgentKit:A seed for growing your own bespoke AI a…
今天给大家推荐一个GitHub上很火的AI开源项目。 📌 项目简介 gbelinsky/PersonalAgentKit A seed for growing your own bespoke AI agent — autonomous, self-naming, and built to learn over time using Claude Code. ⭐ Stars: …
-
LangChain是什么?构建LLM应用的Python框架,AI开发者必备工具
LangChain是最流行的LLM应用开发框架,提供模块化组件连接大模型与外部数据,让开发者快速构建ChatGPT类应用,GitHub星标超9万。
-
OpenAI Whisper是什么?免费开源的语音转文字神器,支持99种语言
Whisper是OpenAI开源的自动语音识别系统,支持99种语言,能将语音/视频转为文字,准确率接近人类水平,完全免费可商用。
-
ComfyUI是什么?AI绘画工作流神器,Stable Diffusion进阶首选工具
ComfyUI是Stable Diffusion的节点式工作流界面,通过拖拽节点实现复杂AI绘画流程,被专业AI艺术家称为Photoshop of AI。
-
Ollama是什么?一键在本地运行Llama、DeepSeek等大模型的开源工具
Ollama让你无需配置复杂环境,一条命令即可在本地运行Llama、DeepSeek、Mistral等大语言模型,保护隐私且完全免费。
-
MCP 服务器是什么?Anthropic 推出的 AI 工具连接新标准详解
MCP (Model Context Protocol) 是 Anthropic 推出的开放协议,让 AI 助手能够安全连接本地文件、数据库和 API。本文详解 MCP 的功能、使用场景和上手方法。
-
OminiControl Art发布:将GPT-4o的吉卜力等艺术风格提炼至FLUX模型
几种风格选择:吉卜力工作室 伊拉苏托亚插图 《辛普森一家》 史努比 体验地址: https://huggingface.co/spaces/Yuanshi/OminiControl_Art
-
智谱开源文生图模型CogView4,中文的开源图片模型来了
主要特点:支持中英双语提示词输入,擅长理解和遵循中文提示词首个能够在画面中生成汉字的开源文生图模型支持生成任意宽高的图片以及任意长度提示词输入 后续还会开源对应的Controlnet、Comfyui支持和模型微调工具图像模型在今年终于有了一点动静了,而且这个模型在 DPG-Bench基准测试中的综合评分排名第一项目地址: https://github.com/THUDM/Cog…
-
微软发布开源OmniParser V2.0,秒变操控电脑AI智能体
微软推出的OmniParser V2.0是一个新型的解析工具,其主要功能是将用户界面(UI)截图转换为结构化数据。这一工具的目的是提升基于大型语言模型(LLM)的用户操作体验,使AI模型能够更好地理解和操作用户界面。OmniParser V2.0通过对数据集和算法进行改进,显著提高了图标识别的准确性和处理速度,从而提升了用户在操作虚拟机时的效率。 OmniParser V2.0…
-
阶跃同时开源视频生成+实时语音模型
2025年2月18日,阶跃星辰与吉利汽车集团联合开源了两款多模态大模型,其中包括全球范围内参数量最大、性能最好的开源视频生成模型阶跃Step-Video-T2V,以及行业内首款产品级开源语音交互大模型阶跃Step-Audio。 阶跃Step-Video-T2V的特点 阶跃Step-Audio的特点 项目地址: https://github.com/stepfun-ai/Step…
