Open Generative AI:免费开源的 AI 图像与视频生成工作室,400+ 模型完整指南
2026/9/6 21:00:34 网站建设 项目流程

Open Generative AI:免费开源的 AI 图像与视频生成工作室,400+ 模型完整指南

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

商业 AI 视频平台经常拒掉你的提示词,还要你月付 10 到 120 美元。Open Generative AI 是个免费的开源 AI 图像与视频生成工作室:400+ 模型覆盖 Flux、Kling、Sora、Veo,可自托管、无内容过滤,MIT 协议。

值不值得试:先看三组对比

  • 费用:Midjourney 约 $10–$120/月、Runway 约 $12–$76/月的订阅制;这里是开源免费,无订阅费
  • 过滤:商业平台会拦截或改写提示词;这里无内容过滤、无提示词拒答
  • 数据:自托管模式下你的上传与生成记录留在本机(存于浏览器 localStorage)
对比项闭源平台Open Generative AI
费用$8–$120/月不等免费,MIT 协议
模型数单一自家模型400+,覆盖 8 大类
参考图上限有限单次最多 14 张
本地推理内置 sd.cpp 引擎,桌面版可用

5 分钟跑起来:三条路径任选其一

  • 在线版:浏览器打开官方托管地址,注册免费账号即可用全部工作室,无需装 Node.js,模型始终最新
  • 桌面应用:v1.0.9 提供 macOS(Apple Silicon / Intel)、Windows x64、Linux(AppImage / .deb)一键安装包。macOS 首次启动被 Gatekeeper 拦截属正常现象(执行一次xattr -cr即可);Windows SmartScreen 提示点"仍要运行"
  • 源码部署(需要 Node.js 18+):
git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup npm run dev

npm run setup会初始化子模块并构建 packages/ 下的 studio、workflow、agents 工作区,只跑npm install是不够的。启动后进入 http://localhost:3000,桌面版则用npm run electron:dev

用文字生成 AI 图像的最短路径

只输入文字时,图像工作室自动挂上50+ 个文本到图像模型:Flux Dev、Nano Banana 2、Seedream 5.0、Midjourney v7、GPT-4o 都在列表里。

  • Nano Banana 2:支持 1K/2K/4K 分辨率,带 Google 搜索增强,宽高比可设auto
  • Seedream 5.0(字节跳动):basic/high 两档质量、8 种宽高比、最高 4K
  • MiniMax Image 01:一次请求最多出 4 张图,提示词支持 1500 字符

界面里的宽高比、分辨率、时长选择器是动态的——切到哪个模型,就只显示那个模型支持的参数,不会选错。所有生成结果存在本地历史里,可一键下载原图。

一次带 14 张参考图:批量改图怎么做

上传 1 张参考图,界面自动切到55+ 个图像到图像模型。选中支持多参考图的模型(如 Nano Banana 2 Edit)后,上传控件会直接变成多选模式:

  • 每张图带顺序编号,按你勾选的顺序发给模型
  • 支持批量勾选文件,点Use Selected一次确认
  • 上传过的图存在本地历史,3 列网格直接复用,不用重复上传

各模型参考图上限差异较大:

模型上限
Nano Banana 2 Edit14
Nano Banana Edit / Flux Kontext Dev / Kling O1 / GPT-4o Edit / Seedream Edit v410
Vidu Q2 Reference to Image7
Flux 2 Flex/Pro Edit8
Qwen Image Edit Plus3

适用场景:把产品图 + 多张风格参考一起喂进去做风格融合,或用"旧图 + 新元素"批量改版式。

用文字生成 AI 视频:40+ 文生视频模型

没有首帧素材就直接文字生成视频,可选40+ 个文本到视频模型:Kling v3、Sora 2、Veo 3、Wan 2.6、Runway Gen-3、Hailuo 2.3。

  • Seedance 2.0(字节跳动):5 / 10 / 15 秒三档时长,16:9 / 9:16 / 4:3 / 3:4,basic/high 质量,还带 Extend 模式给已有视频无缝续写
  • Grok Imagine T2V(xAI):最长 15 秒,fun / normal / spicy 三种运动风格
  • MiniMax Hailuo:Full HD 输出,带快速变体

上传首帧图片后自动切到60+ 个图生视频模型(Kling I2V、Veo3 I2V、Runway I2V、Seedance 2.0 I2V,后者单次最多带 9 张参考图)。任务提交后在历史区轮询结果,刷新页面,未完成的任务会自动恢复。

把静态照片变成会说话的视频:口型同步

想让一张肖像开口说话?Lip Sync Studio 有9 个专用模型,分两种输入模式:

  • 肖像图 + 音频:上传照片和音频,生成 480p / 720p / 1080p 讲话视频。可选 Infinite Talk、Wan 2.2 Speech to Video、LTX 2.3 Lipsync(支持到 1080p)、LTX 2 19B Lipsync,均可附加提示词引导动作风格
  • 视频 + 音频:给已有视频重新对口型,适合配音换语言。可选 Sync、LatentSync、Creatify、Veed、Infinite Talk V2V

生成记录单独存在lipsync_history,刷新后同样自动续上。

深挖独家功能:Cinema Studio 的虚拟相机参数

Cinema Studio 不让你调滑块,而是给你一套"虚拟相机",把选择翻译成优化过的提示词修饰符喂给模型。

怎么操作

  1. 选机身:6 种可选,从 Modular 8K Digital 到 Classic 16mm Film
  2. 选镜头:11 种,如 70s Cinema Prime、Swirl Bokeh Portrait、Extreme Macro、Clinical Sharp Prime
  3. 选焦距:8mm(超广角)/ 14mm / 24mm / 35mm / 50mm / 85mm
  4. 选光圈:f/1.4(浅景深)、f/4(均衡)、f/11(深焦)
  5. 输入场景提示词,点击生成

能得到什么

"70s Cinema Prime + f/1.4 + 85mm"会直接产出带复古胶片光晕的浅景深人像;换 "Clinical Sharp Prime + f/11" 则是前后景全清晰的产品镜头。你不需要懂摄影术语,界面把每个选项都标了用途。

适合谁用

做广告分镜、预告片概念图、或想统一一组图的镜头语言,但又不想学相机设置的人。

跟着做完一次:文字到会说话的成品视频

  1. 图像工作室:输入场景描述,选 Nano Banana 2,分辨率 4K、宽高比 16:9 → 得到一张人物静帧
  2. 视频工作室:把这张静帧设为首帧,选 Kling I2V,生成 5 秒 → 得到基础动态片段
  3. Lip Sync Studio:切到肖像模式,上传同一张人物图 + 一段录音,选 LTX 2.3 Lipsync、1080p → 得到口型与音频对齐的成品

每步结果都留在各自的历史区里,中途刷新不丢任务。

想固化这套流程?打开 Workflow Studio,用拖拽节点把图像、视频、音频模型串成流水线,有内置模板和社区工作流可直接运行,建好的流程还能通过 Muapi API 调用。

硬件与配置速查

配置建议
最低8 GB 内存,本地推理只跑 SD 1.5 级模型(Dreamshaper 8 / Realistic Vision v5.1,各 2.1 GB)
推荐16 GB 内存(Z-Image 权重 7.4 GB + 约 2.4 GB 计算缓冲);Apple Silicon 用 Metal,Win/Linux 用 CUDA / Vulkan / ROCm

常见坑:

  • 8 GB 的 M 系列 Mac 跑 Z-Image 会卡死系统,官方明确警告,请改用 SD 1.5 模型
  • 本地推理只在桌面版可用,托管网页版一律走云端 API
  • sd.cpp 引擎在Settings → Local Models里一键安装,模型默认存在应用数据目录;设环境变量OPEN_GENERATIVE_AI_LOCAL_AI_DIR可把几 GB 权重挪到其他磁盘
  • M2 上 SD 1.5 正常速度约 1–2 秒/步;若变成约 10 秒/步,说明回退到了 CPU,重装引擎即可
  • 排查本地引擎问题从终端启动应用,日志会直接打到控制台;Ubuntu 24.04+ 上 AppImage 启动失败时建议直接装.deb

FAQ

Q:没有本地 GPU 能用吗?A:能。在线版和桌面版默认走云端 API;sd.cpp 也能跑 CPU 模式,只是慢。想要视频级本地模型(Wan 2.2 等)才需要一台带 CUDA/ROCm 的 GPU 服务器接 Wan2GP。

Q:自托管版本真的没有任何内容过滤?A:是的,这是项目的设计目标——无过滤器、无提示词拒答。生成什么由你输入的提示词和所选模型决定。

Q:一定要买 API 密钥吗?A:云端模型需要 Muapi.ai 的访问密钥,在应用内粘贴即可;如果只用本地推理模型(SD 1.5 / SDXL / Z-Image),可以跳过密钥。

Q:参考图会重复上传吗?A:不会。每张图只上传一次,之后存在本地历史里,跨会话直接复用。

Q:生成记录存在哪?A:浏览器 localStorage,按工作室分开存(口型同步单独存lipsync_history),可回看、下载、删除。

Open Generative AI 是目前能免费自托管、且模型池足够大的 AI 图像与视频生成工作台。去 5 分钟跑起来那一节挑一条路径,今天就能出第一张图、第一段视频。

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询