Open Generative AI 入门指南:本地部署 AI 图像生成与 AI 视频生成,5 分钟出第一张图
2026/9/8 10:38:39 网站建设 项目流程

Open Generative AI 入门指南:本地部署 AI 图像生成与 AI 视频生成,5 分钟出第一张图

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

Open Generative AI 是一款开源的 AI 图像生成与 AI 视频生成平台,内置 200 多个模型(Flux、Midjourney、Kling、Sora、Veo 等),MIT 协议、免费、无内容过滤、可完全自托管,个人创作者和想定制功能的开发者都能直接上手。

它到底能帮你创造什么

打开 app/studio/ 你会看到按场景划分的工作室,四条主线覆盖大多数 AI 绘画和 AI 视频需求:

  • 图像工作室:从文字生成图片(70+ 文生图模型),或上传参考图做修改(70+ 图生图模型)。上传参考图后,可用模型集合会自动切换成编辑类模型。
  • 视频工作室:文字直接生成视频,或把一张静帧"动画化"(85+ 文生视频、120+ 图生视频模型),支持 5/10/15 秒时长和多种宽高比。
  • 口型同步工作室:上传人物肖像加一段音频,就能得到说话视频;已有视频也可以重新对口型,共 9 个模型覆盖两种输入方式。
  • 电影工作室:面向写实的电影级镜头,提供相机、镜头、焦距、光圈等专业控制,适合拍"剧照"。

除主线外,还有音频、智能剪辑、营销素材、Agent 等工作室,模型定义集中在 packages/studio/src/,想确认某个模型是否支持某项能力,查这里最准。

最短路径:拿到你的第一张作品

部署方式挑一条,然后动手生成。

挑一条路。想零安装直接体验,用托管的在线版,浏览器打开即可用全部工作室,功能与最新版本保持同步;想要离线能力和本地推理,装桌面应用——macOS 装 DMG(拖进"应用程序"文件夹即可),Windows 跑 EXE 安装程序,Linux 用 AppImage 或 DEB 包;需要改代码或贡献功能,再从源码构建:

git clone --recurse-submodules https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI cd Open-Generative-AI npm run setup # 安装依赖并构建 packages 下的 studio / workflow / agents 工作区 npm run dev # 启动 Next.js 开发服务器,访问 http://localhost:3000

(仓库需 Node.js 18+;npm run setup不能省,只跑npm install起不来。)

动手生成。打开图像工作室,在提示词框里写一句具体描述,选好模型点生成,出图后从历史里下载即可。桌面应用还多一层"本地推理":设置 → 本地模型里可装 sd.cpp 引擎(内置,跑 SD 1.5 / SDXL / Z-Image 图像模型,支持 CPU、Metal、CUDA、Vulkan、ROCm),也可指向自己搭的 Wan2GP 服务器跑视频模型;图像工作室里打开 ⚡ Local 开关后,生成全程不依赖云端 API,模型权重和作品都留在本机。

决定画面质量的三个关键

同一套模型下,出片差异主要来自三个变量:提示词怎么写、模型选哪个、参数怎么调。

📝 写什么:提示词的结构化表达

提示词决定 AI 能不能"看懂"你要什么,推荐按"主体 + 动作 + 环境 + 风格 + 光线/材质细节"组织:不要只写"一只猫",而是"一只橘色虎斑猫在阳光下的花园里睡觉,毛发有光泽,油画风格"。不想要的元素用负面提示排除,出图不理想就基于结果迭代措辞,通常两三轮就能明显收敛。

🎛️ 用什么:模型要配任务类型

任务建议模型说明
文生图Flux、Nano Banana 2通用出图,Nano Banana 2 支持 1K/2K/4K 分辨率
图生图Nano Banana 2 Edit支持最多 14 张参考图
文生视频Kling、Seedance 2.0时长 5/10/15 秒,质量基础/高档
口型同步Infinite Talk肖像 + 音频生成说话视频

一个容易踩的坑:文生图和图生图是两套模型集合,提供参考图后工作室会自动切到图生图集合,如果画面没按预期变化,先确认当前模式。

🎚️ 调什么:参数按模型能力来

可选项包括分辨率(512×512 到 4K)、质量档(基础 / 高质量)、宽高比(1:1、16:9、9:16 等)、生成步数(越高细节越多、耗时越长)。界面上的参数面板是"智能控件",只展示当前模型真正支持的项,出现哪些就调哪些即可。

从一张图到一段成片

多图参考输入。兼容的编辑模型(Nano Banana 2 Edit、Flux Kontext Dev、GPT-4o Edit 等)一次最多接受 14 张参考图,上传器会带序号勾选,保证送入模型的顺序。适合"保持角色/风格一致地换场景"这类需求。上传过的素材会自动进入本地上传历史,跨会话直接复用,不用重复传。

电影级镜头控制。Cinema Studio 源码 里的虚拟相机把专业摄影参数翻译成提示词修饰,可选项包括:相机(70mm 胶片、8K 数码、S35 影棚机等 6 种)、镜头(经典变形宽幅、暖调电影定焦、旋焦人像等 11 种)、焦距(8mm 超广角、35mm 人眼、50mm 人像、85mm 特写)、光圈(f/1.4 浅景深、f/4 均衡、f/11 深焦),再叠加胶片质感,出图就带"摄影师调过机"的味道。

工作流自动化。工作流工作室 用节点式编辑器把图像、视频、音频模型串成自动化流水线,典型链路是"生成概念图 → 提升分辨率 → 叠加艺术风格 → 批量导出"。模板、社区共享流程、交互式 Playground 都内置,同一条工作流也能通过 API 直接调用。

遇到这些情况怎么办

macOS 首次启动被 Gatekeeper 拦截现象:打开 DMG 安装的应用时提示"已损坏"或"无法验证开发者"。原因:应用没有经过 Apple 公证,属正常拦截。解决:终端执行xattr -cr "/Applications/Open Generative AI.app",再右键应用选"打开"确认一次即可;也可以走 系统设置 → 隐私与安全性 → "仍要打开"。

Windows 弹出 SmartScreen 警告现象:运行 EXE 安装程序时提示"Windows 已保护你的电脑"。原因:安装程序未做代码签名。解决:点"更多信息",再选"仍要运行",应用会静默装到本地并生成开始菜单快捷方式。

Linux AppImage 无法运行现象:双击无反应或提示没有执行权限。原因:AppImage 需要执行权限。解决:chmod +x加上权限后运行。另注意 Ubuntu 24.04+ 默认开启的 AppArmor 用户命名空间限制会让 AppImage 静默退出,推荐直接装 DEB 包(自带 AppArmor 配置),或临时用sudo sysctl -w kernel.apparmor_restrict_unprivileged_userns=0处理。

出图质量差现象:画面模糊、细节糊成一团。原因:分辨率或质量档给低了,或提示词太笼统。解决:把分辨率往高调(支持 4K 的模型直接选高档),换具体、结构化的提示词,必要时换更擅长的模型。

生成速度慢现象:等出图的时间明显变长。原因:网络链路或云端排队,也可能是本机硬件不适合本地推理。解决:先检查网络;桌面应用可切换到本地模型推理;本地跑模型时注意硬件门槛(如 Z-Image 系列建议 16 GB 内存,8 GB 内存的机器建议用轻量 SD 1.5 模型)。

模型选错类型现象:上传了参考图,画面却完全没参考它。原因:文生图与图生图是两套模型,当前选的还是文生图模型。解决:确认上传后工作室已切换到图生图集合,重新在 i2i 模型里选择。

作品保存与分享现象:生成完不知道东西去哪了。原因/机制:所有生成记录默认保存在本地历史(浏览器存储),素材复用走上传历史。解决:从历史面板可回看任意一次生成并一键下载全分辨率原图,再导入其他编辑器或社交平台继续处理。

接下来可以往哪走

熟悉基本操作后,有四个自然的延伸方向:通过 app/api/ 下的接口把生成能力嵌入自己的应用(提交 + 轮询的两段式调用,工作流同样支持 API 执行);在 packages/studio/src/ 的模型清单里添加自己的模型,扩展系统能力;用节点编辑器沉淀可复用的工作流;或者直接参与开源开发,给仓库提功能。docs/ 目录里有演示素材和示例,可以先翻一遍。

从一句提示词开始跑通一次完整生成,剩下的能力都是在这条路径上加细节。第一张图离你大概只有五分钟。

【免费下载链接】Open-Generative-AIUnrestricted Open-source alternative to AI video platforms — Free AI image & video generation studio with 600+ models (Flux, Midjourney, Kling, Sora, Veo). No content filters. Self-hosted, MIT licensed.项目地址: https://gitcode.com/GitHub_Trending/ch/Open-Generative-AI

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询