AI 创作流水线 · 本地优先

Memorix Pipeline

一站式 AI 创作工作台 — 视频转译、语音克隆、图像生成、GUI 自动化。本地优先,隐私安全,Apple Silicon 原生加速。

功能模块
生成配图中...
视频创作
原声替换(影视对白/歌曲翻唱)、文生视频(LLM 剧本 → Remotion 渲染)、MiniMax-H3 视频生成
5 个子模块
生成配图中...
音频工坊
语音克隆(CosyVoice 音色克隆)、播客生成(双人对话)、实时字幕、会议记录与纪要
4 个子模块
生成配图中...
图像设计
文生图(SDXL / FLUX 双引擎)、图生图/修图(Gradio 编辑器)、商品套图(参考视觉迁移)
3 个子模块
生成配图中...
GUI 自动化
GUI Agent(自然语言操控手机/桌面)、信息采集(APP 商品数据 → 网页表格)
4 个子模块
生成配图中...
Agent 调用
企业中台集成(Agent 网关问答/流式对话/Webhook)、浏览器自动化(自然语言驱动浏览器)
企业级
生成配图中...
专属工作流
iTest 自动化测试(ERP 用例/报告)、电商图片工作流(识别 → 责任位 → 批量生图)
FLUX + SDXL
典型使用场景
🎬
视频博主 — 外语视频一键转中文配音、克隆自己的音色、生成封面与开场动画
🛒
电商运营 — 商品套图批量生成、APP 商品信息自动采集为表格
🎙️
播客/会议 — 自动转写字幕、生成会议纪要、双人播客一键生成
📱
效率达人 — 用自然语言让 GUI Agent 操作手机完成日常任务
Memorix
AI 创作流水线
本地优先
数据不出设备 · 隐私安全
MPS 加速
Apple Silicon 原生算力
14
功能模块 · 一站式创作
上传视频
🎬
点击或拖拽视频到此处
支持 mp4, mov, avi, mkv
转译选项
文本与语种
参考音频
录音
上传文件
请朗读以下文本 换一段
点击麦克风开始录音 (建议 3-10 秒)
0:00
保存为音色档案
0/15
音色库
已保存的音色档案可在任意需要参考音频的场景中复用
暂无保存的音色
上传参考视频
📹
点击或拖拽视频到此处
将克隆视频中人物的声音和场景
输入文本与选项
双模型交叉审核+人工终审
提示词
0 字
SDXL: 生态成熟, 16GB 可用, ~20-60s | FLUX schnell: 画质更高, 4 步, ~30-90s | FLUX dev: 画质最佳, 20 步, CFG=3.5, ~60-300s
生成选项
🎨
图生图 / 局部修图 / 指令修图
SDXL + FLUX 双生态 · Apple Silicon MPS 加速 · Gradio ImageEditor
正在启动图像编辑器, 请稍候...
生成方式
音频配置 (所有生成方式共用)
🎵
点击或拖拽音频
mp3, wav, m4a, ogg
🎤
点击或拖拽参考音频
wav, mp3, m4a (3-10秒)
视频描述
分镜编辑器 (结构化, 改动后点"刷新预览"生效)
选择生成方式并生成/导入剧本, 或点击"添加场景"从零开始
高级: 原始 JSON (与分镜表双向同步)
工作流选择
影视原声替换 — 源视频
未选择
转写后按时间轴填入新台词 (可改可不改), 生成时替换为克隆音色的新对白。
默认自动
云端路径 (可选, ElevenLabs)
云端路径需在环境变量配置 ELEVENLABS_API_KEY; 未配置时请使用本地 TTS/STS。
手机操作指令 检测设备中...
💡 示例 (点击填入): 给微信发消息 · 抖音点赞评论 · 调亮度并截图 · 添加日历提醒
📊 信息采集工作流 检测设备中...
Agent 导航到目标列表页 → 本地视觉模型逐屏识别商品 (图片/名称/价格) → 生成网页表格
💡 示例 (点击填入): 采集山姆全球购商品 · 采集淘宝评价商品
识别: 本地 qwen3.6:35b (快 2.6x) · 导航模型默认与手机 Agent 面板一致 · 续采会自动携带已采集商品名单去重 (截图不覆盖上一轮)
🌐 浏览器自动化 (本地双模型 GUI Agent)
Qwen3.6 35B 规划 + Qwen3-VL 32B 视觉定位 + Playwright 执行 (DOM 优先, 视觉兜底); 高风险动作人工确认。
💡 示例 (点击填入): 百度搜索天气 · 提取 HN 标题
🛡 CapSolver: 检测中...
iTest · AI 自动化测试
读取 itest/ 目录: ERP 测试用例 (P0/P1) · Playwright 执行 · 报告归因。支持本地 Ollama 驱动用例生成/失败归因。
商品套图 — 参考视觉迁移工作台
上传参考图 → AI 拆解视觉风格 → 应用到商品生成套图
Step 1: 上传参考图
点击或拖拽参考图 (广告图/棚拍图/电商主图)
🎤 实时语音转字幕
就绪
需要浏览器麦克风权限 · 支持 Chrome / Edge / Safari · 音频本地处理
源语言字幕
等待语音输入...
📁 上传音视频文件
🎙️
点击或拖拽音视频文件
支持 mp3, wav, m4a, mp4, mov, avi · 最大 2GB
⚙️ 转写选项
历史纪要
加载中...
引擎选择
Fish S2 Pro: Dual-AR, 15,000+ emotion tags, 44.1kHz | 适合短节目/情感表达
🎤 音色库 (Voice Profiles)
📝 对话脚本
格式: 说话人ID: [可选情绪] 文本 · 一行一个段落
0 段落
生成参数
视频生成
提示词增强
视频再生成
任务历史
生成模式 ?
提示词
💡 示例: A time-lapse of a bustling city skyline as day transitions to night. The camera is static. Watch as the sun sets, casting long shadows, and the city lights begin to twinkle on, with streaks of car headlights moving along the streets below.
生成参数
— × — px
参考图 (可选, FL2VA 首尾帧模式) ?
点击或拖拽图片
点击或拖拽图片
文本描述 ?
💡 示例: 一只橘猫趴在窗台上晒太阳, 晨光柔和, 镜头缓慢推进, 能听到鸟鸣声。
0 / 500
参考图 (可选) ?
生成参数 ?
生成模型 ?
文本描述 ?
0 / 1000
参考图 (可选, I2V) ?
生成参数 ?
🏢 企业中台集成 — EnterpriseAI Agent Gateway
与 AI 网关双向集成: 同步/流式问答 (JWT) · 事件推送 (入站 Hook, HMAC) · 事件接收 (出站 Webhook, 验签+幂等)。
💬 AI 助手 (同步 / 流式问答)
携带 conversationId 维持多轮上下文; 流式模式 SSE 打字机渲染。
连接网关后开始对话...
📤 事件推送 (入站 Hook)
业务事件 → 网关 Hook (HMAC-SHA256 签名, 无需 JWT)。示例: 库存告警 / 订单事件。
💡 示例 (点击填入): 库存告警 · 订单事件
📥 事件接收 (出站 Webhook)
网关向本端点投递事件, 自动验签 (X-Webhook-Signature) + 幂等去重 (X-Webhook-Event-Id)。
暂无 Webhook 事件
🗂️ 内容抓取 — 分平台工作流
输入视频/笔记 URL, 抓取 标题 / 播放量 / 时长 / 视频文件; 抓取失败自动分析能否分离音频并转文字 (Whisper STT)。四平台工作流分开, 先选平台再抓取。
🎵
抖音
yt-dlp 原生提取器
📺
快手
Playwright 拦截兜底
📕
小红书
yt-dlp 原生提取器
💬
微信视频号
仅创作者平台可登录
💡 平台示例: 抖音视频 · 快手视频 · 小红书笔记
🔐 登录 (取得登录态)
抖音/快手/小红书网页端无水印与高清抓取通常需登录。点击「弹出登录窗口」→ 在弹出的 Chrome 窗口内完成登录 → 程序自动检测并保存登录态, 后续抓取自动携带 Cookie。微信视频号仅创作者平台可网页登录。
电商图片 1:1 高级视觉生成专家
上传产品白底实拍图 → 1:1 提取产品信息 → 选择图片类型与责任位 → 逐张生成提示词。全程只输出文字,不生成图片。