运营内容智能分析与生成平台
一句话介绍
面向抖音和小红书运营团队的 AI 工作台,将“内容记录、数据采集、分析诊断、策略资产复用、内容生成、发布前风控”串成一个可追溯、可人工确认的运营闭环。

项目背景
运营人员常在表格、聊天记录、平台后台和 AI 对话之间来回切换:数据难积累,爆款经验难复用,生成内容容易与商品事实不符,平台风控也只能依赖人工经验。现有工具往往只解决“生成”或“排期”中的一个环节,缺少围绕账号长期数据和内容资产的闭环。
我把项目定位为“运营决策与内容生产工作台”,不自动登录或发布,不读取平台 Cookie,也不替代运营人员的最终判断。
目标用户
- 同时运营抖音、小红书账号的小型内容团队。
- 需要复盘历史数据、复用账号风格和爆款结构的运营人员。
- 希望使用自己的模型 API,但需要费用、权限和风险边界的团队。
- 需要把截图、Excel/CSV、手动数据统一沉淀到内容库的运营团队。
核心闭环
账号与栏目配置 → 内容/数据导入 → 动态基准与分析 → 爆款/风格/事实沉淀 → AI 生成 → 发布前检查 → 人工保存与发布 → 新数据回流

工作台不跨平台混算播放量、曝光量等口径不同的数据,而是分别展示账号数据完整度、待分析内容、风险和当前最高优先级行动。
核心能力
- 双平台账号、栏目、指标和数据严格隔离。
- 手动、Excel/CSV、截图识别、浏览器扩展四种数据导入方式。
- 动态基准、成熟度、完整度和基于证据的分析建议。
- 爆款候选人工确认、账号风格版本和事实资料 L1-L5 分级。
- 标题、文案、封面五步生成与风格继承。
- RiskRAG、OCR 降级、确定性规则和发布前检查。
- 持久化运营智能体对话、计划审批和受控任务执行。
- 千问及 OpenAI-compatible 文本模型配置、连接验证和用量治理。
- CSV、Markdown、JSON、ZIP 导出与恢复预览。
- Admin、Editor、Viewer 三角色,以及公开只读 Demo。
我的职责
- 从运营实习、内容生产和切片工具经历中提炼需求。
- 定义产品范围、核心流程、角色权限、平台隔离和 AI 安全边界。
- 持续评审页面信息架构、易懂/专业文案、引导与移动端体验。
- 将大需求拆成可独立验收的 Task,并设计验收标准和回归测试。
- 选择模型、调试提示词、验证 Mock/真实调用边界并复核结果。
- 使用 Codex 协助完成代码、测试、迁移、OpenAPI 类型和交付文档。
当前成果
- 形成 17 个正式工作台入口、16 个后端业务模块、44 个数据库迁移。
- 仓库累计约 196 个提交,包含 124 个 API 测试文件、57 个 Web 测试文件和 17 个扩展测试文件。
- AC-01—AC-17 当前为:8 项
passed、8 项partial、1 项not_run。 - 支持 Docker Compose 本地运行,macOS 已完成解压包验收;Windows 启动器已提供但真实运行仍未验证。
- 浏览器扩展已完成 Manifest V3、页面识别、整页截图、人工预览和暂存上传;真实平台页面与 Windows/Edge 仍需验收。
项目定位
这是一个高完成度工程型 MVP,而不是成熟商业产品。它的价值在于:产品链路完整、业务边界明确、数据与权限隔离扎实、可继续接入真实模型和用户验证;不足在于真实用户样本、真实平台兼容性和生产效果尚未得到充分验证。
产品背景与核心闭环
1. 我观察到的真实问题
在 AI 赛道运营、社群维护、拍摄剪辑和抖音切片工具实践中,我反复遇到五类问题:
- 数据散落:标题、文案、封面和运营数据存放在不同表格、平台和聊天记录中。
- 经验不可复用:团队知道“这条爆了”,但很难保存当时的结构、风格、栏目和数据条件。
- AI 容易胡编:商品面料、价格、功效、认证等事实如果没有资料约束,生成内容容易失真。
- 平台口径不同:抖音和小红书的数据字段、内容形态和风险规则不同,不能简单合并评分。
- 工具入口分散:导入、分析、生成、风控和导出之间缺少清晰的下一步。
2. 产品决策
不做“全自动发布工具”
项目明确不保存 Cookie、不绕过验证码、不调用非官方隐藏接口、不自动发布。这样牺牲了一部分“自动化感”,但避免了账号安全、平台合规和误发布风险。
把人工确认设计成正式流程
截图识别、Excel 映射、爆款候选、事实资料、智能体计划和高风险操作都先进入暂存或确认状态。人工确认不是补丁,而是产品的一部分。
AI 只在可控边界内工作
模型负责解释、分析和生成;范围、权限、事实、引用、用量和风险由服务端规则控制。模型不能自行选择其他工作区、发明工具或绕过风控。
3. 数据采集闭环

数据导入中心统一四种入口:
- 手动录入:适合少量内容和指标补录。
- Excel/CSV:适合历史数据迁移和批量录入。
- 截图识别:识别平台截图中的标题、正文和指标候选。
- Capture Extension:在受支持的平台页面主动截图并上传暂存任务。
所有导入都遵循“选择来源 → 上传/采集 → 暂存预览 → 修正 → 确认入库”。确认前不会写入正式内容或快照。
4. 分析与复盘闭环

分析中心回答三个问题:哪些内容还没分析、当前证据是否足够、下一步应该做什么。动态基准按平台、账号、内容类型、成熟度和用户选择范围计算;样本不足时明确降级,不把空值变成 0。
5. 策略资产闭环

“数据表现好”不等于“应该照抄”。系统先生成爆款候选,再由运营人员确认是否进入素材库。生成时引用的是已确认结构,不把偶然高数据直接当成因果结论。

事实资料采用 L1-L5 分级:权威资料、用户确认、文档/OCR、网页候选、视觉推断。L5 只能提示,不能独立证明面料、价格、功效或认证。冲突事实会阻止确定性生成。
6. 生成与风控闭环

生成中心拆为五步:范围与目标、事实资料、风格与参考、生成与编辑、复核与保存。切换平台或账号时会清除不兼容的事实、风格和爆款引用,避免跨账号污染。

保存前重新执行事实冲突检查、标题/正文/封面联合扫描、OCR 置信度判断和 RiskRAG 引用校验。高风险、OCR 失败或无有效证据时采用 fail-closed,并明确提示人工复核。
7. 运营智能体闭环
运营智能体不是拥有任意权限的通用机器人,而是已有业务能力的编排层:

- 读取当前账号状态和待处理问题。
- 用确定性规则只推荐一个最高优先级行动。
- 生成结构化计划并展示数据范围、工具和预计产物。
- 用户批准后执行低风险步骤。
- 覆盖正式数据、修改关键配置或移入回收站时再次确认。
- 保存聊天、运行、步骤、确认事项和产物,刷新后可恢复。

热点流程采用“浏览器扩展截图 → 人工确认热点候选 → 模型原生联网检索 → 带引用生成”,不做自动抓榜和定时发布。

核心功能与组件说明
本章只使用组件级截图。每张图只保留正在介绍的控件或卡片,避免整页截图让读者找不到重点。
1. 全局导航和数据范围
1.1 两级导航

左侧第一列固定展示“总览、运营、创作、资产、管理”五个大类;第二列只展示当前大类的小功能。它解决早期功能平铺、入口过多的问题,并让新人先建立大类心智。
1.2 平台和账号范围

所有分析、生成、资产和风控操作都继承当前平台与账号范围。切换平台后会清除不匹配的账号,避免抖音和小红书数据混算。
1.3 易懂/专业模式与引导开关

易懂模式强调“现在应该做什么”,专业模式保留版本、证据和状态细节。引导不是只出现一次的新手弹窗,运营人员可以随时打开或关闭。
1.4 页面引导卡

每个页面都提供“建议先做”和“查看操作说明”,用于说明页面用途、操作步骤、会看到什么以及常见空状态。
2. 工作台总览
2.1 数据状态

先告诉用户账号缺什么数据、是否存在等待确认的导入,以及不同平台是否分别核算。它避免在证据不足时先展示漂亮但不可靠的图表。
2.2 待处理问题

统一汇总待分析内容、高风险草稿、低置信度 OCR 和失败任务,减少运营人员在多个模块间寻找异常。
2.3 下一步行动

一次只突出当前最高优先级的一项行动。系统不给出不可靠的时间承诺,只提供明确入口和下一步。
2.4 账号状态卡

每个账号分别展示数据完整度、待分析数量、快照成熟度、闭环状态和风险。抖音与小红书始终分开核算。
3. 账号仪表盘与内容详情
3.1 目标指标卡

指标卡只展示当前平台、内容类型和成熟度下合法的目标指标,并同时说明样本量、完整度和分位门槛。
3.2 图表门禁

趋势图、漏斗图和发布时间热力图都必须满足服务端返回的样本条件。条件不足时显示原因和补数建议,不用空图制造确定感。
3.3 内容详情五标签

概览、数据快照、分析、风控、生成记录五个标签把一条作品的完整上下文集中在同一详情页,减少跨页面跳转。
4. 数据导入与分析
4.1 导入五步进度

“选择来源 → 上传/采集 → 暂存预览 → 修正 → 确认入库”明确区分上传成功和正式写入。确认前不会污染正式内容或快照。
4.2 导入范围选择

导入前必须锁定平台和账号;后端再次验证账号归属和平台匹配,避免跨账号导错数据。
4.3 四种导入来源

手动录入适合少量数据,Excel/CSV 适合批量历史数据,截图识别适合平台截图,Capture Extension 适合用户主动采集已登录页面。
4.4 导入历史

历史区只展示任务状态、统计和安全下一步,不返回截图、OCR 正文、Prompt、Token 或临时签名地址。
4.5 分析筛选与队列

分析队列支持平台、账号、状态和排序筛选,并显示成熟度、样本、版本、证据和建议状态。打开详情后可以恢复原筛选和页码。
5. 策略资产
5.1 爆款候选门槛

运营人员设置候选类别、指标、最低门槛、内容类型和成熟度。历史高分位只代表相关性,不自动等于因果。
5.2 候选与已确认素材

候选需要人工确认后才能进入素材库并被生成引用。已确认爆款结构和账号风格分开维护,避免一次高表现内容自动改变账号风格。
5.3 L1-L5 事实等级

来源等级决定资料能支撑什么强度的文案。L5 视觉推断只能作为提示,不能独立证明面料、价格、功效或认证。
5.4 事实来源录入

用户可以添加文字、网页、文档或图片来源。网页和 OCR 结果始终按不可信输入处理,进入事实清单前仍需人工确认。
6. AI 生成与发布前检查
6.1 五步生成导航

生成中心依次处理范围与目标、事实资料、风格与参考、生成与编辑、复核与保存。切换平台或账号时会清除不兼容引用。
6.2 当前生成范围

侧栏持续展示平台、账号、栏目、事实、风格继承、爆款引用、参考图、模型、风险和预算状态,防止用户忘记当前上下文。
6.3 发布前检查队列

队列同时展示检查状态、OCR 状态、判断资料、规则版本和下一步。高风险、OCR 失败或无有效证据时采用 fail-closed。
7. 运营智能体
7.1 对话与历史会话

成员可以创建、继续和归档会话。聊天负责理解目标与解释结果;计划、运行、步骤、确认和产物仍保存在结构化服务端记录中。
7.2 今日建议

系统每天只突出一个最值得优先处理的问题。优先级由确定性规则计算,不允许模型自行决定最重要事项。
7.3 计划与执行进度

智能体先锁定平台账号并生成结构化计划,获得批准后再执行;页面关闭后仍从服务端恢复执行状态。
7.4 待确认事项

覆盖正式数据、修改关键配置或移入回收站等受保护写操作必须停下来,由发起成员确认后继续。
8. 热点创作
8.1 热点确认与联网门禁

热点榜由用户通过扩展主动截图,OCR 候选先人工确认;只有通过连接检测且声明支持原生联网的模型才能继续查证。没有真实 HTTPS 引用时不生成成功结果。
9. 风控、备份与工作区治理
9.1 知识文档生命周期

风控资料经历草稿、已解析、待审核、生效、被替代或失效。只有审核并生效的资料会用于扫描,旧版本保留历史追溯。
9.2 固定合成评估门槛

固定合成样本用于工程回归和引用校验,不能包装成生产准确率或平台过审承诺。
9.3 导出与恢复方式

CSV 用于继续分析,Markdown 用于分享单条报告,JSON 用于轻量备份,ZIP 用于包含授权资产的完整备份。恢复前先显示新增、覆盖、跳过和冲突。
9.4 工作区设置导航

设置中心把成员、平台账号、指标与基准、模型预算、保留策略和危险操作分开,降低管理员误操作概率。
10. 模型配置与用量治理
10.1 模型接入与连接

管理员可选择千问官方服务或 OpenAI-compatible 文本模型。密钥只在服务端加密保存,连接测试不发送真实运营正文。
10.2 工作区用量政策

用量政策限制并发、每分钟调用、每日调用、输入输出文字量、OCR 数量、生成图片数和每日费用;未配置政策时真实调用默认拒绝。
技术架构与工程亮点
1. 架构选择
项目采用模块化单体,而不是一开始拆成微服务:
Next.js Web / Demo / 浏览器扩展
↓
FastAPI API
↙ ↓ ↘
PostgreSQL+pgvector Redis S3/MinIO
↓
Celery Worker
选择理由:个人项目和早期产品更需要清晰事务边界、低部署复杂度和快速迭代;通过模块服务接口、OpenAPI 合同和异步 Worker 保留未来拆分空间。
2. 核心技术栈
- 前端:Next.js、React、TypeScript。
- 后端:FastAPI、Pydantic、SQLAlchemy、Alembic。
- 异步任务:Celery、Redis,包含 claim、lease、heartbeat 和 fencing。
- 数据:PostgreSQL、pgvector、S3/MinIO。
- 浏览器扩展:Manifest V3、Chrome/Edge 共用源码。
- 部署:Docker Compose、多阶段镜像、非 root、只读根文件系统。
- 合同:OpenAPI 自动生成 TypeScript 类型,CI 检查漂移。
3. Workspace 隔离
真实工作区是系统安全边界。每条业务记录必须直接或间接归属 workspace_id;读取和修改同时校验成员、工作区、平台和账号。跨工作区资源统一返回 404,避免泄露资源是否存在。
公开 Demo 使用独立合成工作区、只读权限和独立限流,不能读取或写入私有工作区。
4. AI Provider Adapter

模型层不把供应商 SDK 直接散落到业务代码,而是使用能力目录和 Adapter:
- 千问文本、视觉/OCR、Embedding 和图片生成。
- OpenAI-compatible 文本模型与自定义服务地址校验。
- 工作区级配置、密钥加密、连接验证和配置版本固定。
- 真实调用默认拒绝,只有配置用量政策后才能执行。
- 429、超时和 5xx 有限重试;鉴权和普通 4xx 不盲目重试。
- 调用记录不保存 Prompt、正文、密钥或供应商错误正文。
5. RiskRAG
RiskRAG 采用“确定性规则 → 平台隔离检索 → 引用验证 → 结果合并”的固定顺序:
- 元数据先过滤工作区、平台、生命周期、模型版本和维度,再进行向量排序。
- Citation 只能引用当前 Evidence Bundle 中真实存在的 chunk。
- S5 或低置信度 OCR 不能独立支撑高风险确定性结论。
- 无有效资料时保留确定性结果并返回证据不足,不生成虚假引用。
- 扫描记录不可覆盖,修改后用新记录和
previous_scan_id串联。
6. 异步任务与数据一致性
生成、识别、分析、导出、恢复和删除都可能耗时。项目通过幂等键、输入指纹、Worker 租约、操作版本和旧 Worker fencing 避免重复写入或旧任务覆盖新状态。
ZIP 恢复采用“隔离暂存 → 校验 → 数据库事务 → 对象移动 → 索引重建”。失败时回滚或进入显式补偿状态,不把半完成任务伪装成成功。
7. 备份与安全
- JSON/ZIP 备份排除 API Key、邀请码、会话、Cookie、临时签名 URL、向量和运行中任务状态。
- ZIP 防护路径穿越、重复路径、Unicode/大小写碰撞、符号链接、嵌套 ZIP 和压缩炸弹。
- 结构化日志自动清除 Authorization、Cookie、Prompt、正文、截图和密钥。
- Docker 镜像采用多阶段构建、最小权限、capability 移除和
no-new-privileges。
8. 工程验收证据
- 196 个本地提交,44 个迁移,16 个后端业务模块。
- 124 个 API 测试文件、57 个 Web 测试文件、17 个扩展测试文件。
- 覆盖跨工作区隔离、权限、迁移、OpenAPI 漂移、密钥扫描、依赖审计、SBOM、镜像漏洞和隔离 fresh-install。
- 视觉回归覆盖桌面、390px 移动端、易懂/专业模式、Viewer 只读和错误状态。
9. 诚实边界
- 真实千问效果、延迟、限流和费用仍需受控验收。
- 真实抖音/小红书页面兼容性尚未完成正式验收。
- Windows/Edge 真实运行仍为
not_run。 - 固定合成评估集是工程回归门槛,不代表真实平台过审准确率。
- 当前不自动发布、不支付、不读取平台 Cookie,也不定时抓取热点榜。

