AI 多模态内容生产技能包
功能说明
本技能包为 AI 内容创作专家团提供完整的多模态内容生产知识体系,基于 WorkBuddy 平台内置工具,覆盖从创意策划到视频生成、从图片创作到发布级精修、从智能编辑到内容改编的全链路创作能力。
WorkBuddy 可用工具总览
内置工具
| 工具 | 触发方式 | 能力 |
|---|---|---|
| 多模态内容生成(Skill) | 说"生成图片/视频/3D"自动触发 | 文生图、图生图、文生视频、图生视频、文生3D、图生3D、图片特效 |
| ImageGen | 文本描述生成图片 | 文生图 |
| ImageEdit | 修改已有图片 | 图生图、局部编辑 |
视频生成模型
| 模型 | 调用参数 | 能力 | 特点 |
|---|---|---|---|
| HY-Video-1.5 | hy-video-1.5 |
文生视频、图生视频 | 中英文,5-10秒高清 |
| YT-Video-2.0 | yt-video-2.0 |
图生视频 | 动态连贯,画面自然 |
| YT-Video-HumanActor | yt-video-humanactor |
图生视频(人物) | 照片驱动人像视频 |
| YT-Video-FX | yt-video-fx |
图片特效视频 | 静态图转动态特效 |
图像生成模型
| 模型 | 调用参数 | 能力 | 特点 |
|---|---|---|---|
| HY-Image-V3.0 | hy-image-v3.0 |
文生图、图生图 | 80B参数,文字渲染强 |
| HY-Image-Lite | hy-image-lite |
文生图 | 快速响应 |
多模态理解模型
| 模型 | 调用参数 | 能力 |
|---|---|---|
| YT-VITA | youtu-vita |
视频/图片内容理解分析 |
知识模块
1. 创意策略
- 品牌/产品定位五要素模型
- 情绪板构建方法论(色彩/意象/质感/风格/情绪五层)
- 广告创意方向策划(渠道适配/20变体矩阵/创意家族)
- 场景设计、镜头与构图系统
- 参考 @references/creative-strategy-guide.md 了解完整策略方法论
2. 视频生成
- 4 个视频生成模型的选型策略
- "图生视频优先"策略:先生成关键帧,再图生视频
- Prompt 构建公式与最佳实践
- 参考 @references/video-generation-guide.md 了解完整视频生成知识
3. 图片创作
- 7 种场景创作策略
- ImageGen / HY-Image-V3.0 / HY-Image-Lite / ImageEdit 工具选型
- 批量生成流程与 20 变体矩阵策略
- 参考 @references/image-generation-guide.md 了解完整图片生成知识
4. 发布级精修(Generative Polish)
- 精确层+生成层分离原则
- 确定性合成工作流
- 社媒轮播/数据卡片/Hero图/格式包等常见模式
- 参考 @references/generative-polish-guide.md 了解完整精修方法论
5. 视频编辑
- Track 结构编辑体系
- 5 种元素类型 + 11 种滤镜类型
- 8 个典型编辑场景示例
- 参考 @references/video-editing-specs.md 了解完整编辑规范
6. 素材改编
- 视频内容分析(YT-VITA)
- 视频翻译(声纹克隆+唇型同步)
- 多媒体合成
- 参考 @references/content-adaptation-guide.md 了解完整改编指南
输出格式
所有创作产出统一采用以下格式:
- 视频:提供可访问的 URL + 元数据(时长/分辨率/格式)
- 图片:提供可访问的 URL + 参数信息(尺寸/比例)
- 报告:Markdown 结构化文档
注意事项
- 所有生成任务有最大等待时间限制(通常 20 分钟)
- 内容安全底线:禁止涉及未成年人或违规内容
- 语言匹配:输出语言与用户请求语言保持一致
- 工具边界:所有成员只能使用 WorkBuddy 内置工具,不得引用外部 API(如 Grok、Veo、Gemini 等)