生成图像与语音的日常用法
视频生成抢眼,但多模态创作的日常主力是图像和语音:做一张封面、配一段插画、生成一段口播音频。这一页整理这两类能力的用法与额度逻辑。
图像生成的用法
- 任务内素材:让 Agent 在做幻灯片、写报告、搭网站时「配上合适的配图」,图像生成作为子环节自动调用——这是和「单独开一个生图工具」最大的区别,图和内容在一次任务里完成配套。
- 独立生图任务:直接描述想要的画面,交付图片文件下载。
- 风格参考:上传一张参考图再描述需求,产出更贴近预期,参考样例的价值见给AI下指令的六个实用技巧。
语音生成的用法
- 配音类:为视频、课程内容生成口播音频;语音模型家族(Speech 系列)支持多品质音色。
- 任务内输出:要求「报告转成音频简报」「幻灯片配讲解音轨」,语音与图文在同一次交付里出现。
额度逻辑:共享一个大池
订阅额度的一个关键设计:文本、图像、语音共享同一额度。这意味着:
- 用得多的模态会挤占其他模态的额度,月底额度紧张时优先保最重要的任务。
- 三档订阅(Plus / Max / Ultra)都包含图像与语音生成,与视频(仅 Max 及以上)不同——日常图文音创作不需要高档位。
额度与档位的完整对比见Token Plan 三档订阅分别适合谁;超出套餐额度的部分由积分抵扣,积分包规则见积分包价格与有效期规则。
与输入侧的区别
别忘了多模态还有输入一半:图片、视频、音频都能作为材料上传让 Agent 理解——「看图做同款」「听录音出纪要」都属于这个方向,上传规则见把材料交给AI什么格式都能读吗。
生成能力与额度设计依据官方订阅页与能力表整理,具体额度数值以官方最新版为准。