Gemini Omni API 接口文档
1. 文档说明
本文基于 Google DeepMind 官方页面https://deepmind.google/models/gemini-omni/prompt-guide/ 整理。
需要注意:该页面是 Gemini Omni 的 Prompt Guide,不是 API Reference。页面介绍了 Omni 的能力、提示词写法和使用场景,但没有公开独立的 REST endpoint、模型 ID、请求参数、价格、限流或返回结构。
因此,本文分为两类内容:
- 已公开的 Gemini API 通用调用方式。
- 基于 Gemini API 风格整理的 Omni 接入模板,具体模型名和字段需以 Google 官方实际开放为准。
2. 基础信息
3. 能力范围
Gemini Omni 官方页面强调的是 “Create anything from anything”,即可以从多种输入生成或编辑视频。4. Prompt 推荐结构
官方建议 Prompt 中包含以下元素:5. 通用 Gemini API 调用方式
如果 Gemini Omni 后续开放到 Gemini API,很可能沿用 Gemini API 的generateContent 调用风格。
基础 Endpoint 通常类似:
{MODEL_ID} 需要替换为实际模型名。
可能的模型名形式如下,但这些名称当前不能从官方 Prompt Guide 页面确认,不能直接假定可用:
6. 文本生成视频接口模板
注意:以下为基于 Gemini 多模态 API 风格整理的接入模板,不代表 Omni 当前已公开可用。
请求
请求体示例
字段说明
7. 视频编辑接口模板
Omni 页面明确支持输入视频并通过自然语言编辑,例如:请求体示例
字段说明
8. 图像、视频、音频组合接口模板
官方示例:请求体示例
9. 文件上传流程
Gemini API 通常需要先上传文件,再在generateContent 中引用文件 URI。
典型流程:
- 上传图片、视频或音频。
- 获取
fileUri。 - 在生成请求中通过
fileData.fileUri引用。 - 获取生成结果。
- 如果是长任务,轮询 operation 状态。
10. 异步生成接口预期
视频生成通常耗时较长,因此如果 Omni API 开放,更可能采用异步任务模式。 可能的请求形式:任务返回示例
轮询请求
完成返回示例
11. Prompt 示例
11.1 文本生成视频
11.2 编辑主体
11.3 改变镜头
11.4 改变动作
11.5 风格迁移
11.6 文本渲染
11.7 Storyboard
12. Node.js 调用模板
13. Python 调用模板
14. cURL 调用模板
15. 返回结果预期结构
同步返回示例
异步任务返回示例
异步任务完成示例
16. 常见错误码
如果通过 Gemini API 接入,常见错误大致如下:17. Prompt 编写建议
官方页面给出的核心经验:18. 当前不可确认的 API 信息
官方 Prompt Guide 页面没有提供以下内容:19. 实际接入建议
工程化接入建议按下面顺序确认:- 在 Google AI Studio 的模型列表中查找是否存在 Gemini Omni。
- 如果存在,复制真实模型 ID。
- 用
generateContent做最小文本生成测试。 - 再测试
responseModalities: ["VIDEO"]是否被接受。 - 如果返回长任务 ID,实现 operation 轮询。
- 如果模型不在 Gemini API 出现,只能通过 Gemini App 或 Google Flow 使用,暂时不能 API 化。
20. 最小封装设计
建议业务侧抽象成如下接口:21. 结论
Gemini Omni 官方目前公开的是能力介绍和 Prompt Guide,不是 API 文档。 如果需要可调用接口,目前能确定的只有通用 Gemini API 接入模式;Omni 的真实MODEL_ID、视频生成参数和返回结构需要等 Google AI Studio、Gemini API 或 Vertex AI 正式公开后才能最终确认。