场景扩展
通过生成下一个片段来延续现有视频,同时保持更好的视觉一致性和叙事连贯性。该模型最多可使用 10 秒的先前上下文,而不只是最后 1 秒,并支持以 10 秒为增量扩展,最长累计 40 秒。
Gemini Omni 1.1 Flash 是 Google DeepMind 面向开发者的生成式视频工作流、创意工具和媒体编辑软件更新。公告称,它通过场景扩展、逐帧过渡、更快的预览以及更高分辨率输出,带来了对视频生成更强的控制力。
该产品被定位为生产就绪,可通过 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 使用。其核心作用是在最终渲染前,让 AI 视频生成与编辑更易于控制,也更便于反复迭代。
通过生成下一个片段来延续现有视频,同时保持更好的视觉一致性和叙事连贯性。该模型最多可使用 10 秒的先前上下文,而不只是最后 1 秒,并支持以 10 秒为增量扩展,最长累计 40 秒。
定义镜头的起点和终点,使模型能够在这些关键帧之间生成连续画面。这适用于更平滑的运镜、转场或循环片段。
生成轻量级 360p 预览,以便在投入更高分辨率渲染前测试创意。来源称,这种方式相比标准 720p 生成最高可快 60%,成本约为三分之一。
生成更高分辨率的视频输出用于最终交付,包括 1080p 和 4K。公告将其描述为一种在同一工作流中从粗略草稿过渡到精修成片的方式。
通过 Google AI Studio 中的 Gemini API 使用该模型,同时公告也提到可通过 Gemini Enterprise Agent Platform 访问。发布说明将 Omni 1.1 Flash 描述为面向开发者的生产就绪版本。
构建可在保持视觉与叙事连贯性的同时延续进行中的视频片段的工具。这适用于需要后续镜头紧密衔接前一镜头的故事驱动型生成。
在镜头中的两个关键时刻之间生成可控过渡,例如起始帧和结束帧。这对于运镜、场景变形或无缝循环很有用。
先用 360p 草稿快速验证视频概念,再投入更高分辨率输出。这适合早期分镜测试或内部快速评审。
在粗剪获批后,以 1080p 或 4K 生成用于交付的最终素材。公告将这些输出与精修、可用于生产的视频工作流联系起来。
将视频生成功能嵌入需要基于 API 控制而非面向消费者编辑界面的开发者产品中。该文章特别将此次发布定位给开发者和产品团队。
公告称 Gemini Omni 1.1 Flash 可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 访问,并且在 Google AI Studio 中可通过 Gemini API 进行生产环境使用。它未列出所有可能的访问路径或工作区要求。
帖子重点介绍了场景扩展、起始帧和结束帧控制、360p 预览生成以及向 4K 的升级放大。这些控制面向视频生成、编辑和更快的迭代,而不是通用文本或图像任务。
来源说明你可以按 10 秒增量扩展视频,累计总时长最多 40 秒。它还提到,在扩展场景时,模型可以分析最多 10 秒的前文上下文。
公告将 360p 预览描述为比模型标准 720p 分辨率更快且成本更低,并且表示最终输出可升级放大到 4K。它没有提供完整的定价表或额度计划。
页面将该更新定位为面向构建生成式视频工作流、创意工具和媒体编辑软件的开发者。它也被描述为适合专业用途的生产就绪产品。
ByteAsk 是面向 C 和 C++ 的终端优先 AI 编码 agent,可直接编辑仓库,并在展示 diff 前用真实编译器、调试器、sanitizers 和测试验证修改。提供免费版与付费方案。
MeetStream 是一款适用于 Zoom、Google Meet、Microsoft Teams 和 Webex 的会议 bot API,帮助开发者以按量计费方式程序化录制、直播和分析会议,注册即送 $5 试用额度。
CreateOS Sandbox 是基于 Firecracker 微型虚拟机的隔离计算环境,用于运行代码和 agent 工作负载,支持私有网络、SDK、CLI 和 MCP 程序化控制。
hob 是面向编码 agent 的独立工作区,可将 agent 会话、终端、历史记录和后续工作围绕你已在用的工具与提供商有序管理,适合重视本地路由、历史和工作区结构控制的开发者。
Manta AI 是面向团队的自治式网页应用测试工具,可从 URL 自动探索应用、映射行为、捕捉回归,并用自然语言生成测试,无需脚本或维护选择器。
Redline 是一款面向 Claude Code 的预算管理工具,可按时间、token、成本或计划百分比限制会话进度,并借助原生 hooks 和 statusline 让任务平稳完成,不会突然中断。