Lyria 3.5 开放公开预览
Google 音乐生成模型新增 Lyria 3.5 公开预览,支持文本与图像输入及 44.1 kHz 立体声音频输出。
查看发布公告谷歌的 AI 能力建立在一系列模型之上,覆盖推理、多模态、端侧、创作与专业行业场景。
Google 音乐生成模型新增 Lyria 3.5 公开预览,支持文本与图像输入及 44.1 kHz 立体声音频输出。
查看发布公告gemini-3.8-flash 已正式可用,重点面向长流程软件开发、自主 Agent 与复杂企业工作流。接入前可用现有业务样本比较任务成功率、延迟与总成本。
查看发布公告3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 可按需读取视频时间线中的字幕、画面或音轨,适合评估长视频检索和内容分析任务。
查看发布公告正式端点 gemini-omni-1.1-flash 支持视频延长与首尾帧生成。旧预览端点计划于 9 月 30 日弃用,已有项目应提前评估迁移。
查看发布公告模型目录
模型页不只是列表,它更像一个选型总控台。你可以先判断自己更在意推理上限、响应速度、多模态输入、端侧运行还是行业专业性,再进入对应分组继续看。
每张卡片保留五行摘要和三个标签,方便快速区分定位、能力边界与适用任务;如果要做团队选型,建议结合模型对比页、API 模型页和订阅页一起看。
最新发布
Gemini 3.5 / Gemini Omni
复杂推理
Gemini 2.5 Pro / 3.1 Pro
高并发主力
Gemini 2.5 Flash / 3.1 Flash
端侧能力
Gemini Nano / Gemma
图像视频
Imagen / Veo / Omni
语音音乐
Chirp / Lyria
行业场景
MedLM 等垂直模型
如果你做研究、复杂规划、代码协作或高价值问答,先看 Pro 系列,能更快理解能力上限。
如果你做聊天、摘要、批处理和大规模接口调用,优先看 Flash 系列,更容易兼顾速度和成本。
当任务转向图像、视频、语音、医疗或开源部署,再从更多模型组里挑更贴合的专门入口。
围绕推理、多模态、端侧与实时交互形成完整谱系,适合从原型验证到生产落地的不同阶段。
覆盖文本、图像、音频、视频、代码与专业行业,让不同任务都能找到合适入口。
选型建议
Google AI 的模型体系不是一条单线,而是围绕推理强度、响应速度、多模态输入、端侧运行和成本效率形成多层组合。真正有用的阅读方式,不是先记住名称,而是先判断自己面对的是复杂分析、日常问答、内容创作、编程协作还是设备本地任务。
如果任务强调长文档阅读、复杂规划、代码理解或高质量最终输出,通常应优先看 Pro 路线;如果任务更看重速度、调用频率和成本控制,则 Flash 系列更容易成为长期主力。端侧、隐私、本地离线和轻量场景,则需要继续关注 Nano 或开源路线。
模型目录的重要性,在于它把抽象的模型名称翻译成可比较的能力边界。上下文长度、多模态支持、速度、调用入口和典型任务之间的关系越清晰,后续接入、试用和升级时的判断就越稳定。
阅读模型页时,建议同时结合功能页、API 文档和订阅页。模型页负责解释能力基础,功能页负责解释使用方式,API 文档负责解释接入方法,订阅页则帮助判断不同层级的使用门槛和资源投入。
模型选择通常不是一次性动作,而是随着任务复杂度、团队规模和调用频率不断调整。很多项目在原型阶段用的是一个模型,但到了稳定运行阶段,会逐步把旗舰模型、速度型模型和特定模态模型分配到不同环节。
如果你经常处理资料总结、研究分析、图文理解、视频创作或代码辅助,最好不要只关注单一指标。模型真正的差别,往往体现在长任务中的稳定度、多轮追问下的上下文保持,以及面对复杂输入时的输出组织能力。
对普通用户来说,模型页也能帮助理解为什么不同产品入口体验会出现差异。很多时候,看起来像同一类 AI 功能,背后实际依赖的是不同档位的模型能力,因此阅读模型页本身就能减少很多模糊判断。
先判断是研究、创作、编程、客服还是日常问答,再进入对应模型路线。
预算、响应速度、调用频率和部署方式,往往会直接影响模型是否适合长期使用。
很多真实工作流并不是单模型完成,而是多模型分工协作。