
文章摘要
2026 年 9 月 3 日,X(Twitter)上一则「Gemini video understanding is truly bonkers 🤯」的帖子火了:把一场 2 小时的足球比赛交给 Gemini 3.8 Flash,它能自动找出所有黄牌、标在 2D 球场上,点击即可跳到视频中的准确位置。本文详解这个演示的原理,以及背后 Google 于 9 月 1 日发布的「Agentic Video Understanding」该如何使用。
Gemini 3.8 Flash 从 2 小时足球比赛中全自动找出所有黄牌!X 上爆火的「Agentic Video Understanding」演示详解(2026)
2026 年 9 月 3 日,X(Twitter)上一则「Gemini video understanding is truly bonkers 🤯」的帖子火了:把一场 2 小时的足球比赛交给 Gemini 3.8 Flash,它能自动找出所有黄牌、标在 2D 球场上,点击即可跳到视频中的准确位置。本文详解这个演示的原理,以及背后 Google 于 9 月 1 日发布的「Agentic Video Understanding」该如何使用。
核心要点:这个演示基于 Google 于 2026 年 9 月 1 日发布的「Agentic Video Understanding(智能体视频理解)」。与传统「按 1FPS 固定采样全部帧」的静态处理不同,Gemini 会自主决定看什么、以什么速度看、用哪种模态看。Token 消耗最高减少 88%,精度最高提升 7%。
本文内容
- 爆火演示做了什么(从 2 小时比赛中找出黄牌)
- Agentic Video Understanding 是什么(与传统方式的区别)
- 具体性能提升(Token・成本・精度)
- 演示背后的技术
- 如何自己上手使用(含 API 代码)
- 除体育外的实际应用场景
爆火演示:从 2 小时比赛中找出全部黄牌
2026 年 9 月 3 日,Jack Wotherspoon(@JackWoth98)发布的演示火了。
帖子内容:
Gemini video understanding is truly bonkers 🤯 Given a 2 hour football match, it scans the video for yellow cards, finds them, 3.8 Flash adds them to a 2D field so you can see where they occurred, then you can click on it and go to the exact part of the video!
(译文:Gemini 的视频理解真的厉害。给它一场 2 小时的足球比赛,它会扫描视频找出黄牌,3.8 Flash 把它们标在 2D 球场上,点击就能跳到视频的准确位置!)

演示中发生了什么
演示是一款名为「MatchLens98 - SoccerTacticalInvestigator」的足球战术分析工具,工作流程如下:
- 粘贴 YouTube 链接(例如曼彻斯特德比 Man City 2-3 Man Utd 的全场录像)
- 设定分析目标(Operational Goal):「找出裁判出示黄牌的所有情况,返回比赛分钟数和被警告球员」
- Gemini 3.8 Flash 扫描全场(Coverage: 100%——分析全部 90 分钟)
- 检测出 4 张黄牌(全部正确 = APPROVED)
- 在 2D 足球场上标出发生位置
- 点击标记即可跳到对应画面(附带 ±5 秒上下文)
检测到的事件示例:
| 比赛分钟 | 球员 | 球队 | 内容 |
|---|---|---|---|
| 35' (34:07) | Danny Welbeck (#19) | Manchester United | 对 Kolarov 的滑铲 |
| 36' (35:46) | Nani (#17) | Manchester United | 对 James Milner 犯规 |
每个事件都记录了球员、球队、球场位置(如 Middle Third)和时间码。所有陈述都通过三条通道——画面帧、语音转写、音频提示(MULTILANE INSPECTION EVIDENCE TIMELINE)交叉验证。「Every claim is grounded with ±5s context」(每个结论都有 ±5 秒上下文佐证)这句话正是这种验证流程的写照。
核心技术:Agentic Video Understanding
这个演示基于Google DeepMind 于 2026 年 9 月 1 日发布的「Agentic Video Understanding」。
传统方式(Static Processing)的区别
| 项目 | 传统(Static) | Agentic(新) |
|---|---|---|
| 处理方法 | 全片按 1FPS 固定处理 | Gemini 自主决定看哪里、看多快 |
| 模态 | 仅画面帧(固定速率) | 画面 + 音频 + 转写,按需切换 |
| Token 消耗 | 基准(巨大) | 最高减少 88% |
| 分析成本 | 基准 | 最高降低 66% |
| 精度 | 基准 | 最高提升 7% |
| 长视频 | 被迫在成本与精度间取舍 | 两者兼得(10 分钟到数小时) |
为什么更高效
传统静态处理是以固定速率(默认 1FPS)采样全部帧并送入模型。有两个问题:
- 长视频会产生海量 Token 消耗(90 分钟讲座可达数十万 Token)
- 在 1FPS 下,瞬间事件(如出示黄牌)容易被漏掉
使用 Agentic Video Understanding 后,Gemini 承担主动、目标导向的角色,自行决定看什么、以什么速度看、用哪种模态(画面/音频/转写)。它只去获取需要的瞬间和信号,从而大幅减少 Token 消耗和漏检。
其原理是智能体循环(agentic loop):模型调用内部工具加载视频的相关片段,大幅降低开发者的手动实现负担。
支持模型与上手方式
| 模型 | Agentic 支持 | 备注 |
|---|---|---|
| Gemini 3.8 Flash | 支持 | 最新;X 演示所用(2026 年 9 月) |
| Gemini 3.7 Flash | 支持 | Google 发布时品质最佳 |
| Gemini 3.6 Flash | 支持 | — |
| Gemini 3.5 Flash-Lite | 支持 | 成本优先选择 |
- 使用位置:Gemini API(Google AI Studio)与 Gemini Enterprise Agent Platform
- 输入形式:上传视频 + 可直接传公开 YouTube 链接
- 额外费用:无(仅标准 API Token 计费)
- 启用方式:在 API 配置中把
processing设为"agentic"即可
如何自己使用(代码)
基础:直接传 YouTube 链接
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.8-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/XXXXXXX", # 公开 YouTube 视频
"processing": "agentic", # ← 关键所在
},
{
"type": "text",
"text": "这个视频中最重要的 3 个瞬间是什么?",
},
],
)
print(interaction.output_text)
要点
- 只需在video 部分加上
processing: "agentic"(省略则回到旧的 static 行为) - 大文件请用 File API 上传,处理完成后引用 URI
- 可混合使用:例如 45 分钟参照视频用 agentic + 10 秒确认片段用 static
实际应用场景(不止体育)
Agentic Video Understanding 不止用于足球分析,还适合以下用途:
1. 体育战术分析(本演示)
- 提取特定事件(黄牌、进球、越位)的所有出现次数
- 带时间码与球场位置作为证据
2. 讲座与研讨会总结
- 从 90 分钟讲座中提取关键主题
- 不错过幻灯片切换或问答环节
3. 安防与监控视频异常检测
- 以更高 FPS 重新检查可疑时间段
- 带时间码报告发生了什么、何时、何地
4. 会议录像与动作计数
- 准确统计重复动作(举手、离席等)
- 在数小时的会议档案中做「大海捞针」式检索
5. 自动视频剪辑
- 精确定位亚秒级瞬间(剪辑边界、状态变化)
- 提升自动高光生成的精度
总结
X 上的爆火演示,正是 Google 新功能「Agentic Video Understanding」所释放潜力的缩影。
- 从 2 小时比赛中找出所有黄牌,标在 2D 球场上,点击跳到对应画面
- 不再是 1FPS 固定处理,而是Gemini 自主决定看哪里、看多快
- Token 最高减 88%、成本最高降 66%、精度最高提升 7%
- 支持 Gemini 3.8 Flash / 3.7 Flash / 3.6 Flash / 3.5 Flash-Lite
- 只需加
processing: "agentic",可直接传 YouTube 链接 - 除体育外还可用于讲座总结、异常检测、视频剪辑等
视频理解的成本大幅下降,「日常分析 2 小时比赛、90 分钟讲座」的时代已经开启。
注意:本文基于 2026 年 9 月的 X 帖子与 Google 官方博客・开发者文档。演示结果来自发帖者自制的应用(MatchLens98);数据包含 Google 公布与自我评估。最新模型支持与价格请以 Google AI 官方文档为准。
参考链接
- X 帖子(@JackWoth98・2026 年 9 月 3 日)
- Introducing agentic video understanding with Gemini(Google 官方博客)
- Video understanding | Gemini API(开发者文档)
- Gemini 3.8 Flash and 3.8 Flash Cyber(Google 官方博客)
相关文章
相关文章

2026年10月1日
【2026年10月】Gemini 4 Argon 全面解读:100 万 token 输出与 19 项基准测试(附来源)

2026年6月15日
【2026】ChatGPT vs Claude vs Gemini 彻底比较!从免费版到付费版完全指南

2026年7月16日
【2026】Blender MCP 在 Hermes Agent 中使用完全指南!用 AI 指示 3D 建模的初学者设置步骤

2026年6月23日
【2026】Blueprint.am 完全解析!「Claude for Hardware」让 AI 自动生成配线图・零件表・组装步骤

2026年7月13日
【2026】Inference AutoTune 完全指南!自动蒸馏生成专用小型模型的革命

2026年9月5日
2026 年 Ling-3.0-flash 详解:蚂蚁集团新一代混合 MoE(附医疗版 Sante 注意事项)