Pi 上的 Felo YouTube SubtitlingPi Coding Agent

没有浏览器面板的框架,照样能看那场分享

Pi 把内核保持得足够小,视频从来进不了工作流——而你要的那句话常常在录像的第四十分钟。这个技能把字幕拉下来,会话就能像搜一个普通文本文件那样搜它。

为 Pi 打造不需要浏览器输出带时间戳
获取 API Key查看平台指南
复制进来cp -r felo-skills/felo-youtube-subtitling ~/.pi/agent/skills/
  1. 技能包felo-skills/felo-youtube-subtitling
  2. 输入一个 YouTube 链接
  3. 返回形式带时间戳的文本行
  4. 然后当成普通文本检索
Pi Coding Agent 标志
该技能运行于

Pi Coding Agent

极简终端编码框架

阅读 Pi Coding Agent 指南

Pi 刻意把内核做得极小,并要求你自己扩展,所以技能正是它期望的扩展方式:不新增需要维护的工具,又能拿到触角。

从哪加载
~/.pi/agent/skills/ · .pi/skills/ · 包
安装方式
复制文件夹,或 pi install npm:@scope/pkg
值得注意
没有沙箱——挂载前先读一遍 SKILL.md
你会得到

带时间戳的文本行,让每条说法都能对着它被说出的那一分钟核对

返回的是会话可以搜索、可以引用、也可以不同意的文本。真正让它在之后还有用的是时间戳:没有时间戳的引文,谁都没法核实,包括你自己。

04:12Maren

我们春天把调度器从单体里搬了出来,最先丢掉的就是重试预算。

11:38Maren

p99 一点没动。动的是我们花在等队列上的时间。

19:05主持人

所以这次的收益是运维上的,而不是延迟上的。

26:44Maren

正是。花六周时间,让一个每季度都会发生的故障不再发生。

33:20Maren

如果这场分享你只带走一个数字:每季度十四个页面变成了两个。

p99 一点没动。动的是我们花在等队列上的时间。
要求把数字连同它们的时间戳一起抽出来,这场分享里最关键的那句话就很容易对着录像核对。
固定套路

从一段别人发来的录像,到有人用得上的笔记

顺序很重要:先拿到文本,再决定什么重要,最后写下来。

触发条件

有人发来一段录像,而有用部分在十分钟以后的某个地方。

  1. 01

    要字幕,不要摘要

    摘要会丢掉数字和那些限定语,而它们往往正是你看这段录像的原因。先拿到带时间戳的文本行,重要不重要自己判断。

  2. 02

    像搜文件一样搜它

    要求列出每一句含数字、版本号或日期的句子。字幕变成文本之后,这就是一个文本任务——正是小内核框架擅长的活。

  3. 03

    挑出值得复述的那两行

    一句承载论点,一句点明限制。时间戳要跟着一起留着;没有时间戳的引用没法核对。

  4. 04

    把它放在它所支撑的决策旁边

    只活在这个会话里的字幕会随它一起消失。把相关的几行写进仓库,放在它们所支撑的那项工作旁边。

留下可以检索的带时间戳文本行、值得复述的引文,以及一份说明演讲者从未给出支撑的主张清单。

在 Pi 上安装

字幕就是普通技能包,所以安装就是复制一次

字幕不需要任何特殊根目录。唯一值得保持的 Pi 习惯是在它变成全局之前先读一遍,因为一个会联网的技能值得看一眼。

  1. 01
    ~/.pi/agent/skills/全局

    本机所有项目。读完之后如果你想让它到处可用,就放这里。

  2. 02
    ~/.agents/skills/共享

    其他框架也会读这个文件夹,所以一次克隆能同时服务 Pi 和你跑的别的东西。

  3. 03
    .pi/skills/项目

    只对这个仓库生效,而且只在你信任该项目之后。还没读过的技能包适合先放这里评估。

  4. 04
    pi install npm:@scope/pkg

    某个包的 skills/ 目录,纳入版本管理、可以更新。技能包一旦确定长期使用,这是更干净的路子。

或者只为一次会话加载,不复制pi --skill /path/to/felo-youtube-subtitling
实际用法

两种用法,对付你还没看的分享

两种都假定视频是资料而不是娱乐,两种都以可核对的东西收尾。

输入这句把这场分享的字幕拿来,列出它引用的每一个基准测试数字,并附上各自的时间戳。返回内容

一张简短的数字表,每一个都指向它被说出的那一分钟,你可以直接跳到那条说法。

输入这句这段录像里有讲他们怎么做回滚吗?把回答连同时间戳一起引用出来。返回内容

相关的几行加时间戳——或者一句明确的说明:这个话题从未被提起,那也是答案。

边界在哪

引用视频之前值得知道的三个限制

字幕是有已知失败模式的证据,而且核对起来很便宜。

字幕不是意图的转录

自动生成的字幕会把名称和数字搞乱。如果某个数字要进入决策,在把它复述到任何要紧的地方之前,先对着录像核一遍。

没有字幕就没有文本

一段没有字幕的录像,技能什么都拿不到。这是来源问题,把提示词写得更长也解决不了。

上下文仍然要你来补

字幕说的是别人讲了什么,而不是他的处境和你的是否相似。技能替你省掉的是观看,不是判断。

常见问题

Pi 用户关于 YouTube 字幕的疑问

哪些视频能用?
带字幕的公开 YouTube 链接,包括自动生成的字幕。私享、未公开且无访问权限,以及需要登录的录像都拿不到。
它能盯着一个频道等新视频吗?
它抓取的是你指给它的那个视频。盯新上传是排期任务而不是字幕任务,在 Pi 上那得用别的东西搭出来。
字幕之后该放在哪里?
放进仓库,放在它所支撑的决策旁边。之后的会话看不到这个会话的记忆,你的同事也看不到。
这需要浏览器,或者装一个无头 Chrome 吗?
不需要。这正是它在极简框架上的意义:技能直接拿到字幕,不用打开页面,也不用让浏览器进程常驻。
Pi Coding Agent 的更多技能

Pi Coding Agent 的全部 Felo 技能

这 5 个技能都是为 Pi Coding Agent 编写的。它们在这个平台上的用法一致,所以你可以放在同一次会话里组合使用,不必重复说明自己的环境。

现成技能之外

一个 API Key,一整套 Agent 工具

从技能开始,再按 Pi 工作流的需要组合模型、实时数据、知识和输出工具——用的还是 Felo 技能已经在用的那个 Key。

模型

当 Agent 需要自定义推理或生成时,使用性价比更高的 LLM 接入。

  • LLM API
  • 对话补全
  • 模型接入
浏览 LLM API →

实时信息

为 Agent 提供最新的 Web 与社交信号,而不是依赖过时的上下文。

  • Web Search
  • X Search
  • Web Fetch
浏览实时数据工具 →

知识与输出

把工作建立在可复用的知识之上,再转化为可以分享的交付物。

  • LiveDoc
  • PPT 生成
  • 思维导图
浏览知识工具 →

创意工具

把工作流从调研延伸到视觉呈现和可直接交付的 Office 成果。

  • 图像生成
  • 页面工具
  • Office 输出
浏览平台工具 →