
【免费下载链接】skillsBrowser automation CLI built for AI agents. Break through anti-bot walls, hand off to humans across platforms when stuck. Parallel multi-task execution, independent multi-session operation, isolated multi-account browsing.项目地址https://gitcode.com/gh_mirrors/skills31/skills点击查看免费下载本文围绕 skills 仓库中 youtube-transcript-extractor-api-skill 展开讲解如何借助 BrowserAct 的 YouTube Transcript Extractor API 工作流模板仅凭一个TargetURL就完成整段视频字幕transcript与视频元数据的自动化提取。文章从脚本源码出发还原 API 调用链完整覆盖 API Key 配置、参数说明、运行监控、输出字段与错误重试策略并给出与批量提取、内容分析、本地 DOM 提取等配套技能的选型矩阵让 Agent 与开发者都能即读即用、直接接入自己的摘要管线或数据集构建流程。一、技能定位与典型应用场景该 Skill 位于 solutions/video-platforms/youtube-transcript-extractor-api-skill是 Solutions Catalog 中Video Platforms分类下的预构建技能之一。它面向的核心诉求是在不打开浏览器、不手写爬虫、不做人机验证的情况下拿到 YouTube 视频的完整字幕和结构化元数据。从技能元数据description可以归纳出它应被主动触发的典型场景提取某条指定 YouTube 视频的完整字幕full transcript获取字幕与元数据用于视频内容分析、AI 摘要、媒体研究抓取视频标题与点赞数、从视频 URL 反查频道信息将字幕沉淀进企业内部知识库或构建由视频字幕组成的结构化数据集为 AI 摘要 pipeline 提供无需观看视频即可总结的文本输入。一句话概括输入一个视频链接输出可直接投喂给 LLM 的干净字幕文本 结构化元数据。二、核心特性与设计思路原文档给出了该技能的五个核心特性这五点是选择API 模板方案而非纯 AI 驱动浏览器自动化的关键依据特性说明无幻觉No hallucinations使用预置工作流pre-set workflow完成真实浏览器内提取避免生成式 AI 在编造字幕/数据时的幻觉问题数据稳定准确无验证码困扰无需处理 reCAPTCHA 或其他验证挑战字幕页面的访问与抓取由 BrowserAct 云端真实浏览器完成无 IP 地域限制无需应对地区性 IP 封锁或地理围栏geofencing字幕获取不受访问者地区影响执行更快相比纯 AI 驱动的浏览器自动化方案任务执行速度明显更快高性价比相比消耗大量 token 的 AI 方案显著降低数据获取成本从仓库 README.md 的为什么选择 BrowserAct一节可以看出这套设计背后的整体架构BrowserAct 通过三层渐进式抗封锁环境层的隐身指纹/TLS 轮换/代理切换、执行层的solve-captcha与stealth-extract、人工层的remote-assist让真实浏览器任务稳定落地。本技能正是把YouTube 字幕页提取这个高频操作固化成了云端模板用户侧只提交参数、轮询状态、取回结果复杂度全部被封装在模板内部。三、工作原理脚本背后的 API 调用链Skill 的核心可执行脚本是 scripts/youtube_transcript_extractor_api.py。它的任务不是自己在本地驱动浏览器而是调用 BrowserAct 云端工作流 API 并轮询任务状态。从源码可以还原出完整的调用链1. 配置常量脚本头部TEMPLATE_ID 87197468034420377 API_BASE_URL https://api.browseract.com/v2/workflowTEMPLATE_ID是 YouTube Transcript Extractor 工作流模板的 ID脚本据此定位云端预置的提取流程API_BASE_URL是 BrowserAct 工作流 API 的根地址所有请求都基于它拼接端点。脚本还通过io.TextIOWrapper强制将标准输出/错误流设为 UTF-8 编码源码 L9-L11保证中文字幕等非 ASCII 内容在终端中正确打印——这是处理多语言字幕时容易被忽略、但很关键的一步。2. 三段式执行流程脚本主体函数run_youtube_transcript_extractor_task(api_key, target_url)严格按照启动 → 轮询 → 取结果三段执行阶段一启动任务run-task-by-templatepayload { workflow_template_id: TEMPLATE_ID, input_parameters: [ {name: TargetURL, value: target_url} ] } res requests.post(f{API_BASE_URL}/run-task-by-template, jsonpayload, headersheaders, timeout30).json()携带Authorization: Bearer {api_key}请求头把用户提供的TargetURL作为input_parameters提交。若响应中没有id字段则区分Invalid authorizationKey 失效与一般失败分别报错源码 L37-L42。阶段二轮询任务状态get-task-status启动成功后拿到task_id脚本以10 秒间隔循环查询get-task-status?task_id{task_id}每次请求超时上限 30 秒总轮询窗口max_poll_time 300秒源码 L48-L74。状态机判定如下finished→ 跳出循环进入取结果阶段failed/canceled→ 打印错误并返回None提示去 BrowserAct 后台查看其他状态如running→ 继续轮询单次轮询请求异常 → 打印Polling error后继续重试超过 300 秒仍未结束 → 打印超时错误并返回None。每次轮询都会打印带时间戳的日志[HH:MM:SS] Task Status: {status}这就是原文档强调的运行状态监控信息的来源。阶段三获取结果get-tasktask_info requests.get(f{API_BASE_URL}/get-task?task_id{task_id}, ...).json() output task_info.get(output, {}) result_string output.get(string)优先读取output.string作为最终结果若该字段为空则退而求其次返回整个task_info的 JSON 序列化文本源码 L76-L89。主程序最终把结果原样打印到终端供 Agent 解析与转发。从源码结构看这套云端执行 本地轮询的模式意味着本地只承担参数提交与结果读取真正的浏览器操作、字幕面板展开、数据解析全部发生在云端模板内因此本地既不需要维护浏览器会话也不需要处理反爬对抗。四、前置条件与 API Key 配置运行环境要求技能元数据metadata.openclaw.requires声明了两项硬性依赖bins:python—— 需要可用的 Python 运行环境及requests库仓库根目录的 requirements.txt 可用于安装依赖env:BROWSERACT_API_KEY—— 必须预先配置 BrowserAct API Key 环境变量。API Key 获取与检查流程原文档明确要求运行前必须先检查BROWSERACT_API_KEY环境变量未设置时不得执行任何其他操作Agent 应停下并请求用户提供 Key。脚本侧也做了同样的强制校验源码 L98-L104Key 缺失时直接打印错误与三步指引打开 BrowserAct 控制台的 Integrations 页面 → 复制 Key → 配置为环境变量并退出。配置方式Linux/macOS bashexport BROWSERACT_API_KEYyour_key_here python -u ./scripts/youtube_transcript_extractor_api.py TargetURL若使用.env或 Agent 平台的环境变量配置界面原理相同——脚本只在进程环境变量中读取os.getenv(BROWSERACT_API_KEY)见 源码 L92。五、输入参数详解该技能只需一个输入参数由 Agent 根据用户需求解析后作为命令行位置参数传入参数类型说明示例TargetURL目标 URLstring需要提取字幕与元数据的 YouTube 视频地址https://www.youtube.com/watch?vst534T7-mdE需要注意的细节脚本通过sys.argv[1]接收该参数且要求len(sys.argv) 2否则打印Usage: python youtube_transcript_extractor_api.py target_url并退出源码 L94-L96示例中的watch?v长链是标准形态youtu.be短链等变体理论上同样可被云端模板处理但以仓库文档给出的watch?v形态为最稳妥的输入Agent 应从用户需求提取这个视频的字幕、总结这条视频等中识别并校验 URL 属于 YouTube 视频页面再执行脚本。六、使用方法与运行监控一行命令获取结果原文档推荐 Agent 直接执行独立脚本实现一条命令拿到结果# 示例调用 python -u ./scripts/youtube_transcript_extractor_api.py TargetURL例如python -u ./scripts/youtube_transcript_extractor_api.py https://www.youtube.com/watch?vst534T7-mdE命令中的-u用于强制无缓冲输出保证长任务期间的状态日志能实时出现在终端避免因缓冲导致看似卡住的误判。运行状态监控重要由于任务包含云端真实浏览器操作整体耗时可能达到数分钟。脚本会在运行期间持续输出带时间戳的状态日志例如[14:30:05] Task Status: running [14:30:15] Task Status: running [14:30:25] Task Status: finished原文档对 Agent 给出了三条明确的监控纪律等待结果期间要持续观察终端输出只要终端仍在输出新的状态日志就说明任务运行正常不要误判为死锁或卡死只有当状态长时间不再变化、或脚本在无结果的情况下停止输出时才考虑触发重试机制。这套监控逻辑与源码中的轮询设计一一对应日志由[L56-L57](https://link.gitcode.com/i/0e4b52e0deecab05984339ae0716b006#L56-L57)的时间戳打印产生而长时间无变化则与 300 秒总轮询上限、10 秒轮询间隔相关——Agent 可据此判断是正常等待还是需要介入。七、输出数据说明任务成功后脚本会直接从 API 响应中解析并打印结果。返回内容包含以下字段字段含义video_titleYouTube 视频标题video_url原视频的直接链接publisher发布该视频的频道名称channel_link发布者频道的 URLvideo_likes_count视频获得的点赞数transcript提取到的完整字幕/转写文本一个典型的返回结构示意{ video_title: …, video_url: https://www.youtube.com/watch?v…, publisher: …, channel_link: https://www.youtube.com/…, video_likes_count: 1234, transcript: …完整字幕文本… }对 Agent 而言transcript字段是后续一切工作摘要、章节切分、内容分析、知识库入库的原材料video_title、publisher、channel_link、video_likes_count则是结构化元数据可直接写入数据集或用作分析上下文。八、错误处理与重试策略原文档规定了一套明确的错误分级逻辑脚本源码在启动任务阶段就已对两类典型错误做了初步区分源码 L37-L42。Agent 收到输出后的完整判定流程如下1. 检查输出内容若输出包含Invalid authorization说明 API Key 无效或已过期。不要重试引导用户检查并提供正确的 Key若输出不含Invalid authorization但任务执行失败例如输出以Error:开头或返回空结果Agent 应自动再执行一次脚本这通常能覆盖网络波动等瞬时故障。2. 重试上限自动重试仅限一次若第二次尝试仍然失败停止重试向用户报告具体的错误信息。结合源码还可以补充两个超时场景的判定依据轮询超时Task polling timed out after 300 seconds表示云端任务在 5 分钟内未结束属于任务级异常应检查 BrowserAct 后台任务面板状态终止Task failed/canceled表示云端任务被终止同样需要到后台查看具体原因。九、单视频之外配套技能矩阵与选型建议本技能解决的是单条视频、手动指定 URL的字幕提取。围绕同一主题仓库的 solutions/video-platforms 目录还提供了三个互补技能可按需求选型技能模式适用场景youtube-transcript-extractor-api-skill本文API 模板 · 单视频用户给出明确视频 URL要字幕 元数据youtube-batch-transcript-extractor-api-skillAPI 模板 · 批量只给关键词 上传时间过滤Today / This week / This month / This year 数量上限默认 5批量拉取多条视频字幕与元数据适合建数据集youtube-transcript-analysis-api-skillAPI 模板 · 提取 分析单视频 / 关键词批量两种模式提取后由 Agent 做 8 维度竞品内容分析钩子、信息架构、受众画像、痛点、转化策略、内容空白等youtube-transcript本地 DOM 提取通过 browser-act 命令在本地浏览器中打开字幕面板、按时间戳分段提取再重排为摘要/章节/X Thread/博文/金句适合深度内容再利用选型建议只要用户给的是具体链接且诉求是拿字幕 元数据首选本文的 extractor 技能诉求是按关键词批量收集则用 batch 技能诉求是拿字幕做竞品分析则用 analysis 技能诉求是在本地浏览器中逐段提取并重排成文章则用 youtube-transcript 技能。十、实战建议与扩展思路先用短视频验证链路正式批量前先用 12 条短视频跑通配置 Key → 执行 → 取回结果确认输出字段完整后再进入生产流程接入 AI 摘要管线脚本输出的transcript可直接作为 LLM 输入构建视频链接 → 字幕 → 摘要/章节/要点的无缝 pipeline无需人工观看视频知识库与数据集构建将transcript与video_title、publisher、channel_link、video_likes_count一起落库即可形成带元数据的视频内容数据集供检索与二次分析与批量技能组合扩容当单条提取跑通后可切换到 batch 技能按关键词批量拉取配合Datelimit参数控制规模小值快速测试大值批量采集注意字幕质量边界自动生成字幕ASR在部分视频上准确率可能低于人工字幕用于分析类任务时应留意文本质量涉及登录权限的视频字幕可能无法获取这类限制与原文档中的可提取范围一致应如实告知用户。综上该技能把YouTube 字幕提取这个高频、易碎的操作封装为一次 API 调用Agent 只需保证BROWSERACT_API_KEY就位、传递TargetURL、耐心监控带时间戳的状态日志即可稳定获得干净的字幕文本与结构化元数据再叠加批量化、内容分析与本地重排版等配套技能构成一套完整的 YouTube 视频内容采集与加工体系。赞分享【免费下载链接】skillsBrowser automation CLI built for AI agents. Break through anti-bot walls, hand off to humans across platforms when stuck. Parallel multi-task execution, independent multi-session operation, isolated multi-account browsing.项目地址https://gitcode.com/gh_mirrors/skills31/skills点击查看免费下载相关推荐BrowserAct 批量提取 YouTube 字幕与元数据youtube-batch-transcript-extractor-api-skill 实战指南BrowserAct 批量提取 YouTube 字幕与元数据youtube batch transcript extractor api skill 实战指南基于 BrowserAct Workflow API 的 YouTube 频道数据批量提取实战指南youtube-channel-api-skill基于 BrowserAct Workflow API 的 YouTube 频道数据批量提取实战指南youtube channel api skill 导读视频转Markdown革命用markitdown实现YouTube字幕与元数据一键提取视频转Markdown革命用markitdown实现YouTube字幕与元数据一键提取 你是否还在手动复制YouTube视频字幕是否为整理视频元数据而烦恼人工智能AI 应用MCP 服务上一篇RPFM全局搜索实战指南用正则在数百MB的Pack文件中秒级定位任意文本下一篇Securo快速开始教程5行命令搭建完全免费的自托管个人理财中心创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考