如何用 scan_method: local_parser 把自己的抓取脚本接入 career-ops,让 scan.mjs 零 token 抓取公司招聘页

发布时间:2026/9/10 12:32:37
如何用 scan_method: local_parser 把自己的抓取脚本接入 career-ops,让 scan.mjs 零 token 抓取公司招聘页 如何用 scan_method: local_parser 把自己的抓取脚本接入 career-ops让 scan.mjs 零 token 抓取公司招聘页【免费下载链接】career-opsOpen-source AI job search: scan job portals, evaluate listings into a structured A-H report with a global 1-5 score, tailor your CV, track applications — runs locally in your AI coding CLI (Claude Code, Codex, OpenCode, Antigravity…)项目地址: https://gitcode.com/GitHub_Trending/ca/career-opscareer-ops 的scan.mjs默认用 Playwright 或 WebSearch 这类会消耗 LLM token 的方式发现职位。如果你的目标公司招聘页是 SSR/静态 HTML、有稳定的结构或文档化的接口可以自己写一个本地抓取脚本通过scan_method: local_parser接入扫描流程解析器作为本地命令运行把规范化后的职位 JSON 打到 stdoutscan.mjs的发现阶段就0 LLM tokens消耗只有规范化后的职位行进入后续 title 过滤、去重和 pipeline 输出流程。完整机制见 docs/local-parser-cookbook.md 和 providers/local-parser.mjs。什么情况下该用 local_parser按 docs/local-parser-cookbook.md 的说明满足以下条件时适合公司招聘页有稳定 HTML、SSR 渲染或有文档化的 endpoint本地解析比 Playwright 更容易脚本语言不限——JavaScript、Python、shell、Go 或机器上任何可执行运行时都行career-ops不自带公司专属解析脚本脚本由你提供portals.yml指向它。一个重要的边界如果某公司已经能被scan.mjs自动识别出 Greenhouse、Ashby 或 Lever 的公开 API通常不需要写解析器而 local parser 失败时scan.mjs会记录失败并对该公司回退到 API 路径而不是直接丢弃。准备条件已装好 career-ops 项目并能运行node scan.mjs脚本走npm run scan等价。按 templates/portals.example.yml 顶部说明先把该模板复制为项目根目录的portals.yml再编辑其中的title_filter和tracked_companies。你的抓取脚本必须放在项目目录内相对路径会相对项目根解析providers/local-parser.mjs 会拒绝解析到项目根之外的路径。第一步写一个满足 stdout 契约的抓取脚本解析器必须把下列三种 JSON 形状之一打印到 stdout文档示例来自 docs/local-parser-cookbook.md[ { title: Senior AI Engineer, url: https://example.com/jobs/123, location: Remote } ]{ jobs: [ { title: Senior AI Engineer, url: https://example.com/jobs/123, location: Remote } ] }{ results: [ { title: Senior AI Engineer, url: https://example.com/jobs/123, location: Remote } ] }字段要求title和url必填company可选缺省时扫描器使用tracked_companies条目的name相对 URL 会按careers_url解析成绝对地址。仓库里 tests/providers/_fixture-local-parser.mjs 是一个可直接参考的示例脚本它按参数打印上面契约的不同形状包括{ jobs: [...] }包裹和缺title/url会被丢弃的行。一个满足契约的最小脚本形态输出为文档示例数据真实脚本需要自己请求目标公司页面并解析// scripts/parsers/example-company-jobs.js console.log(JSON.stringify([ { title: Senior AI Engineer, url: https://example.com/jobs/123, location: Remote } ]));运行时还有几条硬约束来自 providers/local-parser.mjsparser.command必须是白名单解释器之一python3、python、node、deno、bun、sh、bash或者是项目内的一个文件不允许任意二进制。使用白名单解释器时脚本必须是解释器的第一个参数node --eval、python -c这类内联代码标志会被拒绝。脚本以项目根为 cwd 执行且不经过 shell 展开execFile所以args里的{careers_url}和{company}由scan.mjs在执行前做占位符替换careers_url必须是 http(s)公司名不能以-开头。默认超时 20 秒、stdout 缓冲上限 2 MB可用parser.timeout_ms和parser.max_buffer_bytes覆盖。stdout 不是合法 JSON 时抛错local parser returned invalid JSON。args是可选的公司专属脚本通常把源 URL、选择器、分页规则直接写死在脚本里用不到args只有想让一个脚本复用到多家公司时才通过args传{careers_url}/{company}之类的参数。第二步在 portals.yml 中注册解析器在portals.yml的tracked_companies:下为该公司添加一条目下面为文档示例值name、careers_url、脚本路径需替换成你自己的公司- name: Example Company careers_url: https://example.com/careers scan_method: local_parser parser: command: node script: scripts/parsers/example-company-jobs.js format: jobs-json-v1 enabled: truePython 脚本则把command换成python3、script换成.py路径见 templates/portals.example.yml 中注释掉的 JS/Python 示例。路由规则parser.commandparser.script都设置时local-parser优先于其他 provider 运行即先本地解析再谈 ATS API 回退。第三步用 validate:portals 离线校验配置先跑离线校验器再跑扫描。它不请求任何职位板只检查 YAML 形状、未知 provider、URL 格式和 local parser 块是否合法见 docs/SCRIPTS.md 的validate:portals一节npm run validate:portals退出码0表示没有错误允许有 warning1表示发现错误。如果配置有问题应在这一步就被拦下来而不是等到扫描时才报 parser 错误。第四步运行扫描并核对结果npm run scan # 等价于 node scan.mjsscan.mjs读取portals.yml中的目标公司把命中的职位输出到 stdout并可选追加到data/pipeline.md见 docs/SCRIPTS.md 的scan一节。退出码0扫描完成1配置错误或找不到portals.yml。判断接入是否成功按顺序看三点validate:portals退出码为0scan.mjs退出码为0且 stdout 出现目标公司的职位行运行汇总会统计本地解析器覆盖的公司数scan.mjs汇总中的N local parser有职位行且计数大于 0说明该公司走的是本地脚本而不是 Playwright/API 通道。如果解析器同时会写完整 JSON 快照用于调试或审计放到data/parser-output/{company}/下并把生成的 JSON 排除在 git 之外.gitkeep占位文件是唯一允许提交的例外。失败与回退行为本地 parser 失败若该公司同时存在可探测的 Greenhouse、Ashby 或 Lever API 源scan.mjs记录解析器失败后回退到 API 路径公司不会从扫描中消失此时运行信息里会带local parser failed, used API fallback说明。脚本路径或命令不安全detect()阶段解析不了调用未知命令、脚本不在项目内、缺失脚本、内联代码标志时该条目直接跳过报错信息如local-parser: path escapes the project root、local-parser: the parser script must be the interpreters first argument。在 agent 扫描模式下按 modes/scan.md 的规则Level 0local parser成功的公司进入local_parser_ok集合后agent 必须跳过该公司的 PlaywrightLevel 1和 APILevel 2Level 3 的 WebSearch 通用查询仍保留但过滤掉该公司命中也不应为已有 local parser 的公司另建专用search_queries。这就是 local_parser 省 token 的实际效果——防止模型重复抓取同一公司。脚本写好后接入就是一条固定链路脚本进项目目录 →portals.yml挂parser块 →validate:portals通过 →npm run scan以 0 token 完成该公司的发现。后续公司招聘页结构变化时只需改脚本本身portals.yml与扫描流程不用动。【免费下载链接】career-opsOpen-source AI job search: scan job portals, evaluate listings into a structured A-H report with a global 1-5 score, tailor your CV, track applications — runs locally in your AI coding CLI (Claude Code, Codex, OpenCode, Antigravity…)项目地址: https://gitcode.com/GitHub_Trending/ca/career-ops创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询