先分清再动手
给一个起始地址和几层深度,工具顺着链接找文件,适合把公开目录里的素材一次性拉完。
工具监视浏览器的网络请求,把媒体地址抛出来给你下,能不能抓到取决于站点怎么传输。
两者都依赖链接可被直接访问。需要登录、需要校验令牌的地址,工具拿到的往往也是失效的。
加密分段、动态生成地址、需要专门播放器解码的内容,这两项能力都无能为力。
填你要抓的那个目录页,不要填站点首页,范围会失控。
一般设一到两层就够,层数越多抓到的无关文件越多。
只保留需要的扩展名,例如只要压缩包和图片,其余全部排除。
把网页文件、脚本、样式表这些排除掉,抓到的结果会干净很多。
三条规则覆盖多数场景
明确列出要的几种,比列出不要的可靠。
按体积下限过滤,能挡掉缩略图和占位文件。
限制只抓同一个域名下的文件,避免跟到站外去。
先用预览功能看看列表里都是什么,再决定要不要开始。
| 现象 | 原因 | 替代做法 |
|---|---|---|
| 媒体列表是空的 | 播放器用了加密或动态地址 | 换用支持录制的工具 |
| 下载的视频是碎片 | 站点按小片段传输 | 下载全部分片后合并 |
| 下到一半提示失效 | 地址带时效令牌 | 重新抓一次新的地址 |
| 抓到大量无关文件 | 过滤规则没设 | 补上扩展名与体积限制 |
| 速度极慢 | 同域并发过高被限速 | 降低并发数再试 |
批量抓取会不会把站点拖垮?
并发数设得过大确实会给对方造成压力,也会触发限速,适度就好。
抓下来的文件能直接看吗?
分片格式的媒体需要先合并,合并工具在下载列表里就能调出来。
规则写错了怎么改?
把任务停掉改规则重跑,已下好的文件可以跳过重复下载。
能抓需要登录的页面吗?
工具会带上浏览器的会话信息,会话过期后就抓不到了,需要重新登录再抓。