|
|
1
1085
避免下载自动生成的
|
|
|
2
136
要递归下载一个目录,该目录拒绝index.html*文件,下载时不包含主机名、父目录和整个目录结构:
|
|
|
3
124
对于其他有类似问题的人。工作组如下
http://www.gnu.org/software/wget/manual/html_node/Robot-Exclusion.html |
|
|
4
42
您应该使用-m(mirror)标志,因为这会注意不要弄乱时间戳并无限期地递归。
如果您在该线程中添加其他人提到的点,则将是:
|
|
|
5
40
|
|
|
6
8
如果
目录结构:
你想下载吗
|
|
|
7
7
对我有用。 也许您有一个.wgetrc干扰了它? |
|
|
8
5
要使用用户名和密码递归获取目录,请使用以下命令:
|
|
|
9
3
用法:
|
|
|
10
3
你只需要两个旗子,一个是
它只会将您的文件树下载到
事实上,我从这个答案中得到的第一行正是从 wget manual ,他们在第4.3节末尾有一个非常清晰的例子。 |
|
|
11
3
wget-nd-np-P/dest/dir——递归 http://url/dir1/dir2
|
|
12
2
WGET1.18可能工作得更好,例如,我被1.12版的bug咬了一口,其中。。。
…仅检索index.html而不是所有文件。 解决方法是注意到一些301重定向并尝试新的位置–给定新的URL,wget获得目录中的所有文件。 |
|
|
13
2
首先,感谢所有发布答案的人。下面是我递归下载网站的“终极”wget脚本:
stripping the query params
从URL像
此外,如果你正试图建立一个网站,可能很快就会关闭,你应该 get in touch with the ArchiveTeam 并要求他们将您的网站添加到他们的ArchiveBot队列中。 |
|
|
14
1
递归wget忽略机器人(用于网站)
-e robots=off使其忽略该域的robots.txt -r使其递归 -np=没有父文件夹,因此它不跟踪父文件夹的链接 |
|
|
15
0
您只需添加一个-r就可以做到这一点
|
|
|
16
0
听起来你好像想得到你文件的镜像。虽然
尊敬
|
|
Brian · wget`--拒绝regex`不工作? 8 年前 |
|
|
user9269628 · wget:下载具有特定名称的文件 8 年前 |
|
|
John Michael · 检查ftp文件是否存在并分析退出代码 8 年前 |
|
|
dabbler · wget与浏览器获取的图像不同 8 年前 |