百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

下文件,抓网页,你常用的curl竟还有这功能!会的已经去大厂了

nanshan 2025-04-27 15:14 7 浏览 0 评论

引言

curl 是一个软件包,由命令行工具和使用URL语法传输数据的库组成。

curl 支持多种协议,如DICT、FILE、FTP、FTPS、Gopher、HTTP、HTTPS、IMAP、IMAPS、LDAP、LDAPS、POP3、POP3S、RTMP、RTSP、SCP、SFTP、SMTP、SMTPS、Telnet和TFTP。

本文用实例深度演示 curl 的详细用法。

下载单个文件

下面的命令将获取URL的内容并将其显示在STDOUT中(即在你的终端上)。

curl URL

要将输出存储到文件中,您可以将其重定向,如下所示。这还将显示一些额外的下载统计信息。

curl URL > output.html


将cURL输出保存到文件

我们可以使用-o/-O选项将curl命令的结果保存到文件中。

  • -o(小写o)结果将保存在命令行中提供的文件名中。
  • -O(大写O)将采用URL中的文件名,并将其用作存储结果的文件名
curl -o gettext.html URL

现在,页面URL将保存在名为“gettext.html”的文件中。你还会注意到,当使用-o选项运行curl时,它会显示下载的进度表。

当你使用curl-O(大写O)时,它会使用URL后缀文件名,并将内容保存在本地。

注意:当cURL必须将数据写入终端时,它会禁用进度表,以避免打印时的混乱。我们可以使用‘>’|‘-o’|‘-O’选项将结果移动到文件中


一次下载多个页面

通过在命令行上指定URL,我们可以一次下载多个文件。

curl -O URL1 -O URL2

下面的命令将下载a.html和b.html,并将其以对应的名称保存在当前目录下。

curl -O URL/a.html -O URL/b.html

当我们如上所述从同一服务器下载多个文件时,cURL将会尝试复用该连接。


使用-L选项跟随请求头HTTP Location

默认情况下,cURL不跟随HTTP Location标头。它也称为重定向

当请求的网页移动到另一个位置时,HTTP Location标头将作为响应发送,它将显示实际网页所在的位置。

例如,当用户在浏览器中键入a.com时,它将自动重定向到b.com。这是基于HTTP Location标头完成的,如下所示。

curl a.com

<TITLE>302 Moved</TITLE>
<H1>302 Moved</H1>
The document has moved
<A HREF="http://b.com">here</A>

上述信息也表明请求地址被永久重定向(302)到了其他地址。

我们可以使用-L选项坚持curl遵循重定向,使它下载最终的目标页面。

curl -L a.com


断点续传

使用curl-C选项,您可以继续下载由于某种原因已经停止的下载。当下载大文件,但网络被中断时,这将很有帮助。

如果我们使用“-C -”选项,那么cURL将找到断点并开始恢复下载

我们还可以给出一个偏移量‘-C<偏移量>’。将从源文件的开头跳过给定的偏移量字节

下面测试一下。使用curl开始大文件的下载,然后在下载之间按Ctrl-C组合键停止下载。

curl -O URL
##############             42.1%

下面额#表示进度条,下载停止在42.1%。

使用“curl -C -”,我们可以从前面停止的地方继续下载。现在,下载进度将从42.1%继续。

curl -C - -O URL
###############            42.1%


限制下载速度

你可以使用-limit-rate选项限制数据的传输量,将最大传输速率指定为参数。

 curl --limit-rate 50k -O UTL

上述命令将数据传输限制为50kb/秒。在短时间内,curl可以使用较高的传输速率。但平均而言,它将达到50kb/秒左右。可以使用大文件进行速度测试。


仅当文件在给定时间之前/之后被修改时才下载

我们可以使用curl中的-z选项获取在特定时间之后修改的文件。这对FTP和HTTP都有效。

curl -z 2012-03-04 URL

上述命令仅当URL文件晚于给定日期和时间时,上述命令才会下载。

curl -z -2012-03-04 URL

上述命令正好反过来,仅当URL文件早于给定日期时间才进行下载。

有关日期表达式支持的各种语法,请参考 man curl_getdate。


在cURL中传递HTTP身份验证

有时,网站需要用户名和密码才能查看内容(可以使用.htaccess文件)。在-u选项的帮助下,我们可以将这些凭据从cURL传递到Web服务器,如下所示。

curl -u username:password URL

默认情况下,cURL使用基本HTTP身份验证,我们可以使用-ntlm | -digest指定其他身份验证方法。


从FTP服务器下载资源

cURL还可以用于从FTP服务器下载文件。如果给定的FTP路径是目录,则默认情况下将列出特定目录下的文件。

curl -u user:password -O ftp://ftp_server/path/to/file/readme

上述命令将会直接下载FTP服务器上的readme文件。

curl -u user:password -O ftp://ftp_server/path/to/file/

上述命令则罗列出该目录下所有的目录和文件。


模糊匹配下载路径

cURL支持URL中给定的范围。当给定范围时,将下载该范围内匹配的文件。从FTP镜像站点下载软件包会很有帮助。

 curl ftp://ftp_server/path/to/dest/[a-z]/

这样会罗列出所有从dest/a/ 到 dest/z/ 目录下的所有文件和目录。


上传文件到FTP服务器

cURL还可以用于通过-T选项将文件上传到FTP服务器。

curl -u user:password -T build.tar.gz ftp://ftp_server/path/to/dest/

上述命令把压缩包 build.tar.gz 推送到FTP服务器目录。

curl -u user:password -T "{file1,file2}" ftp://ftp_server/

上述命令则是上传多个文件到FTP服务器。

还有一个黑魔法,就是“-”,使用管道处理,获取stdin信息流,并经由cURL上传到FTP服务器。

echo blablabla | curl -u user:password -T - ftp://ftp_server/path/summary.log


更详细的输出

Linux下的同学应该很熟悉,多加几个-v就可以了。cURL也是如此。

curl -vvv URL

加到3个-v,请求的握手过程都给打印出来了。


通过代理下载文件

我们可以使用-x选项指定curl来使用代理执行特定的操作,需要指定代理的主机和端口。

curl -x proxy_ip:port URL

使用长选项更好记。

curl --proxy proxy_ip:port URL


使用SMTP协议发邮件

cURL还可用于通过SMTP协议发送邮件。你应该指定发件人地址、收件人地址和邮件服务器IP地址,如下所示。

curl --mail-from foo@bar.com --mail-rcpt foo@bar.com smtp://mailserver.com

一旦输入上述命令,它将等待用户向邮件提供数据。编写完消息后,请键入.(英文句号)作为最后一行,将立即发送电子邮件。

Subject: Testing
This is a test mail
.


写在最后

cURL提供的能力,不亚于生态完整的浏览器,更多用法等你来使用。

相关推荐

实战派 | Java项目中玩转Redis6.0客户端缓存

铺垫首先介绍一下今天要使用到的工具Lettuce,它是一个可伸缩线程安全的redis客户端。多个线程可以共享同一个RedisConnection,利用nio框架Netty来高效地管理多个连接。放眼望向...

轻松掌握redis缓存穿透、击穿、雪崩问题解决方案(20230529版)

1、缓存穿透所谓缓存穿透就是非法传输了一个在数据库中不存在的条件,导致查询redis和数据库中都没有,并且有大量的请求进来,就会导致对数据库产生压力,解决这一问题的方法如下:1、使用空缓存解决对查询到...

Redis与本地缓存联手:多级缓存架构的奥秘

多级缓存(如Redis+本地缓存)是一种在系统架构中广泛应用的提高系统性能和响应速度的技术手段,它综合利用了不同类型缓存的优势,以下为你详细介绍:基本概念本地缓存:指的是在应用程序所在的服务器内...

腾讯云国际站:腾讯云服务器如何配置Redis缓存?

本文由【云老大】TG@yunlaoda360撰写一、安装Redis使用包管理器安装(推荐)在CentOS系统中,可以通过yum包管理器安装Redis:sudoyumupdate-...

Spring Boot3 整合 Redis 实现数据缓存,你做对了吗?

你是否在开发互联网大厂后端项目时,遇到过系统响应速度慢的问题?当高并发请求涌入,数据库压力剧增,响应时间拉长,用户体验直线下降。相信不少后端开发同行都被这个问题困扰过。其实,通过在SpringBo...

【Redis】Redis应用问题-缓存穿透缓存击穿、缓存雪崩及解决方案

在我们使用redis时,也会存在一些问题,导致请求直接打到数据库上,导致数据库挂掉。下面我们来说说这些问题及解决方案。1、缓存穿透1.1场景一个请求进来后,先去redis进行查找,redis存在,则...

Spring boot 整合Redis缓存你了解多少

在前一篇里面讲到了Redis缓存击穿、缓存穿透、缓存雪崩这三者区别,接下来我们讲解Springboot整合Redis中的一些知识点:之前遇到过,有的了四五年,甚至更长时间的后端Java开发,并且...

揭秘!Redis 缓存与数据库一致性问题的终极解决方案

在现代软件开发中,Redis作为一款高性能的缓存数据库,被广泛应用于提升系统的响应速度和吞吐量。然而,缓存与数据库之间的数据一致性问题,一直是开发者们面临的一大挑战。本文将深入探讨Redis缓存...

高并发下Spring Cache缓存穿透?我用Caffeine+Redis破局

一、什么是缓存穿透?缓存穿透是指查询一个根本不存在的数据,导致请求直接穿透缓存层到达数据库,可能压垮数据库的现象。在高并发场景下,这尤其危险。典型场景:恶意攻击:故意查询不存在的ID(如负数或超大数值...

Redis缓存三剑客:穿透、雪崩、击穿—手把手教你解决

缓存穿透菜小弟:我先问问什么是缓存穿透?我听说是缓存查不到,直接去查数据库了。表哥:没错。缓存穿透是指查询一个缓存中不存在且数据库中也不存在的数据,导致每次请求都直接访问数据库的行为。这种行为会让缓存...

Redis中缓存穿透问题与解决方法

缓存穿透问题概述在Redis作为缓存使用时,缓存穿透是常见问题。正常查询流程是先从Redis缓存获取数据,若有则直接使用;若没有则去数据库查询,查到后存入缓存。但当请求的数据在缓存和数据库中都...

Redis客户端缓存的几种实现方式

前言:Redis作为当今最流行的内存数据库和缓存系统,被广泛应用于各类应用场景。然而,即使Redis本身性能卓越,在高并发场景下,应用于Redis服务器之间的网络通信仍可能成为性能瓶颈。所以客户端缓存...

Nginx合集-常用功能指导

1)启动、重启以及停止nginx进入sbin目录之后,输入以下命令#启动nginx./nginx#指定配置文件启动nginx./nginx-c/usr/local/nginx/conf/n...

腾讯云国际站:腾讯云怎么提升服务器速度?

本文由【云老大】TG@yunlaoda360撰写升级服务器规格选择更高性能的CPU、内存和带宽,以提供更好的处理能力和网络性能。优化网络配置调整网络接口卡(NIC)驱动,优化TCP/IP参数...

雷霆一击服务器管理员教程

本文转载莱卡云游戏服务器雷霆一击管理员教程(搜索莱卡云面版可搜到)首先你需要给服务器设置管理员密码,默认是空的管理员密码在启动页面进行设置设置完成后你需要重启服务器才可生效加入游戏后,点击键盘左上角E...

取消回复欢迎 发表评论: