百度360必应搜狗淘宝本站头条
当前位置:网站首页 > 技术文章 > 正文

下文件,抓网页,你常用的curl竟还有这功能!会的已经去大厂了

nanshan 2025-04-27 15:14 15 浏览 0 评论

引言

curl 是一个软件包,由命令行工具和使用URL语法传输数据的库组成。

curl 支持多种协议,如DICT、FILE、FTP、FTPS、Gopher、HTTP、HTTPS、IMAP、IMAPS、LDAP、LDAPS、POP3、POP3S、RTMP、RTSP、SCP、SFTP、SMTP、SMTPS、Telnet和TFTP。

本文用实例深度演示 curl 的详细用法。

下载单个文件

下面的命令将获取URL的内容并将其显示在STDOUT中(即在你的终端上)。

curl URL

要将输出存储到文件中,您可以将其重定向,如下所示。这还将显示一些额外的下载统计信息。

curl URL > output.html


将cURL输出保存到文件

我们可以使用-o/-O选项将curl命令的结果保存到文件中。

  • -o(小写o)结果将保存在命令行中提供的文件名中。
  • -O(大写O)将采用URL中的文件名,并将其用作存储结果的文件名
curl -o gettext.html URL

现在,页面URL将保存在名为“gettext.html”的文件中。你还会注意到,当使用-o选项运行curl时,它会显示下载的进度表。

当你使用curl-O(大写O)时,它会使用URL后缀文件名,并将内容保存在本地。

注意:当cURL必须将数据写入终端时,它会禁用进度表,以避免打印时的混乱。我们可以使用‘>’|‘-o’|‘-O’选项将结果移动到文件中


一次下载多个页面

通过在命令行上指定URL,我们可以一次下载多个文件。

curl -O URL1 -O URL2

下面的命令将下载a.html和b.html,并将其以对应的名称保存在当前目录下。

curl -O URL/a.html -O URL/b.html

当我们如上所述从同一服务器下载多个文件时,cURL将会尝试复用该连接。


使用-L选项跟随请求头HTTP Location

默认情况下,cURL不跟随HTTP Location标头。它也称为重定向

当请求的网页移动到另一个位置时,HTTP Location标头将作为响应发送,它将显示实际网页所在的位置。

例如,当用户在浏览器中键入a.com时,它将自动重定向到b.com。这是基于HTTP Location标头完成的,如下所示。

curl a.com

<TITLE>302 Moved</TITLE>
<H1>302 Moved</H1>
The document has moved
<A HREF="http://b.com">here</A>

上述信息也表明请求地址被永久重定向(302)到了其他地址。

我们可以使用-L选项坚持curl遵循重定向,使它下载最终的目标页面。

curl -L a.com


断点续传

使用curl-C选项,您可以继续下载由于某种原因已经停止的下载。当下载大文件,但网络被中断时,这将很有帮助。

如果我们使用“-C -”选项,那么cURL将找到断点并开始恢复下载

我们还可以给出一个偏移量‘-C<偏移量>’。将从源文件的开头跳过给定的偏移量字节

下面测试一下。使用curl开始大文件的下载,然后在下载之间按Ctrl-C组合键停止下载。

curl -O URL
##############             42.1%

下面额#表示进度条,下载停止在42.1%。

使用“curl -C -”,我们可以从前面停止的地方继续下载。现在,下载进度将从42.1%继续。

curl -C - -O URL
###############            42.1%


限制下载速度

你可以使用-limit-rate选项限制数据的传输量,将最大传输速率指定为参数。

 curl --limit-rate 50k -O UTL

上述命令将数据传输限制为50kb/秒。在短时间内,curl可以使用较高的传输速率。但平均而言,它将达到50kb/秒左右。可以使用大文件进行速度测试。


仅当文件在给定时间之前/之后被修改时才下载

我们可以使用curl中的-z选项获取在特定时间之后修改的文件。这对FTP和HTTP都有效。

curl -z 2012-03-04 URL

上述命令仅当URL文件晚于给定日期和时间时,上述命令才会下载。

curl -z -2012-03-04 URL

上述命令正好反过来,仅当URL文件早于给定日期时间才进行下载。

有关日期表达式支持的各种语法,请参考 man curl_getdate。


在cURL中传递HTTP身份验证

有时,网站需要用户名和密码才能查看内容(可以使用.htaccess文件)。在-u选项的帮助下,我们可以将这些凭据从cURL传递到Web服务器,如下所示。

curl -u username:password URL

默认情况下,cURL使用基本HTTP身份验证,我们可以使用-ntlm | -digest指定其他身份验证方法。


从FTP服务器下载资源

cURL还可以用于从FTP服务器下载文件。如果给定的FTP路径是目录,则默认情况下将列出特定目录下的文件。

curl -u user:password -O ftp://ftp_server/path/to/file/readme

上述命令将会直接下载FTP服务器上的readme文件。

curl -u user:password -O ftp://ftp_server/path/to/file/

上述命令则罗列出该目录下所有的目录和文件。


模糊匹配下载路径

cURL支持URL中给定的范围。当给定范围时,将下载该范围内匹配的文件。从FTP镜像站点下载软件包会很有帮助。

 curl ftp://ftp_server/path/to/dest/[a-z]/

这样会罗列出所有从dest/a/ 到 dest/z/ 目录下的所有文件和目录。


上传文件到FTP服务器

cURL还可以用于通过-T选项将文件上传到FTP服务器。

curl -u user:password -T build.tar.gz ftp://ftp_server/path/to/dest/

上述命令把压缩包 build.tar.gz 推送到FTP服务器目录。

curl -u user:password -T "{file1,file2}" ftp://ftp_server/

上述命令则是上传多个文件到FTP服务器。

还有一个黑魔法,就是“-”,使用管道处理,获取stdin信息流,并经由cURL上传到FTP服务器。

echo blablabla | curl -u user:password -T - ftp://ftp_server/path/summary.log


更详细的输出

Linux下的同学应该很熟悉,多加几个-v就可以了。cURL也是如此。

curl -vvv URL

加到3个-v,请求的握手过程都给打印出来了。


通过代理下载文件

我们可以使用-x选项指定curl来使用代理执行特定的操作,需要指定代理的主机和端口。

curl -x proxy_ip:port URL

使用长选项更好记。

curl --proxy proxy_ip:port URL


使用SMTP协议发邮件

cURL还可用于通过SMTP协议发送邮件。你应该指定发件人地址、收件人地址和邮件服务器IP地址,如下所示。

curl --mail-from foo@bar.com --mail-rcpt foo@bar.com smtp://mailserver.com

一旦输入上述命令,它将等待用户向邮件提供数据。编写完消息后,请键入.(英文句号)作为最后一行,将立即发送电子邮件。

Subject: Testing
This is a test mail
.


写在最后

cURL提供的能力,不亚于生态完整的浏览器,更多用法等你来使用。

相关推荐

轻量级分析利器再升级:解读 DuckDB 1.3.0 新特性

DuckDB团队近日正式发布了最新版本——DuckDB1.3.0,代号“Ossivalis”。此次版本以金眼鸭的远古祖先BucephalaOssivalis命名,象征项目在演化和成长过...

C++跨平台编译的终极奥义:用Docker把环境差异按在地上摩擦

"代码在本地跑得飞起,一上服务器就coredump?"——每个C++程序员都经历过的《编译器的复仇》事件!大家好,我是Henry,废话少说,今天来简单谈一下跨平台编译的那些事儿,...

全网最全-Version Script以及__asm__((&quot;.symver xxx&quot;))使用总结

首先提醒一点,一切的前提建立在你的名字必须要mangling,不然无论你写的versionscript还是__asm__都不会起任何效果VersionScript简单用法:这是一个典型例子,这个例...

Ubuntu 25.04 Beta发布:Linux 6.14内核

IT之家3月28日消息,Canonical昨日(3月27日)放出了Beta版Ubuntu25.04系统镜像,代号“PluckyPuffin”,稳定版预估将于2025年...

不同平台CRT的区别?什么是UCRT?如何看libc源代码?

若文章对您有帮助,欢迎关注程序员小迷。助您在编程路上越走越好!CRT运行时库C标准规定例如输入输出函数、字符串函数、内存操作等接口,一般采用C运行时库实现。微软的CRT微软有两套CRT,早期的MS...

信创力量,中兴绽放——中兴新支点桌面操作系统安装与使用全攻略

原文链接:「链接」Hello,大家好啊,今天给大家带来一篇中兴新支点桌面操作系统安装使用的文章,欢迎大家分享点赞,点个在看和关注吧!中兴新支点桌面操作系统是一款基于Linux内核、面向政企和信创环...

Linux下安装常用软件都有哪些?做了一个汇总列表,你看还缺啥?

1.安装列表MySQL5.7.11Java1.8ApacheMaven3.6+tomcat8.5gitRedisNginxpythondocker2.安装mysql1.拷贝mysql安装文件到...

一篇文章解决Linux系统安全问题排查,另配实操环境

实操地址:https://www.skillup.host/1/linux/safe/command.md#Linux安全检查排查指南##1.系统账户安全检查###1.1检查异常账户``...

程序员必备的学习笔记《TCP/IP详解(一)》

为什么会有TCP/IP协议在世界上各地,各种各样的电脑运行着各自不同的操作系统为大家服务,这些电脑在表达同一种信息的时候所使用的方法是千差万别。就好像圣经中上帝打乱了各地人的口音,让他们无法合作一样...

《Linux常用命令》(linux的常用命令总结)

一、文件与目录操作1.目录导航pwd:显示当前工作目录路径示例:pwd关键词:当前路径、工作目录cd:切换目录示例:cd/home/user#切换到绝对路径cd..#...

Kubernetes 教程之跟着官方文档从零搭建 K8S

前言本文将带领读者一起,参照者Kubernetes官方文档,对其安装部署进行讲解.Kubernetes更新迭代很快,书上、网上等教程可能并不能适用于新版本,但官方文档能.阅读这篇文章你...

电脑网卡坏了怎么修复(电脑网卡坏了怎么修复win7系统)

当电脑网卡出现故障时,无论是有线网络还是无线网络,都可能无法正常连接。下面从软件、硬件等方面,分步骤为你介绍排查与修复的解决方案。一、初步排查:锁定问题源头检查网络环境将手机、平板等其他设备连接至同一...

如何查询电脑/手机的物理地址(如何找手机的物理地址)

一、要查询电脑的物理地址(也称为MAC地址),可以按照以下步骤进行操作:1.打开命令提示符(Windows)或终端(Mac):-在Windows上,点击“开始”按钮,搜索“命令提示符”,然后点击打...

IPv4 无网络访问权限全流程解决方案

当设备出现IPv4无网络访问权限问题时,多由网络配置错误、连接故障或服务异常导致。以下提供系统化的排查步骤与解决方案,帮助用户快速定位并修复问题。一、基础故障快速检查1.物理连接确认有线网络:检...

Python教程(十九):文件操作(python操作文件夹)

昨天,我们学习了列表推导式,掌握了Python中最优雅的数据处理方式。今天,我们将学习文件操作—Python中读写文件的基础技能。文件操作是编程中的核心技能,无论是读取配置文件、保存用户数据,还是...

取消回复欢迎 发表评论: