:HTTP请求是如何被服务器解析的?从请求报文、路径处理到响应状态码与异常处理)
◆ 博主名称 小此方-CSDN博客大家好欢迎来到小此方的博客。⭐️网络系列个人专栏 【主题曲】计算机网络⭐️此方的GitHub github_此方⭐️我们思考 (Rethink) · 我们重建 (Rebuild) · 我们记录 (Record)文章目录概要序論一、服务器如何解析 HTTP 请求中的资源路径1.1 先聊一聊三个概念1.2 路径拼接规则1.2.1 显式请求具体文件1.2.2 隐式请求根目录自动拼接首页1.3 总结二、HTTP 请求协议格式详解2.1 请求行的组成要素2.2 为什么请求和响应中必须携带版本号2.3 网站的树状访问逻辑与二次请求2.4 如何读取到一个完整的 HTTP 请求报文Tips/favicon.ico请求三、HTTP 响应报文与异常处理机制3.1 HTTP 状态码分类3.2 常见服务器处理异常场景解析3.2.1 代理服务器帮助传递错误码3.2.2 代码层面的异常捕获与回调机制3.2.3 公司里的状态码还有隐藏策略3.3 应答告诉对方我的有效载荷是什么Tips需要注意的小问题3.4 有效载荷的类型3.5 客户端支持的属性字段3.6 Host 字段的作用3.7 User-Agent 的作用与爬虫原理概要序論Hello大家好我是此方。接着上篇继续讲HTTP本文将继续深入 HTTP 协议从服务器视角分析一个 HTTP 请求是如何被接收、解析和处理的。文章将详细介绍请求行、HTTP 版本号、URI 路径及网站资源的访问逻辑并分析如何读取完整的 HTTP 请求报文。在此基础上进一步探讨 HTTP 响应状态码、异常处理、有效载荷以及 Host、User-Agent 等常见请求字段理解浏览器、代理服务器与 Web 服务器之间的实际交互过程。一、服务器如何解析 HTTP 请求中的资源路径网页内容图片、CSS、JS等都存储在服务器的特定路径下而非在代码中硬编码。浏览器在发送 HTTP 请求时是通过 URI 来告知服务器自己需要什么资源。1.1 先聊一聊三个概念URI统一资源标识符当浏览器请求http://8.137.19.140:8081/a/b/c.html时服务端收到的请求行如GET /a/b/c.html HTTP/1.1其中/a/b/c.html即 URI用于指示请求资源的相对位置。Web 根目录Web Root代码中定义的资源存储根目录如const std::string webroot “./wwwroot”。注意它并非 Linux 系统的绝对根目录 /所有静态资源均需放置于此目录下。资源路径资源在服务器磁盘上的真实物理路径由 Web 根目录与 URI 拼接而成。1.2 路径拼接规则服务器收到请求后会根据 URI 情况选择不同的拼接逻辑1.2.1 显式请求具体文件当请求行为GET /a/b/c.html HTTP/1.1时服务器直接将 Web 根目录webroot./wwwroot与 URI/a/b/c.html拼接最终得到的真实文件路径为./wwwroot/a/b/c.html。1.2.2 隐式请求根目录自动拼接首页当请求行为GET / HTTP/1.1时服务器无法直接返回目录需要自动拼接默认首页如index.html。服务器通过预设的homepage “/index.html”完成拼接filename webroot homepage得到真实路径./wwwroot/index.html随后读取该文件并返回。1.3 总结HTTP 请求的本质就是请求代码中./wwwroot目录下特定路径的资源而 URI 中的路径则是寻找该资源的磁盘索引。二、HTTP 请求协议格式详解在了解了服务器如何根据 URI 解析文件路径后我们需要进一步拆拆 HTTP 请求本身的报文结构。2.1 请求行的组成要素请求方法告知服务器本次操作的意图。虽然 HTTP 定义了多种请求方法但最常用的是GET和POST。其中GET主要用于从远端获取内容而POST则用于向远端进行参数提交。URI 表明客户端要请求的资源目前在请求行中的表现形式为一段相对路径。HTTP 版本号指定客户端发送请求时所采用的协议版本例如HTTP/1.0或HTTP/1.1。2.2 为什么请求和响应中必须携带版本号在 HTTP 协议的报文设计中请求和响应都会明确标明版本号。原因在于客户端和服务器是两款独立运行的软件在实际的应用场景中一个厂家给他的服务器进行了软件升级但是市面上的用户还有很多没有更新他们的客户端于是就会出现新老版本的客户端和服务器同时在网络中并存的情况。因此客户端发送请求必须带上自己的版本号然后服务器和客户端协商版本号为客户端提供对应版本的服务。否则如果缺乏版本协商机制就会出现客户端解析或处理错误。2.3 网站的树状访问逻辑与二次请求我们在浏览器端发起请求时首页作为整个站点的入口本质上一个网站就是一颗多叉树。当用户在网页上点击链接时浏览器会形成新的访问地址并发起二次请求进而拼接出新的 URI。我们在服务器端请求的所有资源最终都是通过HTTP Request中的 URI 来精准表示的。2.4 如何读取到一个完整的 HTTP 请求报文HTTP的底层是TCPTCP 是面向字节流的直接调用recv无法保证单次读取就能拿到完整请求。那么怎么做呢逐字节或按行读取数据查找代表报头结束的空行即连续的\r\n\r\n以此确保读取到完整的请求报头。对读取到的报头进行反序列化解析提取出Content-Length属性该属性明确标明了后续请求正文有效载荷的字节长度。根据提取到的Content-Length数值继续从剩余的字符流缓冲区中精准提取对应字节数的字符从而拼接出完整的 HTTP 请求正文。Tips/favicon.ico请求浏览器向服务器发送一次网页请求除了请求这个网页本身还会请求/favicon.ico。我们采取忽略的方式if(_targetfile./wwwroot/favicon.ico){LOG(LogLevel::DEBUG)用户请求: _targetfile忽略它;returnfalse;}/favicon.ico是什么就是你这个网页的小图标三、HTTP 响应报文与异常处理机制在 Web 服务器完成请求解析与业务逻辑处理后需要向客户端返回 HTTP 响应报文。状态行中的状态码与状态码描述是服务器向客户端表达请求处理结果与进行异常处理的核心。3.1 HTTP 状态码分类状态码由三位数字组成根据首位数字划分为五种主要类别3.2 常见服务器处理异常场景解析3.2.1 代理服务器帮助传递错误码大型公司内部通常会由代理服务器与机房中的多台服务器共同组成负载均衡系统。如果其中某台后端服务器因过载等原因发生异常该服务器会向代理服务器返回错误码最终由代理服务器统一将错误信息返回给终端用户。(我在后面正反向代理的时候会讲)3.2.2 代码层面的异常捕获与回调机制500错误的一种可能是服务器创建子进程失败。但是子进程创建都失败了如何给我们的网页发送500呢有一种方法可以处理如果fork错误可以在进程退出前调用一下回调函数excepter()可以执行回调由服务器自己发送一个网页回去。pid_t idfork();if(id0){LOG(LogLevel::FATAL)fork error ...;// excepter(sock); //exit(FORK_ERR);}如果父子进程都挂了那么没有任何办法没有任何返回。3.2.3 公司里的状态码还有隐藏策略很多大公司如果是服务器出错正确的应该返回5xx但是实际上会返回4xx为了防止暴露自己服务器的错误会有黑客趁你病要你命。3.3 应答告诉对方我的有效载荷是什么如果你的应答是携带了数据的我就应该在 response 的响应报头中包含Content-Length:XXX\r\n。那么我们必然要知道一个文件的大小是多少有三种方法C语言的文件读写位置接口。C的 ifstream 的读写位置接口。stat 系统调用传入文件名称会返回文件结构体里面有文件大小。我们认为文件内容就是一个char类型的数组文件读写位置就是数组下标。#ifndef__UTIL__#define__UTIL__#include./BasicElement/Common.hppnamespaceHttpUtilModule{classUtil{public:longGetFileSize(std::string filename){std::ifstreamin(filename,std::ios::binary);in.seekg(0,std::ios::end);std::streamoff sizein.tellg();in.seekg(0,std::ios::beg);return(long)size;}voidGetFileContent(std::stringfilename,std::stringcontent){longnGetFileSize(filename);intsizen;content.resize(size);std::ifstreamin(filename,std::ios::binary);in.read(content.data(),size);std::coutFileName: filenamestd::endl;std::coutFileSize: nstd::endl;std::coutContentSize: content.size()std::endl;}private:};}#endifTips需要注意的小问题必须得提一嘴我们前面在为 Tcp 服务器设计协议的时候使用的是字符串读取但是这样是有失偏颇的。严格意义上讲我们是面向“字节流”。字节流应该使用vector作为你读取的缓冲区。staticboolReadFileContent(conststd::stringfilename/*std::vectorchar*/,std::string*out){// version1: 默认是以文本方式读取文件的图片是二进制的。}如果采用字符串的方式在遇到不可显示字符或者\0的时候就可能读取错误或者停止读取。这在读取图片文件的时候是致命的。3.4 有效载荷的类型Content-Type一般是应答要携带这个属性。因为超文本传输传输的都是字节流你得知道我传输过来的字节流是什么东西。3.5 客户端支持的属性字段Accept-Encoding和Accept-Language分别表示我们的客户端可以支持的压缩模式和语言。一般我们的网页比较大的时候我们会把它打包一下成为一个压缩包再发出来这个时候就需要双方商量好压缩/解压方式。3.6 Host 字段的作用Host字段客户端告知服务器所请求的资源是在哪个主机的哪个端口上。假设浏览器向服务器发送这么一段请求中间经过代理服务器时代理服务器接到请求后向后端发送到对应Host的主机。后端目标主机接到请求后执行任务并返回回应。3.7 User-Agent 的作用与爬虫原理我们在百度中搜索信息的时候本质上也是在向百度的服务器发送 HTTP服务器会接收到我们的客户端的请求通过User-Agent判断我们的客户端是否合法是否是一个真的客户端客户端支持的平台版本。于是给我们提供对应的搜索结果。比如我们搜索微信手机上搜索结果会给你推送安卓的下载电脑上会给你推win/mac的版本。于是User-Agent是一个描述客户端信息的一个属性。让我们的机器给百度发送一个最简单的 HTTP 请求就是这样一个请求行GET / HTTP/1.1于是我们可以使用一些工具向服务器发起请求于是我们就可以抓取我们想要的网页了。我们刚好有一个工具wget https://tool.oschina.net/commons。这就是爬虫pachong本质就是用 http 客户端来模拟浏览器行为获取指定链接下的网页好的本期内容就到这里如果对你有帮助还不要忘记点赞三联支持。我是此方我们下期再见。bye!