tomcat上传文件大小限制10M(springboot上传文件大小设置)

前言 这两天在另一个社区看到了一个关于Tomcat的提问,还挺有意思。正好自己之前也没思考过这个问题,今天就结合Tomcat机制来聊聊这个“为什么”。 本文对HTTP协议中的文件上传标准和Tomcat机制的分析内容较多,比较基础,不需要的大佬们可以直接跳到文末。 HTTP协议中的文件上传 众所周知,HTTP是一个文本协议,那文本协议如何传输文件呢? 直接传……是的就这么简单。文本协议只是在应用层的…

前言

这两天在另一个社区看到了一个关于 Tomcat 的提问,还挺有意思。正好自己之前也没思考过这个问题,今天就结合 Tomcat 机制来聊聊这个“为什么”。

Tomcat 中是怎么处理文件上传的?

本文对 HTTP 协议中的文件上传标准和 Tomcat 机制的分析内容较多,比较基础,不需要的大佬们可以直接跳到文末。

HTTP 协议中的文件上传

众所周知,HTTP 是一个文本协议,那文本协议如何传输文件呢?

直接传……是的就这么简单。文本协议只是在应用层的角度,到了传输层都是数据都是字节,没什么区别,并不用进行额外的编解码。

multipart/form-data 方式

HTTP 协议中规定了一种基于表单的文件上传方式(Form-based File Upload)。在 form 中定义一个 ENCTYPE 属性,值为 multipart/form-data,然后增加一个 type 为 file 的 <input> 标签。

 <FORM ENCTYPE=\"multipart/form-data\" ACTION=\"_URL_\" METHOD=POST>

   File to process: <INPUT NAME=\"userfile1\" TYPE=\"file\">

   <INPUT TYPE=\"submit\" VALUE=\"Send File\">

 </FORM>

这个 multipart/form-data 类型的表单和默认的 x-www-form-urlencoded 有些不同。虽然都作为表单,可以上传多个字段,但前者可以上传文件,后者却只能传输文本

现在来看看这个表单文件上传方式的协议,下图是一个简单的 multipart/form-data 类型的请求报文:

Tomcat 中是怎么处理文件上传的?

从上图可以看到,HTTP header 部分没什么变化,只是 Content-Type 中增加了一段 boundary 标签,但 payload 部分却完全不同

boundary 在 multipart/form-data 中作用是分隔表单的多个字段,在 payload 部分中,首尾两行各有一个 boundary,每个字段(part/item)之间也会有一个 boundary

Server 端在读取时,只需要先从 Content-Type 中拿到 boundary ,然后通过这个 boundary 去拆分 payload 部分就可以获取所有的字段。

每个字段的报文中,有一个 Content-Disposition字段,作为这个字段的 Header 部分。其中记录了当前字段名(name),如果是文件的话还会有一个 filename 属性,同时再下一行会附带一个 Content-Type 来标识文件的类型

虽然 x-www-form-urlencoded 和 multipart 两种类型的表单都可以完成字段的传输,但 multipart 不仅可以传输文本字段,还可以传输文件。而且这个 multipart 传输文件的方式也是“标准”的,各种 Server 都可以支持,直接读取文件。

而 x-www-form-urlencoded 只可以传输基础的文本数据,不过你要是强行把文件当做文本,用这个类型传也没人能拦你,但作为文本传输时后端必然用字符串方式解析,byte -> str 时的编码开销完全没必要,而且可能会导致编码错误……

在 x-www-form-urlencoded 类型的报文中,并没有 boundary,多个字段会通过 & 符号拼接,并且对key/value 都进行 urlencode 编码

Tomcat 中是怎么处理文件上传的?

虽然 x-www-form-urlencoded 增加了一步编码的过程,但不会给每个字段增加header,也没有 boundary,报文体积相对 multipart 方式来说小了很多。

除了这个 multipart,还有一种直接上传文件的形式,不过不太常用

binary payload 方式

除了 multipart/form-data之外,还有一种 binary payload 的上传方式。这个 binary payload 是我自己起的名字……因为在 HTTP 协议中并没有找到这种方式的说明(如果有找到的大佬评论区贴个连接),不过很多 HTTP 客户端都支持。

比如 Postman:

Tomcat 中是怎么处理文件上传的?

比如 OkHttp:

OkHttpClient client = new OkHttpClient().newBuilder()
  .build();
MediaType mediaType = MediaType.parse(\"image/png\");
RequestBody body = RequestBody.create(mediaType, \"<file contents here>\");
Request request = new Request.Builder()
  .url(\"localhost:8098/upload\")
  .method(\"POST\", body)
  .addHeader(\"Content-Type\", \"image/png\")
  .build();
Response response = client.newCall(request).execute();

这种方式非常简单,就是将整个 payload 部分,都用来存放文件数据。如下图所示,整个 payload 部分都是文件内容:

Tomcat 中是怎么处理文件上传的?

这种方式虽然简单,客户端实现也简单,但……服务端没有很好的支持。比如 Tomcat 中,并不会将这种 binary file 的形式作为文件处理,而是当做普通的报文处理。

Tomcat 处理机制分析

Tomcat 在处理文本形式的报文时,会先读取前面的 Header 部分,解析 Content-Length 来划分报文边界,剩下的 Payload 部分并不会一次性读取,而是包装了一个 InputStream ,在内部调用 Socket read 进行读取 RCV_BUF 的数据(完整报文大小大于 readBuf Size时

Tomcat 中是怎么处理文件上传的?

对 HttpServletRequest 调用
getParameter/getInputStream 等涉及 Payload 部分读取操作时,就会进行InputStream 内部的 Socket RCV_BUF 的读取,读取 Payload 的数据。

这种不一次性读取所有数据暂存至内存中的方式,而包装一个 InputStream 内部读取 RCV_BUF 的方式,特点是不存储数据,只是做一个包装,应用层对 ServletRequest#inputStream 的 read 操作会转发到对 Socket RCV_BUF 的read。

不过如果应用层完整的读取了 ServletRequest#inputStream ,然后转字符串,存储至内存中的话,那这就和 Tomcat 没什么关系了。

对于 multipart 类型的请求,Tomcat 处理机制上比较特殊。由于 multipart 是为了传输文件而设计的,所以在处理这种类型请求时,Tomcat 增加了一个暂存文件的概念,在解析报文时,将 multipart 中的数据写入到了磁盘中

如下图所示,Tomcat 对每一个字段都包装为一个 DiskFileItem –
org.apache.tomcat.util.http.fileupload.disk.DiskFileItem(这个 DiskFileItem 不区分是文件还是文本数据)。DiskFileItem 内又分为 Header 部分和 Content 部分。Content 中一部分存储在内存,剩下的存储至磁盘,通过一个 sizeThreshold 进行分割;不过这个值默认为0,也就是说默认会把内容部分全部存储至磁盘。

Tomcat 中是怎么处理文件上传的?

那既然存储至磁盘,读取时也肯定也是从磁盘读取了……效率自然是比较低的。所以如果只是文本型的报文,还是不要用 multipart 类型来传输了,这个类型会被转存磁盘的。

还有一个冷知识,Tomcat 在处理 multipart 类型的报文时,如果某个字段不是文件,会将这个字段的key/value 添加到 parameterMap 中,也就是说通过
request.getParameter/getParameterMap 可以获取到这些非文件的字段。

//org.apache.catalina.connector.Request#parseParts

if (part.getSubmittedFileName() == null) {
    String name = part.getName();
    String value = null;
    try {
        value = part.getString(charset.name());
    } catch (UnsupportedEncodingException uee) {
        // Not possible
    }
    ......
        parameters.addParameter(name, value);
}

要知道这个 getParameter 是只能获取表单参数(FormParam)和查询参数(QueryString)的,不过 multipart 也是 form,能获取参数好像也没啥毛病……

一个简单的小结

Tomcat 对不同类型的请求处理方式:

  1. 如果参数是 GET queryString方式(url上拼参数),那么所有参数都在报文头中,会一次性全部读取至内存
  2. 如果是 POST 类型的报文,Tomcat 只会对读取 Header 部分,Payload 部分不会主动读取,而是将 Socket 包装成一个 InputStream 供应用层 read
    1. x-www-form-urlencoded 这种类型的报文,虽然不会主动读取,但很多 Web 框架(比如 SpringMVC)会调用 getParameter,还是会出发 InputStream 的read,对 RCV_BUF 进行读取
    2. 上面提到的 binary payload也是一样,Tomcat 并不会主动发起 read 操作,需要应用层调用 ServletRequest#InputStream 进行 read操作读取 RCV_BUF 的数据
    3. multipart 类型的报文,一样不会主动读取,调用HttpServletRequest#getParts 才会触发解析/读取;同样的,很多 Web 框架会调用 getParts,所以会触发解析

为什么要先写入临时文件,直接包装 InputStream 交给应用层读取不行吗?

如果应用层不(及时)读取 RCV_BUF,那么当收到的数据写满 RCV_BUF 时,就不会再返回 ACK 了,客户端的的数据也会存储在 SND_BUF 中,无法继续发送数据,当 SND_BUF 被应用层写满时,这条连接就被阻塞了。

Tomcat 中是怎么处理文件上传的?

由于 multipart 一般是用于传输文件,但文件大小通常会远大于 Socket Buffer 的容量。所以,为了不阻塞 TCP 连接,Tomcat 会一次性读取完整的 Payload 部分,然后将其中所有的 Part 存储至磁盘(Header在内存中,内容在磁盘)。

应用层只需要再从 Tomcat 提供的 DiskFileItem 读取 Part 数据即可,这样看起来虽然中转了一层,但 RCV_BUF 中的数据却可以被及时消费了。

从效率上说,中转+存磁盘这种操作,一定比不中转要慢的多,不过可以及时消费 RCV_BUF,保证 TCP 连接不被阻塞。

如果是在 HTTP2 的多路复用下,多个请求都使用同一个 TCP 连接,如果 RCV_BUF 没有及时消费,那么还会导致所有的“逻辑 HTTP 连接”都阻塞

那为什么其他类型的报文不用暂存磁盘呢?

因为报文小啊,普通的请求报文不会太大的,常见的也就几K 到几十K ,而且对于纯文本报文来说,读取操作一定也是及时的且一次性全部读取的,而 multipart 这种形式的报文不同,它是文本+文件混合的方式,而且还可能是多文件。

比如服务端在接收到文件后,还需要对文件进行转存,转存到某些云厂商的对象存储服务中,那么此时有两种转存方式:

  1. 接收到完整文件数据,存储至内存中,然后调用对象存储的SDK
  2. 用流的方式,一边 read ServletRequest#InputStream,一边 write 到 SDK 的 OutputStream 中

方式 1,虽然及时读取了 RCV_BUF,但是内存占用过大,很容易把内存撑爆,非常不合理 方式 2,虽然内存占用很小(最多只有一个 Read Buffer 的大小),但由于是边读边写,两边都是网络,会导致 RCV_BUF 不能及时消费完成。

而且不光是 Tomcat ,连 Jetty 也是这么处理 multipart,其他 Web Server 虽然没看,但我想应该都会这么处理。

版权声明:本文内容由互联网用户自发贡献,该文观点仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至 举报,一经查实,本站将立刻删除。

(0)
上一篇 2022年5月12日 下午6:13
下一篇 2022年5月12日 下午6:14

相关推荐

  • 微办公平台怎么样(微办公平台品牌介绍)

    DoNews5月31日消息(记者翟继茹)在本届数博会上,奇鱼微办公作为为数不多聚焦移动办公领域的企业参加了本届数博会。与传统移动办公平台相对比,奇鱼办公副总裁黄喆介绍奇鱼的优势在于AI智能化和一体化链接企业大数据。 2015年是中国移动办公领域的“爆发之年”,奇鱼微办公也是在这一年加入激烈的竞争中。2015年4月,微办公首次提出一体化移动办公平台离线,正式推出客户管理(CRM)系统。同年11月推出…

    2022年5月3日
    880
  • 创业板开板日期,股票创业板怎么开通

    2009年10月23日,创业板正式开板。2019年10月23日,将是创业板开板十周年纪念日。 十年来,创业板从最初的28家公司增长至目前的775家,总市值从千亿元,增长至5.6万亿元。一批批企业通过资本市场成长壮大,已有5家企业总市值超千亿元,一百多家企业总市值超百亿元。 十年栉风沐雨 十年栉风沐雨,从首批28家企业,到如今的775家企业,总市值超5.6万亿元,创业板不断发展壮大,成为证券市场的重…

    2022年5月20日
    700
  • 网站推广有哪些方案,网站推广营销运营方式

    –通过各大广告任务网推广 费用:一天几元,在威客网站发布任务, –通过论坛、贴吧推广 在其他论坛、博客等类型网站进行知名人士、热点文章评论,回复,提高曝光率 百度贴吧、站长类论坛、IT类论坛、站长之家论坛、A5论坛、落伍者论坛、主机论坛、服务器论坛、域名论坛 –通过各大博客平台推广 博客之间互相留链接,新浪博客、和讯博客、网易博客、1688博客、博客园、CNDS、51CTO,还有豆瓣、知乎以…

    2022年7月31日
    620
  • 淘宝店可以转让吗,淘宝店转让的注意事项

    目前随着淘宝店铺的运维成本升高,一部分个人店主已无心经营,往往会造成等级和信誉都不错的店铺闲置。 而另一方面,一部分有能力有资源的团队,想通过收购高等级高信誉的店铺来批量经营淘宝店。所以网店转让是这两者之间的完美桥梁。 但是在淘宝店转让的过程中,必须注意一下4点,否则可能造成不必要的纠纷和麻烦: 关于淘宝贷款功能。 因为淘宝店铺信息一经注册便不可更改,转让后店铺信息仍然属于原注册人,有些不良买家便…

    2022年7月22日
    590
  • 怎样在家里赚钱,适合在家赚钱的工作推荐

    今天给大家推荐可以兼职上手,月入过万的4种方法,0成本,无风险。在这只能闲在家里的日子,给自己多一条出路。 但请注意,虽然是兼职,不代表躺赚,想赚钱必须得付出努力。 淘宝无库存倒卖 很多人都认为,现在红利期过了,做淘宝肯定赚不到钱。这话也没错,不投入精力想轻松赚大钱很难。但是现在想通过淘宝一个月赚个万把块还是可能的,而且只需要利用业余时间就行。在工作之外每个月还能多出1万块收入,也是不错的选择。 …

    2022年7月22日
    620
  • 运营主要做什么,女生做运营以后的发展

    作为一名电商运营人员,其每日最主要的工作任务有哪些呢?这篇文章写给新手电商运营人和准备转行电商运营的朋友们。(本文以淘宝为例-其他天猫,京东,拼多多等几乎是一样的) 店铺日常运营基本内容 店铺运营是电商运营最基本的操作工作,店铺运营我们要会下面这些知识;开店流程–发布宝贝–商品上下架–橱窗推荐–类目优化–商品标题–品类规划–运营规划; 上面这些都是任何一个新手需要掌握的最基本知识,其…

    2022年6月30日
    1580
  • rsa解密过程(rsa算法例题详细)

    数据信息安全对我们每个人都有很重要的意义,特别是一些敏感信息,可能一些类似于收货地址、手机号还没引起大家的注意。但是最直白的,银行卡、姓名、手机号、身份证号,如果这些信息被黑客拦截到,他就可以伪装成你,把你的钱都取走。那我们该怎么防止这样的事情发生?报文加密解密,加签验签。 我害怕什么 我害怕卡里的钱被别人取走 我害怕转账的时候,报文被黑客拦截到,篡改信息转到别人的账户。 我害怕我的敏感信息被有心…

    2022年5月18日
    610
  • 域名备案代理(网站域名备案流程)

    域名主要就是由域名服务器分割出来的由一串字母、字符、数字形成的位置代码,现在域名注册市场火热,域名注册种类也比较多。域名可分为中文域名和英文域名,在互联网还可分一、二、三级域名,也会有其他的分类方法。 域名备案是指网站备案,是指将你的网站在工信部系统中进行登记,相当于是给网站做个实名认证。域名需要指向一个网站时是必须要进行备案的,备案的目的就是为了防止在网上从事非法的网站经营活动,打击不良互联网信…

    2022年5月9日
    1270
  • 魅族16怎么样值得买吗,魅族16网络信号测试

    8月8日,魅族在北京举办了新品发布会,正式推出了旗下新旗舰——魅族16th,极果君提前拿到了这款手机,亲手体验了一下黄章打磨的魅族有史以来配置最豪华的手机,到底魅族16th怎么样?在今年强敌林立的市场中能否打一场漂亮的翻身仗?话不多说,一起来看看吧~ 对称式全面屏好不好看? 真香。 关于魅族16th的外观,其实早就没什么悬念了,黄章、李楠天天在微博/论坛上大爆料,加上工信部神助攻,大家对魅族的新机…

    2022年9月7日
    450
  • pdf如何解密,加密pdf在线破解平台

    有时我们从某些网站上下载下来一些PDF文件,其中有些PDF文件无法打开阅读,或者我们想要对PDF文件进行打印或编辑等操作的时候提示我们需要输入口令密码之类的权限,非常不方便我们的使用,那么有没有什么办法可以取消PDF文件的密码呢?PDF文件怎么解密? 首先,如果某个PDF文件的密码是你为了保护自己的PDF文件而创建的,但过后想要取消文件加密,有些朋友只会加密而不会取消加密的话,该怎么办呢? 我们用…

    2022年6月9日
    730

发表回复

登录后才能评论

联系我们

400-800-8888

在线咨询: QQ交谈

邮件:admin@example.com

工作时间:周一至周五,9:30-18:30,节假日休息

关注微信