找回密码
注册

QQ登录

只需一步,快速开始

Some links >
Some links >
Some links >

Unity2019.4 渐进式光照贴图烘焙详解

随着各大计算平台的算力稳步增长,特别是GPU技术的不断进化,原 ...

从宋代建筑到场景原画

在讲之前,应该先了解下宋朝的时代背景,一个朝代的建筑特点,和 ...

浅谈“音乐大厂”FALCOM:法老控,永远的神

日本的游戏大厂众多,一说起日本的游戏厂商,大家肯定会先想到卡 ...

单机游戏的发展历史(一):起源

单机游戏可以说是现代大部分游戏的起源,当我们说起单机游戏的诞 ...

刺猬索尼克编年史:世嘉首席吉祥物的倔强便是永不停歇

人生若只如初见:一抹动情的蓝 世嘉公司在1988年发行了他们的1 ...

日本Pocket Pair公司老板Takuro Mizobe访谈录

前几天在网上看到Craftopia(中文被翻译成《创世理想乡》)的视 ...

从心理学角度浅谈《最后生还者2》的剧情设计问题

本文主要从心理学的角度,简单谈谈为啥《最后生还者2》的剧情, ...

从山海镜花看日式游戏美术设计

游族网络的山海镜花从发售以来一直占据各大排行榜首位,浓浓 ...

开放世界品类又多了一个挑战者

丨有备而来。 2020年,可能是开放世界的大年。除了大家已经有所 ...

《最后生还者 第二章》倒计时!重温第一部,依然震撼!

《最后生还者 第二章》6月19日就要上线了!最近重温了《最后生还 ...

作者: 九艺网
查看: 204|回复: 0
搜索

more +最新主题Download

more +社区更新Forums

more +随机图赏Gallery

Unity2019.4 渐进式光照贴图烘焙详解
从宋代建筑到场景原画
浅谈“音乐大厂”FALCOM:法老控,永远的神
单机游戏的发展历史(一):起源

more +文章更新News

[技术美术] 省带宽、耗电小,腾讯游戏学院专家解析手游渲染架构

[复制链接]
九艺网 发表于 2020-1-2 21:55:22 | 显示全部楼层 |阅读模式
查看: 204|回复: 0

马上注册,结交更多好友,享用更多功能,让你轻松玩转社区。

您需要 登录 才可以下载或查看,没有帐号?注册

x
编者按 如何让手游更省带宽,耗电量更少?渲染或是其中一个可突破的点。本文中,腾讯游戏学院专家Hailong将从为大家解析TBR渲染架构的特点。

什么是TBR?

全称是Tile Based Rendering,主要用在移动设备(手机、平板)上的一种渲染架构,渲染时将屏幕分割成小块,分别渲染。每块大小为16×16 或32×32等(不同产品各不相同),特点是省带宽,耗电小。

与之对应的是IMR(Immediate Mode Rendering),提交的每个渲染要求都会立即开始,这是一种简单而又粗暴的思路,优点缺点都非常明显,如果不用为性能担忧,这种方式会很省事。

片上缓存(On-Chip Buffer)

TBR设备在GPU内部集成有很小的片上缓存(On-Chip Buffer),片上缓存,在渲染时会先将一个Tile内的图像先渲染到片上缓存,然后在拷贝到主显存中。而IMR渲染则是直接由GPU操作显存。片上缓存相比于显存中的Frame Buffer具有更快的访问速度,但是只有很小的存储空间(16×16像素或32×32像素)。

133241mswdy7yd3la773k6.jpg

与IMR相比,TBR在GPU上多出一块片上缓存。

133242y0t9hg31mdh73gu7.jpg

IMR与TBR在渲染流程上的对比(红色阴影表示带宽消耗热点)

由上图可以看出,IMR和TBR在带宽消耗上有比较大的差异,左侧的IMR渲染时,Depth Test和Alpha Test等由于需要频繁访问显存,导致有很大的带宽消耗。而右侧的TBR渲染方式由于Depth Test和Alpha Test都只需要跟片上缓存交互即可,避免了和显存之间的带宽消耗。

Tiling(分块)

为了能够按照逐个Tile渲染,在一帧的绘图指令全部提交完成并经过顶点运算后后,会在记录下每个Tile中对应的Triangle List。并保存在FrameBuffer中,等待光栅化时从FrameBuffer读取相应的Tile的TriangleList进行处理。

133242hgws26ztu21gz0w2.png

Resove和Restore

由于GPU的片上缓存的存储空间非常有限,因此渲染完成一个Tile之后,需要将结果复制到FrameBuffer中,这个过程称作Resove。

如果一帧内需要多遍渲染时,在对Tile进行渲染的时候往往需要从FrameBuffer中将对应Tile中旧的数据读取到片上缓存,这个过程称为Restore。

Resove和Restore会导致大量的带宽消耗,需要尽量避免。

如果在渲染过程中需要频繁的切换FrameBuffer,要注意调用顺序,避免浪费带宽。

133242dpok2fkp6kfkicwk.png

133242v5weq3yoee2rl2qo.png

会导致Resove+Restore的OpenGL ES调用。

  • eglSwapBuffers
  • glBindFramebuffer
  • glTexImage2D,glTexSubImage2D,
  • glBufferData,glBufferSubData
  • glCopyTexImage2D ,glCopyTexSubImage2
  • glReadPixels()
  • (参考:Adreno_Developer_Guide.pdf第38页)


实例:为什么在Unity中使用Grap Pass实现屏幕扭曲非常慢?

由于Unity中的Grap Pass是插在渲染过程中的,每渲染一次,会调用一次glBufferSubData,会导致Resorve和Restore。

可能做的优化:
等场景全部渲染完之后再在最上层叠加一个扭曲效果。
跟其他后处理合并处理。

实例:关于后处理

每个后处理会导至少增加一次Resorve。

可能的优化:
将多种后处理效果放在一个shader中可以减少Resove发生次数。
某些效果低分辨率可以减少带宽。

实例:实时阴影

Shadow map方式实现的实时阴影,需要首先将摄像机放在光源处,将场景深度渲染到一张纹理上,因此除了draw call的增加外,带宽的增加也很多。

  • 可能的优化:
  • 使用更小的RT。
  • 如果能接受的话,可以尝试镇魔曲中影子的做法,即将主角压扁,用黑色纹理渲出来。


减少带宽消耗的建议

1、减少顶点数和图片尺寸。

2、图片压缩(ETC,ATC,PVRTC等)。

3、除界面外,几乎所有贴图都建议生成Mipmap(减小带宽消耗,增加缓存命中)。

4、尽量减少Resove和Restore,尽量减小RenderTexture的尺寸。

  • 全屏后处理
  • 实时阴影(shadow map)
  • 扭曲
  • 实时反射
  • 5、优化Shader。
  • 使用低精度浮点数


TBR特有的两个OpenGL ES扩展

1、Framebuffer Fetch

允许Shader中直接访问片上缓存中当前的颜色和深度。

可以用来实现高效的Color Grading、高度雾之类。

2、Pixel Local Storage

允许在片上缓存中存储和读取自定义的数据格式,大小为每像素128字节或256字节。

可以用来实现高效的延迟光照渲染(在片上缓存中保存G-Buffer)。

133243y3y3kbwybeeais0b.png

关于腾讯游戏学院专家团
如果你的游戏也富有想法充满创意,如果你的团队现在也遇到了一些开发瓶颈,那么欢迎你来联系我们。腾讯游戏学院聚集了腾讯及行业内策划、美术、程序等领域的游戏专家,我们将为全世界的创意游戏团队提供专业的技术指导和游戏调优建议,解决团队在开发过程中遇到的一系列问题。


申请专家资源请前往:
https://gwb.tencent.com/cn/tutor


作者:Hailong  
来源:腾讯GWB游戏无界
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册

本版积分规则

快速回复 返回顶部 返回列表