返回「计算机、信息技术与工程」

【转载】Mobile SoC

更多
Markdown 结构化数据
本文目录 10 个章节

【转载】Mobile SoC

创建时间:2020/11/26 23:15

  • 【转载】Mobile SoC
    • SoC
      • CPU
      • GPU
        • GPU(图形处理器) ARCHITECTURE的变迁史
        • 市场状况
      • CPU和GPU整体系统架构
      • SOC天梯
    • 通用并列处理
    • ARM
    • Ref

Mobile device的硬件种类繁多,差异较大。国内相关博客也较少。本文内容转载了博主leegoonz和电子工程专辑的文章,无法保证信息的时效性与准确性,但希望能借此对移动设备硬件有所了解。

SoC

单片系统(System on a Chip): 是一个将电脑或其他电子系统集成到单一芯片的集成电路。常应用在嵌入式系统中。

Alt text

AP(Application Processor) - AP 包括了CPU和GPU核心,其运行操作系统和应用程序,具有control附近Chipset的function。

AP原来是指用电池驱动的,专门为Mobile Embedded Computing设计的CPU。早期,其安装在notebook/netbook/UMPC和PDA等便携式PC上。现在,AP(Application Processor)安装在智能设备的SoC上,已经成为了mobile process的代名词。

组成 - CPU,处理2D/3D图形的GPU,ISP(Image Signal Processor),multi format video codec(编码解码器), 运行audio and voice recognize processing的数字信号处理器(DSP, Digital Signal Processor),以及各种interface IP等

CPU

ARM公司的Cortex-A处理器是市场上的主流产品。

GPU

GPU支持OpenVG, OpenGL ES等图形语言和library。Imagination Technologies公司的 PowerVR 和ARM公司的 Mali 是具有代表性的GPU IP产品。

GPU(图形处理器) ARCHITECTURE的变迁史

著名的游戏引擎虚幻引擎(Unreal Engine)Epic Games的Unreal window用PC游戏是在1998年公布的。当时因为还是软件渲染时代,坐标转换矩阵计算是在CPU中进行的。

1999年NVIDIA发布了Geforce 256显卡,因为硬件是T&L(transform & lighting),矩阵计算和Multiply accumulate operation这些固定功能是由硬件来实现的,从这个时候开始,3D PC游戏的坐标转换将在GPU中实现。

单机游戏机中,在2000年发布的索尼Playstation2中CPU Emotion Engine的向量运算单位已经实现了几何处理,2001年发售的任天堂GameCube在GPU Flipper上实现了硬件T&L。

2000年微软发布了window用图形API DirectX 8。

DirectX 8不是固定功能,而是搭载了用户可以自定义编写的软件管线的硬件Shader,前提得是Programmable shader架构的GPU。

Shader分为两种,处理几何的Vertex Shader和处理Pixel的Pixel Shader,各自内部分别实现了个别硬件Block。

在OpenGL/OpenGL-ES中,把在DirectX中叫做Pixel shader的词汇称之为Fragment shader。

2001年发布了支持DiectX 8的操作系统windows XP和Nvidia GPU Geforce 3。

同年,发售的微软单机游戏机 ‘XBOX’搭载了支持自定义的Geforce 3,并支持Programmable shader。

渲染就是为了表现出3D立体感,给物件赋予由Shading这种模型现象而产生的阴影和灯光效果。

灯光、阴影处理等影响渲染结果的处理有很多,所以Shading这个词汇作为现代用语,指的是使用GPU来渲染的一般表现。

把在GPU硬件Shader中运行的程序叫做Shader Program,有时候干脆就叫做Shader。

在这之后,在2005年发售的微软XBOX 360中采用的ATI GPU Xenos,采用了Unified shader,这是一个很大的突破。

Unified shader作为同一硬件,在Shader process 中,同时处理vertex shader和Pixel shader两边,会根据各自处理阶段和每个游戏特性的不同会更换适合各个处理负荷的资源分配,在Shader process 方面能保持road平衡。

这边Unified shader process是以stream processing unit来实现的,具有5要素的VLIW(Very Long Instruction Word,超长命令) ISA。

5要素就是为了Vector4和Matrix4x4运算的 XYZW的4unit,超越函数和为了形态变换处理的T unit合在一起叫做VLIW5。

在支持Unified shader以后,作为大规模并行计算机(Massively parallel computer)的概念也渐渐明确下来,分支预测也逐渐加强,GPGPU处理为了不一直停留于图形处理,逐渐开始使用GPU。

这种趋势一直持续到现在为止。手机用的GPU,每种最新的型号都采用了Unified shader。现在比较有代表性的GPU架构(开发公司)如下: – Mali/Midgard(ARM) – Adreno – Tegra – PowerVR 最新型号都支持OpenGL ES 3.1。其中Mali的最新型号不是VLIW5,采用的是省略了T unit的VLIW4,把使用的并不是很多的T unit给省略了,把这部分又分配给了其它地方,处理速度就提高了。而且,Adreno, Tegra, PowerVR的最新型号用的也不是VLIW,采用的是接近于一般CPU ISA的Scalar processor。Scalar processor因为不是向量计算用SoA形式,所以处理一般AoS形式的数据也是很快的。

随着Shader program变得越来越复杂,这么做就是为了应对除了向量运算以外增加的处理。

虽然它是GPU core,但是实际搭载在手机上的不仅仅是GPU,而是把和CPU通信的通信调制解调器等相关部件都一并搭载在一个芯片上的 SoC(System on Chip)。apple A8,高通骁龙,Nvidia Tegra 等公司从ARM拿到许可,把CPU芯片也包含在了SoC上。

手机GPU的Die-Size(半导体芯片面积)因为手机form factor的尺寸很小,比PC用台式GPU要小很多,性能也要差很多。但是,现在手机GPU的Die-Size也有逐渐变大的趋势,以FLOPS来表示的浮动小数点运算性能来看, iPhone 6的GPU比iPhone 5的GPU的运算性能要高4倍,性能提高的非常快。正如以哪个硬件为对象,优化的内容就完全不一样,开发手机软件的时候,作为我们发布对象的市场是哪个,需要慎重考虑。

系统内存空间虽然也会越来越大,但是正如GPU性能的提升和画面分辨率的提升并没有形成正比,所以内存空间依旧是稀有资源。

而且,和在SoC外面的又远又慢的系统内存的access是通过公交(路径,Bus)实现的,它和CPU,GPU消耗的电力和产生的热量是类似的,根据电池消耗和Soc温度调节功能的不同,可能会成为导致性能低下的原因,所以尽可能减少对系统内存的access。

我们看下PowerVR Series7XT的内部结构,心脏部位多数是Unified shading cluster,USC)的集合。USC即是scalar运算引擎,又是一般使用的浮点型单精度浮动小数点(FP16),也支持double型二倍精度浮动小数点(FP32)的运算。GPU整体作为 ALU(arithmetic logic unit,运算装置)搭载的处理器核数量最大已经提高到了512个。

作为手机GPU,PowerVR的传统特征是所谓的TBDR(Tile based deffered rendering)方式。

Viewport变换结束后,把画面分成小的tile(bin),把属于1 tile内的临近区域的Geometry集合相关的Pointer转送到搭载于GPU Chip上的小的、快的专用内存,像素处理好之后,把结果记录于系统内存的Frame buffer。此时,先计算物件的前后关系,根据Over-load把不需要的Pixel shader处理功能都删掉,运行Deffered rendering(延迟渲染)。

并没有采用PC用台式GPU的Tile分配,而是采用了简单的 IMR(Immediate mode rendering)方式。

内存带域策略来看,利用硬件支持的压缩格式虽然效果也挺好的,PowerVR支持自己的贴图压缩格式PVRTC。

安卓设备主流Mali或者Adreno的GPU仅实现了除了deferred rendering的TBR(Tile based rendering)。

现在,手机设备1080P以上也成了标准,分辨率和PC环境也没啥区别,Pixel shader处理比重也升高了。

分tile来渲染的方式,也有缺点,因为随着顶点数的增加,Tile overhead会增加,所以要控制顶点数量,以防顶点处理成为瓶颈。而且,在渲染中,如果要试图关于Frame buffer的accessh和复数渲染目标的连接的话,因为中间状态要存储到系统内存,会导致严重性能问题。

市场状况

  • 三星Galaxy S4的国内版(韩国版) - 三星自己研发的Exynos(Arm cortex + ARM MALI 的图形处理器组合)

  • 三星国外版和LTEA版 - Qualcomm(高通)公司的Snapdragon(晓龙) 800

两者压缩Texture的方式不同,所以两者在压缩Texture的memory Access speed,capacity 和image channel type上不同

  • iPhone和iPad - 由Arm cortex + PowerVR组成的mobile AP

PowerVR的Tile based rendering技术

* 没有Z buffer,内存的使用率高

* 不访问Z buffer,减少开销

* 不用担心渲染顺序,会自动作半透明处理

Alt text

来源:DeviceAtlas

上面这份数据来自DeviceAtlas[4],发布时间在2019年年中。这份数据统计的是截至2019年第一季度,DeviceAtlas数据库中36个不同国家的GPU使用率。这份统计实际可能受到DeviceAtlas样本量的局限,不过它依然符合我们的基本认知。由于它考察的是手机保有量,而非当季最新出货量,所以仍有大量老设备活跃。其中PowerVR Series7XT,实际是iPhone 7时代的GPU。其他更多出现在榜单上的设备皆来自高通和Arm。 下面的对比中,我们考察这些市场玩家最新推出的GPU旗舰产品,以及上一代GPU旗舰产品——除了苹果这样相对特殊的市场参与者,通常在GPU IP发布的半年到2年的时间里,实际的芯片产品才会问世,所以这些厂商的上一代GPU产品通常才是当前活跃在市场上的旗舰。 那么实际的对比对象就十分明确了,即:

  • 苹果A13 Bionic

  • 苹果A12 Bionic

  • 高通Adreno 650(高通骁龙865)

  • 高通Adreno 640(高通骁龙855)

  • Arm Mali G77(三星Exynos 990/联发科天玑1000)

  • Arm Mali G76(三星Exynos 9820/海思Kirin 990、980)

  • Imagination PowerVR A-Series

  • Imagination PowerVR Series 9

CPU和GPU整体系统架构

现在我们整体来看下包含CPU和GPU的系统架构,参考的是用于Sony Xperia Z4等机型的SOC 高通骁龙810内部数据流。

64位多核心CPU和Adreno GPU通信,结构是引用两边的系统内存上的几何,贴图和shader。

虽然,PC上CPU和GPU有各自专用的内存,但是,单机游戏机和手机设备的话,一般都是单一系统内存,CPU和GPU都能访问的一个整合的内存结构(Unified memory architecture,UMA)。

内存Bus如果单一的话,不管对耗电还是对内存芯片配线面积都是有利的。

UMA的优点是不管内存芯片多小,内存空间都能有效利用。

当CPU内存使用的少的时候,GPU相对可以使用更多的内存。同时,UMA的缺点是,CPU和GPU相互会抢内存带域,可能相互会干涉处理。

而且,不是UMA的时候,当CPU和GPU使用不同类型的内存芯片的时候,CPU使用低延迟的内存芯片,GPU使用的是宽带宽的内存芯片,按照处理器别,选用适合自己的work load,虽然能提高处理效率,但是像UMA这种情况又是无法妥协的。举个例子,以带宽优先,构成UMA,为了隐藏相对增长的Latency,要提高CPU的并行处理能力或者搭载更多的Cache.

虽然有同样的缺点,UMA在掌机中也利用的是除了减少内存芯片的种类,降低成本的优点外,因为是用所谓的Heterogeneous System Architectur,由CPU和GPU构成的异构处理器来编程控制的,和为了处理仅仅依靠CPU无法处理的并列computing workload的系统构成很适合

SOC天梯

https://www.techcenturion.com/smartphone-processors-ranking

Rank Processor Name Phone Centurion Mark 1 Apple A14 Bionic Apple iPhone 12 165* 2 Apple A13 Bionic Apple iPhone 11 154 3 Snapdragon 865+ Asus ROG Phone 3 150 4 Snapdragon 865 OnePlus 8 149 5 Dimensity 1000+ Xiaomi Redmi K30 Ultra 146 6 Apple A12 Bionic iPhone XS Max 146 7 Dimensity 1000 146* 8 Snapdragon 855+ Asus ROG Phone II 145 9 Exynos 990 Samsung Galaxy S20 Ultra 144 10 Snapdragon 855 OnePlus 7 Pro 144 11 Kirin 990 5G Huawei Mate 30 Pro 5G 144 12 Kirin 990 4G Huawei Mate 30 Pro 4G 143 13 Exynos 9825 Galaxy Note 10+ 142 14 Exynos 9820 Samsung Galaxy S10 140

通用并列处理

关于通用并列处理,专门为Heterogeneous Computing发布了叫做OpenCL的API。

以游戏来说,原来在CPU上发生的物理运算和AI处理,现在在GPU上也能进行,并且CPU和CPU可以渐渐的相互通信,相互共享信息,Heterogeneous Architecture的优势也渐渐的突显出来了。手机设备上也同样,不仅仅局限于游戏,一般的软件也是同样,对图片处理和音频处理,物理处理这种高度的数据处理需求也在越来越大,往后用Heterogeneous Computing来优化应该是趋势。

ARM

影响SOC性能更大的是其指令集和架构,目前大部分手机SOC都是基于ARM指令集和架构。ARM全称Acorn RISC Machine,是面向低预算市场的RISC微处理器设计公司,其下有A(Application Processor)、R(Real Time)、M(MCU)三个部门,手机SOC就出自A部门。

Ref

https://leegoonz.blog/2020/08/19/about-mobile-soc/ https://post.smzdm.com/p/a07855q0/ https://www.techcenturion.com/smartphone-processors-ranking https://www.eet-china.com/news/202001061219.html