国产三级小视频,爆乳姉在线播放

cuBLAS 庫可提供基本線性代數(shù)子程序（BLAS）的 GPU 加速實現(xiàn)。cuBLAS 利用針對 NVIDIA GPU 高度優(yōu)化的插入式行業(yè)標(biāo)準(zhǔn) BLAS API，加速 AI 和 HPC 應(yīng)用。cuBLAS 庫包含用于批量運算、跨多個 GPU 的執(zhí)行以及混合精度和低精度執(zhí)行的擴展程序。通過使用 cuBLAS，應(yīng)用將能自動從定期性能提升及新的 GPU 體系架構(gòu)中受益。cuBLAS 庫包含在 NVIDIA HPC SDK 和 CUDA 工具包中。

cuBLAS 多 GPU 擴展

cuBLASMg 提供了先進的多 GPU 矩陣間乘法，您可在多臺設(shè)備間以 2D 塊循環(huán)方式分發(fā)每個矩陣。cuBLASMg 目前已加入 CUDA 數(shù)學(xué)庫搶先體驗計劃。

cuBLAS 性能

cuBLAS 庫針對 NVIDIAGPU 上的性能進行了高度優(yōu)化，并利用 Tensor Core 對低精度和混合精度矩陣乘法進行加速。

cuBLAS 的主要特性

全面支持 152 個標(biāo)準(zhǔn) BLAS 例程

支持半精度和整數(shù)矩陣乘法

GEMM 和 GEMM 擴展程序針對 Volta 及 Turing Tensor Core 進行了優(yōu)化

針對各種深度學(xué)習(xí)模型中使用的規(guī)模調(diào)整 GEMM 性能

支持用于并發(fā)操作的 CUDA 流

加速計算基礎(chǔ)——CUDA C/C++

您將能夠使用最基本的 CUDA 工具和技術(shù)，加速和優(yōu)化僅適用于 CPU 的 C/C++ 應(yīng)用程序。您將了解 CUDA 開發(fā)的迭代風(fēng)格，這將幫助您快速發(fā)布加速應(yīng)用程序。

加速計算基礎(chǔ)——CUDA Python

您將了解使用 CUDA 和 Numba 編譯器在大規(guī)模并行 GPU 上加速運行 Python 應(yīng)用程序的基本工具和技能。

通過 CUDA C++ 在多個 GPU 之間擴展工作負載

您將學(xué)習(xí)如何在單個節(jié)點上使用多個 GPU，構(gòu)建強大高效的 CUDA C++ 應(yīng)用程序。

通過并發(fā)流加速 CUDA C++ 應(yīng)用程序

您將在 CUDA C++ 應(yīng)用程序中，學(xué)習(xí)利用 CUDA Streams 進行復(fù)制/計算重疊。

審核編輯：劉清

聲明：本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點僅代表作者本人，不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用，如有內(nèi)容侵權(quán)或者其他違規(guī)問題，請聯(lián)系本站處理。舉報投訴