chinese直男口爆体育生外卖, 99久久er热在这里只有精品99, 又色又爽又黄18禁美女裸身无遮挡, gogogo高清免费观看日本电视,私密按摩师高清版在线,人妻视频毛茸茸,91论坛 兴趣闲谈,欧美 亚洲 精品 8区,国产精品久久久久精品免费

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認識你,還能領取20積分哦,立即完善>

3天內不再提示

TensorRT和Triton助力微信OCR降低耗時和成本

星星科技指導員 ? 來源:NVIDIA ? 作者:NVIDIA ? 2022-04-13 14:44 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

簡介

? 本案例中通過NVIDIA T4 GPU,TensorRT和Triton, 幫助微信OCR降低整體耗時46%, 并將系統(tǒng)的失敗率降低81%,同時降低了高達78%的服務器數量。

? 本案例主要應用到 NVIDIA GPU ,TensorRT和Triton。

客戶簡介

騰訊微信是一款跨平臺的通訊工具。支持通過手機網絡發(fā)送語音、圖片、視頻和文字等。截至2021年6月,微信在全球擁有超過12億活躍用戶,是國內活躍用戶最多的社交軟件。

微信識物是一款主打物品識別的 AI 產品,通過相機拍攝物品,更高效、更智能地獲取信息。2020 年,微信識物拓展了更多識別場景,上線了微信版的圖片搜索。打開微信掃一掃,左滑切換到“識物”功能,對準想要了解的物品正面,可以獲取對應的物品信息,包括物品百科、相關資訊、相關商品

2021年1月, 微信發(fā)布的微信8.0,版本更新支持圖片文字提取的功能。用戶在聊天界面和朋友圈中長按圖片就可以提取圖片中文字,然后一鍵轉發(fā)、復制或收藏。

挑戰(zhàn)

微信識物包含檢測、圖像召回、信息提煉等環(huán)節(jié),OCR主要包括識別和檢測,這兩種應用都有非常大的計算量,在用Pytorch進行模型的推理時,一方面時延特別大,導致用戶體驗受損;另一方面,顯存占用很大,單張NVIDIA T4上部署的模型數比較少,導致推理請求的并發(fā)數上不去,請求失敗的概率太高,只能通過增加機器的方式來提高并發(fā)能力,業(yè)務部署成本較高。再次,使用的模型經常變化,而業(yè)務需要更換后的模型能夠快速地加速和上線部署。

方案

基于以上挑戰(zhàn),騰訊微信選擇了采用NVIDIA 的TensorRT對模型進行推理加速,并利用NVIDIA Triton推理服務器在T4 GPU上進行在線部署,在提升用戶體驗的同時,大幅降低了服務成本。

1、 通過使用TensorRT對微信識物和OCR的模型進行加速,在都使用FP32的情況下,與Pytorch相對,時延降低50%左右。

2、 在OCR的識別和檢測階段,使用TensorRT結合NVIDIA T4 GPU 的FP16 Tensor Core,在保證精度的同時,識別的時延進一步降低了50%,檢測降低了20%。

3、 在微信識物的分類和檢測任務中,通過使用NVIDIA T4 GPU 的int8 Tensor Core,并結合QAT,在滿足精度要求的前提下,進一步大幅提升了性能。

4、 通過使用FP16和int8 低精度模式,在大幅降低推理時延的同時,大大減少了顯存的占用,在FP16模式下,單模型顯存占用僅占FP32模式的40%–50%, 而在int8模式下,單模型顯存占用僅占FP32模式的30%左右。在提高單張T4卡上部署的模型數量的同時,大幅提高了單GPU的推理請求并發(fā)能力。

5、 Triton的dynamic batch和多實例等特性,幫助微信將在滿足時延要求的同時,提高了系統(tǒng)整體的并發(fā)能力,將系統(tǒng)失敗降低了81%。

6、 TensorRT可以對模型進行快速的加速,Triton則可以對加速后的模型進行快速的部署,滿足了業(yè)務對修改后的模型進行快速部署的需求,同時也大大減少了工程人員的工作量。

效果

通過使用NVIDIA的TensorRT對微信識物和OCR的模型進行加速,在降低單次推理時延50%以上的同時,節(jié)約了多達64%的顯存。結合Triton的dynamic batch和多實例的功能,OCR的整體時延降低了46%,系統(tǒng)失敗率降低了81%。大大提高了用戶的體驗,并且服務器的數量減少了多達78%,極大降低了服務的成本。

審核編輯:郭婷

聲明:本文內容及配圖由入駐作者撰寫或者入駐合作網站授權轉載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網立場。文章及其配圖僅供工程師學習之用,如有內容侵權或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • NVIDIA
    +關注

    關注

    14

    文章

    5444

    瀏覽量

    108571
  • gpu
    gpu
    +關注

    關注

    28

    文章

    5050

    瀏覽量

    134014
  • 服務器
    +關注

    關注

    13

    文章

    10013

    瀏覽量

    90353
收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評論

    相關推薦
    熱點推薦

    小語種OCR標注效率提升10+倍:PaddleOCR+ERNIE 4.5自動標注實戰(zhàn)解析

    摘要 :小語種OCR研發(fā)的核心瓶頸在于高質量標注數據的稀缺與高昂成本。本文介紹一種創(chuàng)新的自動化標注方案,利用 PaddleOCR 進行文本檢測與裁剪,并調用 ERNIE 4.5 大模型進行雙重預測
    的頭像 發(fā)表于 08-29 11:26 ?3111次閱讀
    小語種<b class='flag-5'>OCR</b>標注效率提升10+倍:PaddleOCR+ERNIE 4.5自動標注實戰(zhàn)解析

    如何利用OCR技術實現(xiàn)高效集裝箱箱號識別?

    在現(xiàn)代物流和海關監(jiān)管領域,快速準確地識別集裝箱箱號是提升通關效率、降低運營成本的關鍵。OCR(光學字符識別)技術的應用,為這一需求提供了智能化解決方案。通過結合高清成像設備和先進的算法,OCR
    的頭像 發(fā)表于 08-12 10:48 ?397次閱讀
    如何利用<b class='flag-5'>OCR</b>技術實現(xiàn)高效集裝箱箱號識別?

    使用NVIDIA TritonTensorRT-LLM部署TTS應用的最佳實踐

    針對基于 Diffusion 和 LLM 類別的 TTS 模型,NVIDIA TritonTensorRT-LLM 方案能顯著提升推理速度。在單張 NVIDIA Ada Lovelace
    的頭像 發(fā)表于 06-12 15:37 ?1132次閱讀
    使用NVIDIA <b class='flag-5'>Triton</b>和<b class='flag-5'>TensorRT</b>-LLM部署TTS應用的最佳實踐

    高能耗時代,安科瑞能量管理系統(tǒng)如何化解電網能量管理難題?

    電網技術的提出,為高效利用這些新能源電力提供了重要的技術方向。? 一、高能耗時代,電網能量管理面臨哪些挑戰(zhàn)? 在當今高能耗時代,電網能量管理正面臨著諸多嚴峻挑戰(zhàn),這些挑戰(zhàn)猶如一道道
    的頭像 發(fā)表于 04-01 16:12 ?518次閱讀
    高能<b class='flag-5'>耗時</b>代,安科瑞能量管理系統(tǒng)如何化解<b class='flag-5'>微</b>電網能量管理難題?

    租用站群服務器時如何降低成本?

    在租用站群服務器時,降低成本是許多站群管理者關注的重要問題。主機推薦小編為您整理發(fā)布租用站群服務器時如何降低成本,以下是一些實用的策略和建議,有助于在保持性能的同時降低租用成本。
    的頭像 發(fā)表于 01-22 10:45 ?478次閱讀

    NVIDIA技術助力Pantheon Lab數字人實時交互解決方案

    、NVIDIA Triton,Pantheon Lab 訓練速度提高 10 倍、推理延遲降低 50%,以及用戶參與度提升 30%。這些進步使對話式 AI 能夠提供實時且真實的互動,使 Pantheon Lab 在數字人技術不斷革新。
    的頭像 發(fā)表于 01-14 11:19 ?843次閱讀

    Triton編譯器與GPU編程的結合應用

    Triton編譯器簡介 Triton編譯器是一種針對并行計算優(yōu)化的編譯器,它能夠自動將高級語言代碼轉換為針對特定硬件優(yōu)化的低級代碼。Triton編譯器的核心優(yōu)勢在于其能夠識別并行模式,自動進行代碼
    的頭像 發(fā)表于 12-25 09:13 ?1163次閱讀

    Triton編譯器的優(yōu)化技巧

    在現(xiàn)代計算環(huán)境中,編譯器的性能對于軟件的運行效率至關重要。Triton 編譯器作為一個先進的編譯器框架,提供了一系列的優(yōu)化技術,以確保生成的代碼既高效又適應不同的硬件架構。 1. 指令選擇
    的頭像 發(fā)表于 12-25 09:09 ?1552次閱讀

    Triton編譯器的優(yōu)勢與劣勢分析

    Triton編譯器作為一種新興的深度學習編譯器,具有一系列顯著的優(yōu)勢,同時也存在一些潛在的劣勢。以下是對Triton編譯器優(yōu)勢與劣勢的分析: 優(yōu)勢 高效性能優(yōu)化 : Triton編譯器通過塊級數
    的頭像 發(fā)表于 12-25 09:07 ?1667次閱讀

    Triton編譯器在機器學習中的應用

    1. Triton編譯器概述 Triton編譯器是NVIDIA Triton推理服務平臺的一部分,它負責將深度學習模型轉換為優(yōu)化的格式,以便在NVIDIA GPU上高效運行。Triton
    的頭像 發(fā)表于 12-24 18:13 ?1446次閱讀

    Triton編譯器支持的編程語言

    Triton編譯器支持的編程語言主要包括以下幾種: 一、主要編程語言 Python :Triton編譯器通過Python接口提供了對Triton語言和編譯器的訪問,使得用戶可以在Python環(huán)境中
    的頭像 發(fā)表于 12-24 17:33 ?1335次閱讀

    Triton編譯器與其他編譯器的比較

    Triton編譯器與其他編譯器的比較主要體現(xiàn)在以下幾個方面: 一、定位與目標 Triton編譯器 : 定位:專注于深度學習中最核心、最耗時的張量運算的優(yōu)化。 目標:提供一個高度抽象、靈活、高效
    的頭像 發(fā)表于 12-24 17:25 ?1415次閱讀

    Triton編譯器功能介紹 Triton編譯器使用教程

    Triton 是一個開源的編譯器前端,它支持多種編程語言,包括 C、C++、Fortran 和 Ada。Triton 旨在提供一個可擴展和可定制的編譯器框架,允許開發(fā)者添加新的編程語言特性和優(yōu)化技術
    的頭像 發(fā)表于 12-24 17:23 ?2342次閱讀

    TensorRT-LLM低精度推理優(yōu)化

    本文將分享 TensorRT-LLM 中低精度量化內容,并從精度和速度角度對比 FP8 與 INT8。首先介紹性能,包括速度和精度。其次,介紹量化工具 NVIDIA TensorRT Model
    的頭像 發(fā)表于 11-19 14:29 ?2112次閱讀
    <b class='flag-5'>TensorRT</b>-LLM低精度推理優(yōu)化