chinese直男口爆体育生外卖, 99久久er热在这里只有精品99, 又色又爽又黄18禁美女裸身无遮挡, gogogo高清免费观看日本电视,私密按摩师高清版在线,人妻视频毛茸茸,91论坛 兴趣闲谈,欧美 亚洲 精品 8区,国产精品久久久久精品免费

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認識你,還能領取20積分哦,立即完善>

3天內(nèi)不再提示

最常見的4個神經(jīng)網(wǎng)絡錯誤是什么?

深度學習自然語言處理 ? 來源:AI公園 ? 作者:Yuval Greenfield ? 2020-11-27 10:49 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

最常見的神經(jīng)網(wǎng)絡錯誤:

1)你沒有首先嘗試過擬合單個batch。

2)你忘了為網(wǎng)絡設置train/eval模式。

3)在.backward()之前忘記了.zero_grad()(在pytorch中)。

4)將softmaxed輸出傳遞給了期望原始logits的損失,還有其他嗎?

這篇文章將逐點分析這些錯誤是如何在PyTorch代碼示例中體現(xiàn)出來的。

代碼:https://github.com/missinglinkai/common-nn-mistakes

常見錯誤 #1 你沒有首先嘗試過擬合單個batch

Andrej說我們應該過擬合單個batch。為什么?好吧,當你過擬合了單個batch —— 你實際上是在確保模型在工作。我不想在一個巨大的數(shù)據(jù)集上浪費了幾個小時的訓練時間,只是為了發(fā)現(xiàn)因為一個小錯誤,它只有50%的準確性。當你的模型完全記住輸入時,你會得到的結(jié)果是對其最佳表現(xiàn)的很好的預測。

可能最佳表現(xiàn)為零,因為在執(zhí)行過程中拋出了一個異常。但這沒關系,因為我們很快就能發(fā)現(xiàn)問題并解決它??偨Y(jié)一下,為什么你應該從數(shù)據(jù)集的一個小子集開始過擬合:

發(fā)現(xiàn)bug

估計最佳的可能損失和準確率

快速迭代

在PyTorch數(shù)據(jù)集中,你通常在dataloader上迭代。你的第一個嘗試可能是索引train_loader。

#TypeError:'DataLoader'objectdoesnotsupportindexing first_batch=train_loader[0]

你會立即看到一個錯誤,因為DataLoaders希望支持網(wǎng)絡流和其他不需要索引的場景。所以沒有__getitem__方法,這導致了[0]操作失敗,然后你會嘗試將其轉(zhuǎn)換為list,這樣就可以支持索引。

#slow,wasteful first_batch=list(train_loader)[0]

但這意味著你要評估整個數(shù)據(jù)集這會消耗你的時間和內(nèi)存。那么我們還能嘗試什么呢?

Python for循環(huán)中,當你輸入如下:

foriteminiterable: do_stuff(item)

你有效地得到了這個:

iterator=iter(iterable) try: whileTrue: item=next(iterator) do_stuff(item) exceptStopIteration: pass

調(diào)用“iter”函數(shù)來創(chuàng)建迭代器,然后在循環(huán)中多次調(diào)用該函數(shù)的“next”來獲取下一個條目。直到我們完成時,StopIteration被觸發(fā)。在這個循環(huán)中,我們只需要調(diào)用next, next, next… 。為了模擬這種行為但只獲取第一項,我們可以使用這個:

first=next(iter(iterable))

我們調(diào)用“iter”來獲得迭代器,但我們只調(diào)用“next”函數(shù)一次。注意,為了清楚起見,我將下一個結(jié)果分配到一個名為“first”的變量中。我把這叫做“next-iter” trick。在下面的代碼中,你可以看到完整的train data loader的例子:

forbatch_idx,(data,target)inenumerate(train_loader): #trainingcodehere

下面是如何修改這個循環(huán)來使用 first-iter trick :

first_batch=next(iter(train_loader)) forbatch_idx,(data,target)inenumerate([first_batch]*50): #trainingcodehere

你可以看到我將“first_batch”乘以了50次,以確保我會過擬合。

常見錯誤 #2: 忘記為網(wǎng)絡設置 train/eval 模式

為什么PyTorch關注我們是訓練還是評估模型?最大的原因是dropout。這項技術在訓練中隨機去除神經(jīng)元。

想象一下,如果右邊的紅色神經(jīng)元是唯一促成正確結(jié)果的神經(jīng)元。一旦我們移除紅色神經(jīng)元,它就迫使其他神經(jīng)元訓練和學習如何在沒有紅色的情況下保持準確。這種drop-out提高了最終測試的性能 —— 但它對訓練期間的性能產(chǎn)生了負面影響,因為網(wǎng)絡是不全的。在運行腳本并查看MissingLink dashobard的準確性時,請記住這一點。

在這個特定的例子中,似乎每50次迭代就會降低準確度。

如果我們檢查一下代碼 —— 我們看到確實在train函數(shù)中設置了訓練模式。

deftrain(model,optimizer,epoch,train_loader,validation_loader): model.train()#???????????? forbatch_idx,(data,target)inexperiment.batch_loop(iterable=train_loader): data,target=Variable(data),Variable(target) #Inference output=model(data) loss_t=F.nll_loss(output,target) #Theiconicgrad-back-steptrio optimizer.zero_grad() loss_t.backward() optimizer.step() ifbatch_idx%args.log_interval==0: train_loss=loss_t.item() train_accuracy=get_correct_count(output,target)*100.0/len(target) experiment.add_metric(LOSS_METRIC,train_loss) experiment.add_metric(ACC_METRIC,train_accuracy) print('TrainEpoch:{}[{}/{}({:.0f}%)] Loss:{:.6f}'.format( epoch,batch_idx,len(train_loader), 100.*batch_idx/len(train_loader),train_loss)) withexperiment.validation(): val_loss,val_accuracy=test(model,validation_loader)#???????????? experiment.add_metric(LOSS_METRIC,val_loss) experiment.add_metric(ACC_METRIC,val_accuracy)

這個問題不太容易注意到,在循環(huán)中我們調(diào)用了test函數(shù)。

deftest(model,test_loader): model.eval() #...

在test函數(shù)內(nèi)部,我們將模式設置為eval!這意味著,如果我們在訓練過程中調(diào)用了test函數(shù),我們就會進eval模式,直到下一次train函數(shù)被調(diào)用。這就導致了每一個epoch中只有一個batch使用了drop-out ,這就導致了我們看到的性能下降。

修復很簡單 —— 我們將model.train()向下移動一行,讓如訓練循環(huán)中。理想的模式設置是盡可能接近推理步驟,以避免忘記設置它。修正后,我們的訓練過程看起來更合理,沒有中間的峰值出現(xiàn)。請注意,由于使用了drop-out ,訓練準確性會低于驗證準確性。

常用的錯誤 #3: 忘記在.backward()之前進行.zero_grad()

當在 “l(fā)oss”張量上調(diào)用 “backward” 時,你是在告訴PyTorch從loss往回走,并計算每個權(quán)重對損失的影響有多少,也就是這是計算圖中每個節(jié)點的梯度。使用這個梯度,我們可以最優(yōu)地更新權(quán)值。

這是它在PyTorch代碼中的樣子。最后的“step”方法將根據(jù)“backward”步驟的結(jié)果更新權(quán)重。從這段代碼中可能不明顯的是,如果我們一直在很多個batch上這么做,梯度會爆炸,我們使用的step將不斷變大。

output=model(input)#forward-pass loss_fn.backward()#backward-pass optimizer.step()#updateweightsbyanevergrowinggradient????????????

為了避免step變得太大,我們使用zero_grad方法。

output=model(input)#forward-pass optimizer.zero_grad()#resetgradient???? loss_fn.backward()#backward-pass optimizer.step()#updateweightsusingareasonablysizedgradient????

這可能感覺有點過于明顯,但它確實賦予了對梯度的精確控制。有一種方法可以確保你沒有搞混,那就是把這三個函數(shù)放在一起:

zero_grad

backward

step

在我們的代碼例子中,在完全不使用zero_grad的情況下。神經(jīng)網(wǎng)絡開始變得更好,因為它在改進,但梯度最終會爆炸,所有的更新變得越來越垃圾,直到網(wǎng)絡最終變得無用。

調(diào)用backward之后再做zero_grad。什么也沒有發(fā)生,因為我們擦掉了梯度,所以權(quán)重沒有更新。剩下的唯一有變化的是dropout。

我認為在每次step方法被調(diào)用時自動重置梯度是有意義的。

在backward的時候不使用zero_grad的一個原因是,如果你每次調(diào)用step()時都要多次調(diào)用backward,例如,如果你每個batch只能將一個樣本放入內(nèi)存中,那么一個梯度會噪聲太大,你想要在每個step中聚合幾個batch的梯度。另一個原因可能是在計算圖的不同部分調(diào)用backward—— 但在這種情況下,你也可以把損失加起來,然后在總和上調(diào)用backward。

常見錯誤 #4: 你把做完softmax的結(jié)果送到了需要原始logits的損失函數(shù)中

logits是最后一個全連接層的激活值。softmax也是同樣的激活值,但是經(jīng)過了標準化。logits值,你可以看到有些是正的,一些是負的。而log_softmax之后的值,全是負值。如果看柱狀圖的話,可以看到分布式一樣的,唯一的差別就是尺度,但就是這個細微的差別,導致最后的數(shù)學計算完全不一樣了。但是為什么這是一個常見的錯誤呢?在PyTorch的官方MNIST例子中,查看forward方法,在最后你可以看到最后一個全連接層self.fc2,然后就是log_softmax。

但是當你查看官方的PyTorch resnet或者AlexNet模型的時候,你會發(fā)現(xiàn)這些模型在最后并沒有softmax層,最后得到就是全連接的輸出,就是logits。

這兩個的差別在文檔中沒有說的很清楚。如果你查看nll_loss函數(shù),并沒有提得輸入是logits還是softmax,你的唯一希望是在示例代碼中發(fā)現(xiàn)nll_loss使用了log_softmax作為輸入。

原文標題:收藏 | 使用PyTorch時,最常見的4個錯誤

文章出處:【微信公眾號:深度學習自然語言處理】歡迎添加關注!文章轉(zhuǎn)載請注明出處。

責任編輯:haq

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學習之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴

原文標題:收藏 | 使用PyTorch時,最常見的4個錯誤

文章出處:【微信號:zenRRan,微信公眾號:深度學習自然語言處理】歡迎添加關注!文章轉(zhuǎn)載請注明出處。

收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評論

    相關推薦
    熱點推薦

    自動駕駛中常提的卷積神經(jīng)網(wǎng)絡啥?

    在自動駕駛領域,經(jīng)常會聽到卷積神經(jīng)網(wǎng)絡技術。卷積神經(jīng)網(wǎng)絡,簡稱為CNN,是一種專門用來處理網(wǎng)格狀數(shù)據(jù)(比如圖像)的深度學習模型。CNN在圖像處理中尤其常見,因為圖像本身就可以看作是由像素排列成的二維網(wǎng)格。
    的頭像 發(fā)表于 11-19 18:15 ?1809次閱讀
    自動駕駛中常提的卷積<b class='flag-5'>神經(jīng)網(wǎng)絡</b>是<b class='flag-5'>個</b>啥?

    NMSIS神經(jīng)網(wǎng)絡庫使用介紹

    (q7_t) 和 16 位整數(shù) (q15_t)。 卷積神經(jīng)網(wǎng)絡示例: 本示例中使用的 CNN 基于來自 Caffe 的 CIFAR-10 示例。神經(jīng)網(wǎng)絡由 3 卷積層組成,中間散布著 ReLU
    發(fā)表于 10-29 06:08

    在Ubuntu20.04系統(tǒng)中訓練神經(jīng)網(wǎng)絡模型的一些經(jīng)驗

    本帖欲分享在Ubuntu20.04系統(tǒng)中訓練神經(jīng)網(wǎng)絡模型的一些經(jīng)驗。我們采用jupyter notebook作為開發(fā)IDE,以TensorFlow2為訓練框架,目標是訓練一手寫數(shù)字識別的神經(jīng)網(wǎng)絡
    發(fā)表于 10-22 07:03

    液態(tài)神經(jīng)網(wǎng)絡(LNN):時間連續(xù)性與動態(tài)適應性的神經(jīng)網(wǎng)絡

    1.算法簡介液態(tài)神經(jīng)網(wǎng)絡(LiquidNeuralNetworks,LNN)是一種新型的神經(jīng)網(wǎng)絡架構(gòu),其設計理念借鑒自生物神經(jīng)系統(tǒng),特別是秀麗隱桿線蟲的神經(jīng)結(jié)構(gòu),盡管這種微生物的
    的頭像 發(fā)表于 09-28 10:03 ?646次閱讀
    液態(tài)<b class='flag-5'>神經(jīng)網(wǎng)絡</b>(LNN):時間連續(xù)性與動態(tài)適應性的<b class='flag-5'>神經(jīng)網(wǎng)絡</b>

    無刷電機小波神經(jīng)網(wǎng)絡轉(zhuǎn)子位置檢測方法的研究

    摘要:論文通過對無刷電機數(shù)學模型的推導,得出轉(zhuǎn)角:與三相相電壓之間存在映射關系,因此構(gòu)建了一以三相相電壓為輸人,轉(zhuǎn)角為輸出的小波神經(jīng)網(wǎng)絡來實現(xiàn)轉(zhuǎn)角預測,并采用改進遺傳算法來訓練網(wǎng)絡結(jié)構(gòu)與參數(shù),借助
    發(fā)表于 06-25 13:06

    基于FPGA搭建神經(jīng)網(wǎng)絡的步驟解析

    本文的目的是在一神經(jīng)網(wǎng)絡已經(jīng)通過python或者MATLAB訓練好的神經(jīng)網(wǎng)絡模型,將訓練好的模型的權(quán)重和偏置文件以TXT文件格式導出,然后通過python程序?qū)xt文件轉(zhuǎn)化為coe文件,(coe
    的頭像 發(fā)表于 06-03 15:51 ?878次閱讀
    基于FPGA搭建<b class='flag-5'>神經(jīng)網(wǎng)絡</b>的步驟解析

    神經(jīng)網(wǎng)絡壓縮框架 (NNCF) 中的過濾器修剪統(tǒng)計數(shù)據(jù)怎么查看?

    無法觀察神經(jīng)網(wǎng)絡壓縮框架 (NNCF) 中的過濾器修剪統(tǒng)計數(shù)據(jù)
    發(fā)表于 03-06 07:10

    BP神經(jīng)網(wǎng)絡與卷積神經(jīng)網(wǎng)絡的比較

    BP神經(jīng)網(wǎng)絡與卷積神經(jīng)網(wǎng)絡在多個方面存在顯著差異,以下是對兩者的比較: 一、結(jié)構(gòu)特點 BP神經(jīng)網(wǎng)絡 : BP神經(jīng)網(wǎng)絡是一種多層的前饋神經(jīng)網(wǎng)絡
    的頭像 發(fā)表于 02-12 15:53 ?1281次閱讀

    BP神經(jīng)網(wǎng)絡的優(yōu)缺點分析

    BP神經(jīng)網(wǎng)絡(Back Propagation Neural Network)作為一種常用的機器學習模型,具有顯著的優(yōu)點,同時也存在一些不容忽視的缺點。以下是對BP神經(jīng)網(wǎng)絡優(yōu)缺點的分析: 優(yōu)點
    的頭像 發(fā)表于 02-12 15:36 ?1527次閱讀

    什么是BP神經(jīng)網(wǎng)絡的反向傳播算法

    BP神經(jīng)網(wǎng)絡的反向傳播算法(Backpropagation Algorithm)是一種用于訓練神經(jīng)網(wǎng)絡的有效方法。以下是關于BP神經(jīng)網(wǎng)絡的反向傳播算法的介紹: 一、基本概念 反向傳播算法是BP
    的頭像 發(fā)表于 02-12 15:18 ?1256次閱讀

    BP神經(jīng)網(wǎng)絡與深度學習的關系

    ),是一種多層前饋神經(jīng)網(wǎng)絡,它通過反向傳播算法進行訓練。BP神經(jīng)網(wǎng)絡由輸入層、一或多個隱藏層和輸出層組成,通過逐層遞減的方式調(diào)整網(wǎng)絡權(quán)重,目的是最小化
    的頭像 發(fā)表于 02-12 15:15 ?1323次閱讀

    BP神經(jīng)網(wǎng)絡的基本原理

    BP神經(jīng)網(wǎng)絡(Back Propagation Neural Network)的基本原理涉及前向傳播和反向傳播兩核心過程。以下是關于BP神經(jīng)網(wǎng)絡基本原理的介紹: 一、網(wǎng)絡結(jié)構(gòu) BP
    的頭像 發(fā)表于 02-12 15:13 ?1487次閱讀

    BP神經(jīng)網(wǎng)絡在圖像識別中的應用

    傳播神經(jīng)網(wǎng)絡(Back Propagation Neural Network),是一種多層前饋神經(jīng)網(wǎng)絡,主要通過反向傳播算法進行學習。它通常包括輸入層、一或多個隱藏層和輸出層。BP神經(jīng)網(wǎng)絡
    的頭像 發(fā)表于 02-12 15:12 ?1162次閱讀

    深度學習入門:簡單神經(jīng)網(wǎng)絡的構(gòu)建與實現(xiàn)

    深度學習中,神經(jīng)網(wǎng)絡是核心模型。今天我們用 Python 和 NumPy 構(gòu)建一簡單的神經(jīng)網(wǎng)絡神經(jīng)網(wǎng)絡由多個神經(jīng)元組成,
    的頭像 發(fā)表于 01-23 13:52 ?832次閱讀

    人工神經(jīng)網(wǎng)絡的原理和多種神經(jīng)網(wǎng)絡架構(gòu)方法

    在上一篇文章中,我們介紹了傳統(tǒng)機器學習的基礎知識和多種算法。在本文中,我們會介紹人工神經(jīng)網(wǎng)絡的原理和多種神經(jīng)網(wǎng)絡架構(gòu)方法,供各位老師選擇。 01 人工神經(jīng)網(wǎng)絡 ? 人工神經(jīng)網(wǎng)絡模型之所
    的頭像 發(fā)表于 01-09 10:24 ?2213次閱讀
    人工<b class='flag-5'>神經(jīng)網(wǎng)絡</b>的原理和多種<b class='flag-5'>神經(jīng)網(wǎng)絡</b>架構(gòu)方法