ARM在硬件上不支持除法指令,編譯器是通過調(diào)用C庫函數(shù)來實現(xiàn)除法運算的,有許多不同類型的除法程序來適應(yīng)不同的除數(shù)和被除數(shù)。但直接利用C庫函數(shù)中的標(biāo)準(zhǔn)整數(shù)除法程序,根據(jù)執(zhí)行情況和輸入操作數(shù)的范圍,要花費20~100個周期,消耗較多的軟件運行時間。在實時嵌入式應(yīng)用中,對時間參數(shù)較為敏感,故可以考慮如何優(yōu)化避免除法消耗過多的CPU運行時間。
除法和模運算(/和%)執(zhí)行起來比較慢,所以應(yīng)盡量避免使用。但是,除數(shù)是常數(shù)的除法運算和用同一個除數(shù)的重復(fù)除法,執(zhí)行效率會比較高。在ARM中,可以利用單條MUL指令實現(xiàn)乘法操作。本文將闡述如何用乘法運算代替除法運算,以及如何使除法的次數(shù)最少化。
1 避免除法運算
在非嵌入式領(lǐng)域,因為CPU運算速度快、存儲器容量大,除法操作通常都是不加考慮直接使用的。但在嵌入式領(lǐng)域,首先需要考慮的是這些除法操作是否是必須的。以對環(huán)形緩沖區(qū)操作為例,經(jīng)常要用到除法,其實完全可以避免這些除法運算。

?
假定有一個buffer_size大小的環(huán)形緩沖區(qū),如圖1所示,offset指定目前所在的位置。通過increment字節(jié)來增加offset的值,一般是這樣寫的:
0ffset=(Offset+increment)%buffer_size;
效率更高的寫法是:
offset+=increment;
if(offset>=buffer_size){
offset-=buffer_size;
}
第一種寫法要花費50個周期,而第二種因為沒有除法運算,只須花費3個周期。這里假定increment
如果不能避免除法運算,那么就應(yīng)盡量使除數(shù)和被除數(shù)是無符號的整數(shù)。有符號的除法程序執(zhí)行起來更加慢,因為它們先要取得除數(shù)和被除數(shù)的絕對值,再調(diào)用無符號除法運算,最后再確定結(jié)果的符號。
2 充分利用商和余數(shù)
許多C語言庫中的除法函數(shù)返回商和余數(shù)。換句話說,每一個除法運算,余數(shù)是可以無償?shù)玫降?,反之亦然。例如,要在屏幕緩沖區(qū)找到偏移量為offset的屏幕位置(x,y),可以這樣寫:
typeclef struct{
int x;
int y;
}point;
point getxy_v1(unsigned int offset,unsigned int bytes_per_line){
point p;
p.y=offset/lt)ytes_per_line;
p.x=offset - p.y* bytes_per_line;
return p;
}
這里,似乎對p.x使用減法和乘法,少了一次除法運算;但是,實際上使用模運算或者取余操作效率更高,對getxy_v1改進如下:
point getxy_v2(unsigned int offset,unsigned int bytes_per_line){
point P;
P.x=offset%bytes_per_1ine;
P.y=offset/bytes_per_line;
return P;
}
從下面編譯器的輸出結(jié)果可以看到,只有一次除法調(diào)用。實際上,這個程序要比前面的getxy_vl少4條指令(注意,并不是對所有的編譯器和C庫都有這樣的結(jié)果)。
getxy_v2
STMFD r13!,{r4,r14};保存r4,lr人堆棧
MOV r4,r0 ;賦值后r4保存的為點P基址
MOV r0,r2 ;r0=bytes_per_line
BL rt_udiv ;調(diào)用無符號除法例程
(r0.;r1)=(rl/r0,rl%r0)
STR r0,[r4,#4] ;P.y=offset/bytes_per_line
STR rl,[r4,#o] ;P.x=offset%bytes_per_line
LDMFD r13!,(r4,pc);恢復(fù)上下文,返回
電子發(fā)燒友App




























評論