女人被狂躁到高潮视频免费无遮挡,内射人妻骚骚骚,免费人成小说在线观看网站,九九影院午夜理论片少妇,免费av永久免费网址

當(dāng)前位置：首頁(yè) > 物聯(lián)網(wǎng) > 智能應(yīng)用

了解推理時(shí)間計(jì)算

時(shí)間：2025-02-10 09:28:51

關(guān)鍵字：機(jī)器學(xué)習(xí) 人工智能

手機(jī)看文章

掃描二維碼
隨時(shí)隨地手機(jī)看文章

[導(dǎo)讀]在機(jī)器學(xué)習(xí)和人工智能領(lǐng)域，推斷是將經(jīng)過(guò)訓(xùn)練的模型應(yīng)用于現(xiàn)實(shí)世界數(shù)據(jù)以生成預(yù)測(cè)或決策的階段。在模型接受了訓(xùn)練之后，可以在計(jì)算上進(jìn)行密集且耗時(shí)，推理過(guò)程允許模型進(jìn)行預(yù)測(cè)，以提供可行的結(jié)果。

在機(jī)器學(xué)習(xí)和人工智能領(lǐng)域，推斷是將經(jīng)過(guò)訓(xùn)練的模型應(yīng)用于現(xiàn)實(shí)世界數(shù)據(jù)以生成預(yù)測(cè)或決策的階段。在模型接受了訓(xùn)練之后，可以在計(jì)算上進(jìn)行密集且耗時(shí)，推理過(guò)程允許模型進(jìn)行預(yù)測(cè)，以提供可行的結(jié)果。

推理時(shí)間計(jì)算

推理時(shí)間計(jì)算是指使用訓(xùn)練有素的模型進(jìn)行此類預(yù)測(cè)所需的計(jì)算能力量。訓(xùn)練模型涉及處理大型數(shù)據(jù)集以學(xué)習(xí)模式和關(guān)系，但推斷是該模型用于對(duì)新的，看不見(jiàn)的數(shù)據(jù)進(jìn)行預(yù)測(cè)的過(guò)程。在現(xiàn)實(shí)世界中，此階段至關(guān)重要，例如圖像識(shí)別，自然語(yǔ)言處理，自動(dòng)駕駛汽車等。

雖然訓(xùn)練時(shí)間和準(zhǔn)確性通常是ML模型開(kāi)發(fā)過(guò)程中的重點(diǎn)，但推理時(shí)間和效率同樣重要，尤其是在將模型部署到大規(guī)模生產(chǎn)環(huán)境中時(shí)。推斷期間模型的性能會(huì)影響實(shí)時(shí)用戶體驗(yàn)和功耗等各個(gè)現(xiàn)實(shí)世界方面。例如，在自動(dòng)駕駛用例中，響應(yīng)速度非常緩慢的模型可能無(wú)法使用。

自適應(yīng)推理時(shí)間計(jì)算

盡管通過(guò)增加的預(yù)訓(xùn)練來(lái)擴(kuò)展模型大小一直是改善模型性能的主要方法，但自適應(yīng)推理時(shí)間計(jì)算使LLM在推理時(shí)在推理時(shí)間越來(lái)越多地思考，并使用各種策略來(lái)改善其初始響應(yīng)。 LLM可以根據(jù)任務(wù)的感知難度自適應(yīng)分配計(jì)算來(lái)更有效。

自適應(yīng)推理時(shí)間計(jì)算是我們對(duì)LLM性能的看法，從固定的計(jì)算配額轉(zhuǎn)變?yōu)楦邉?dòng)態(tài)和有效的方法的范式轉(zhuǎn)變。自適應(yīng)技術(shù)無(wú)需生成預(yù)定數(shù)量的響應(yīng)或使用固定的計(jì)算配額進(jìn)行搜索，而是根據(jù)任務(wù)的難度和自身感知到的改進(jìn)能力，使模型可以隨時(shí)調(diào)整其計(jì)算支出。例如，LLM可能會(huì)決定為一個(gè)充滿挑戰(zhàn)的數(shù)學(xué)問(wèn)題生成更多樣本，在該問(wèn)題中，它正在努力尋找解決方案，同時(shí)迅速返回單個(gè)，自信的響應(yīng)以進(jìn)行簡(jiǎn)單的事實(shí)查詢。這種適應(yīng)性可以導(dǎo)致性能和效率的顯著提高，從而使LLM可以在最小化浪費(fèi)的計(jì)算時(shí)更有效地解決問(wèn)題。

推論指標(biāo)

有幾種傳統(tǒng)的指標(biāo)來(lái)評(píng)估LLM TTFT，TBT，TPOT和歸一化延遲的性能。盡管這些指標(biāo)在某些方面很有用，但它們無(wú)法提供實(shí)時(shí)體驗(yàn)的完整圖片，有時(shí)可能會(huì)產(chǎn)生誤導(dǎo)。

是時(shí)候首先令牌(ttft)

該度量標(biāo)準(zhǔn)衡量請(qǐng)求到達(dá)的時(shí)間與第一個(gè)輸出令牌的生成之間的延遲。它包括調(diào)度延遲，這取決于系統(tǒng)負(fù)載等因素和迅速處理時(shí)間，這受到迅速長(zhǎng)度的影響。 TTFT的關(guān)鍵限制在于，它不能說(shuō)明提示的長(zhǎng)度。按及時(shí)長(zhǎng)度歸一化TTFT也不是理想的，因?yàn)樗矊⒄{(diào)度延遲歸一化，因此對(duì)較短的輸入請(qǐng)求的懲罰不成比例。

令牌之間的時(shí)間(TBT)

該度量代表了在解碼階段中每個(gè)后續(xù)代幣產(chǎn)生的延遲，直接影響了感知的響應(yīng)速度。優(yōu)化TBT對(duì)于流體用戶體驗(yàn)很重要，尤其是在諸如聊天之類的實(shí)時(shí)應(yīng)用程序中。然而，TBT無(wú)法揭示令牌生成過(guò)程中攤位的幅度和時(shí)間。高尾巴TBT可以在生成過(guò)程的開(kāi)始時(shí)表明一個(gè)攤位，這會(huì)大大破壞用戶體驗(yàn)，但是此信息并非僅由TBT捕獲。此外，TBT不考慮非統(tǒng)一的代幣生成策略，例如投機(jī)解碼，其中可以在單個(gè)迭代中生成多個(gè)令牌。

每個(gè)輸出令牌(TPOT)的時(shí)間

該度量與TBT相似，代表在解碼階段生成輸出令牌所需的平均時(shí)間。通過(guò)通過(guò)生成的解碼令牌數(shù)量將總解碼時(shí)間歸一化來(lái)計(jì)算。 TPOT的主要問(wèn)題是，它通過(guò)平均所有令牌上的延遲來(lái)掩蓋令牌生成中的煩惱和失速。一個(gè)長(zhǎng)的攤位可以顯著影響用戶體驗(yàn)，但是由于令牌數(shù)量的標(biāo)準(zhǔn)化，其對(duì)TPOT的影響在數(shù)值上很小。

歸一化延遲

該度量計(jì)算請(qǐng)求的總執(zhí)行時(shí)間，包括調(diào)度延遲，及時(shí)處理和解碼時(shí)間，然后通過(guò)解碼令牌數(shù)量進(jìn)行歸一化。在提供吞吐量的總體度量的同時(shí)，歸一化延遲可能會(huì)掩蓋重要細(xì)節(jié)，例如調(diào)度延遲。兩個(gè)計(jì)劃延遲截然不同的系統(tǒng)具有非常相似的歸一化延遲值。像TPOT一樣，標(biāo)準(zhǔn)化的延遲也可以掩蓋令牌生成中的抖動(dòng)和攤位。

流動(dòng)性指數(shù)

TTFT，TBT和TPOT(TPOT)等傳統(tǒng)指標(biāo)無(wú)法完全捕獲LLM交互中的實(shí)時(shí)用戶體驗(yàn)，因?yàn)樗鼈儫o(wú)法充分說(shuō)明令牌生成速度的變化。為了解決這個(gè)問(wèn)題，將流動(dòng)性指數(shù)引入了一種新型度量標(biāo)準(zhǔn)，旨在反映LLM在諸如CHAT之類的實(shí)時(shí)應(yīng)用中的細(xì)微差別。流動(dòng)性指數(shù)的靈感來(lái)自實(shí)時(shí)系統(tǒng)中基于截止日期的評(píng)估，并在LLM中處理流媒體令牌的產(chǎn)生，例如定期任務(wù)。它通過(guò)根據(jù)所需的TTFT和TBT值為每個(gè)令牌生成的截止日期設(shè)置截止日期來(lái)起作用。更高的流動(dòng)性索引表明一個(gè)更光滑，更一致的令牌生成過(guò)程，與實(shí)時(shí)應(yīng)用程序中的用戶期望更好。

影響推理時(shí)間的因素

幾個(gè)因素會(huì)影響模型的推理時(shí)間。這些包括模型的復(fù)雜性，用于計(jì)算的硬件以及輸入數(shù)據(jù)的性質(zhì)。優(yōu)化推理時(shí)間對(duì)于大規(guī)模部署機(jī)器學(xué)習(xí)模型至關(guān)重要。幾種技術(shù)可以幫助減少模型進(jìn)行預(yù)測(cè)所需的時(shí)間。

· 模型復(fù)雜性：更大，更復(fù)雜的模型通常需要更多時(shí)間來(lái)做出預(yù)測(cè)。例如，與更簡(jiǎn)單的模型(如決策樹(shù)或線性回歸)相比，具有數(shù)百萬(wàn)參數(shù)的深神經(jīng)網(wǎng)絡(luò)可能需要更長(zhǎng)的時(shí)間來(lái)處理數(shù)據(jù)。

· 硬件：該模型運(yùn)行的硬件平臺(tái)顯著影響推理時(shí)間。傳統(tǒng)的CPU可能比專門(mén)的硬件(如GPU或TPU(張量處理單元))慢，該硬件已針對(duì)并行處理進(jìn)行了優(yōu)化，尤其是對(duì)于深度學(xué)習(xí)任務(wù)。

· 批處理大?。阂淮翁幚矶鄠€(gè)輸入(一種稱為批處理推斷的方法)通常可以更快。但是，最佳批量尺寸取決于所使用的特定模型和硬件。批量太大可能會(huì)使系統(tǒng)不知所措，而批量太小可能不足以使硬件資源不足。

· 數(shù)據(jù)預(yù)處理：將輸入數(shù)據(jù)傳遞給模型之前花費(fèi)的時(shí)間也有助于整體推理時(shí)間。例如，諸如令牌化之類的任務(wù)可能會(huì)增加大量開(kāi)銷。

· 模型量化和修剪：通過(guò)量化，IE，降低模型權(quán)重的精度和修剪的精確度，IE，即刪除模型的不必要部分，可以幫助減少記憶足跡和推理時(shí)間，從而優(yōu)化模型。這些技術(shù)對(duì)于在資源約束設(shè)備上部署模型特別有用。

· 軟件優(yōu)化：專門(mén)的庫(kù)和框架，例如Tensorrt，ONNX運(yùn)行時(shí)或LITERT可以通過(guò)優(yōu)化基礎(chǔ)計(jì)算圖來(lái)顯著加快推理過(guò)程。此外，可以使用優(yōu)化的精度算術(shù)降低，例如16位浮點(diǎn)而不是32位，以加快計(jì)算而無(wú)需犧牲太多準(zhǔn)確性。

· 模型并行性：對(duì)于極大的模型，將工作負(fù)載跨多個(gè)設(shè)備拆分可以幫助減少推理時(shí)間，從而可以更快地處理。

· 邊緣計(jì)算：對(duì)于涉及移動(dòng)設(shè)備或物聯(lián)網(wǎng)的應(yīng)用程序，直接在邊緣部署模型，即本地設(shè)備而不是依靠云服務(wù)，可以減少往返的通信時(shí)間，從而更快地推斷。 EDGE計(jì)算允許實(shí)時(shí)決策無(wú)需將數(shù)據(jù)發(fā)送到遠(yuǎn)程服務(wù)器。

結(jié)論

推理時(shí)間計(jì)算是機(jī)器學(xué)習(xí)模型部署的關(guān)鍵因素，尤其是在性能，效率和用戶體驗(yàn)至關(guān)重要的現(xiàn)實(shí)世界應(yīng)用中。減少推理時(shí)間會(huì)導(dǎo)致更快，更具成本效益和可擴(kuò)展的AI系統(tǒng)。隨著AI技術(shù)的繼續(xù)發(fā)展，硬件加速度，模型優(yōu)化和有效的軟件框架等技術(shù)將在確保推理盡可能快速和資源效率方面發(fā)揮越來(lái)越重要的作用。優(yōu)化推理時(shí)間可以更好地體驗(yàn)用戶體驗(yàn)，降低運(yùn)營(yíng)成本以及有效擴(kuò)展AI系統(tǒng)的能力。

本站聲明：本文章由作者或相關(guān)機(jī)構(gòu)授權(quán)發(fā)布，目的在于傳遞更多信息，并不代表本站贊同其觀點(diǎn)，本站亦不保證或承諾內(nèi)容真實(shí)性等。需要轉(zhuǎn)載請(qǐng)聯(lián)系該專欄作者，如若文章內(nèi)容侵犯您的權(quán)益，請(qǐng)及時(shí)聯(lián)系本站刪除。

換一批

人工智能對(duì)工業(yè)價(jià)值鏈的影響

面對(duì)市場(chǎng)對(duì)更智能產(chǎn)品、更短設(shè)計(jì)周期以及更高效靈活生產(chǎn)流程的需求日益增長(zhǎng)，設(shè)計(jì)與制造企業(yè)紛紛借助人工智能，推動(dòng)業(yè)務(wù)流程邁向新高度。憑借處理復(fù)雜數(shù)據(jù)的卓越能力與傳遞智能洞見(jiàn)的便捷性，人工智能已準(zhǔn)備好在工業(yè)價(jià)值鏈的各個(gè)環(huán)節(jié)承擔(dān)...

關(guān)鍵字：人工智能工業(yè)物聯(lián)網(wǎng) 傳感器

[美通社全球TMT]

世界智能產(chǎn)業(yè)博覽會(huì)于重慶開(kāi)幕，人工智能與新能源汽車成焦點(diǎn)

重慶2025年9月6日 /美通社/ -- iChongqing新聞報(bào)道：2025世界智能產(chǎn)業(yè)博覽會(huì)于9月5日在重慶開(kāi)幕，550余家企業(yè)參展，展示了從自動(dòng)駕駛和人工智能(AI)座艙到擴(kuò)展現(xiàn)實(shí)(XR)影視和機(jī)器人咖啡廳的30...

關(guān)鍵字：人工智能新能源汽車 AI 機(jī)器人

[美通社全球TMT]

北京經(jīng)開(kāi)區(qū)構(gòu)建五大支撐體系，加快建設(shè)全域人工智能之城

北京2025年9月5日 /美通社/ -- 9月4日，在北京市人民政府新聞辦公室舉行的"一把手發(fā)布?京華巡禮"系列主題新聞發(fā)布會(huì)上，北京經(jīng)開(kāi)區(qū)對(duì)外發(fā)布，北京經(jīng)濟(jì)技術(shù)開(kāi)發(fā)區(qū)（簡(jiǎn)稱"北京經(jīng)開(kāi)區(qū)&q...

關(guān)鍵字：人工智能模型開(kāi)源 AI

[美通社全球TMT]

北京經(jīng)開(kāi)區(qū)全力打造國(guó)際一流營(yíng)商環(huán)境

二十余項(xiàng)改革全國(guó)全市推廣，700余事項(xiàng)100%全程網(wǎng)辦北京2025年9月5日 /美通社/ -- 9月4日，在北京市人民政府新聞辦公室舉行的"一把手發(fā)布?京華巡禮"系列主題新聞發(fā)布會(huì)上，北京經(jīng)開(kāi)區(qū)對(duì)...

關(guān)鍵字： DIY 人工智能加速器機(jī)器人

[美通社全球TMT]

北京經(jīng)開(kāi)區(qū)全力打造新質(zhì)生產(chǎn)力典范區(qū)

"十四五"期間GDP年均增長(zhǎng)9.6%，每年安排產(chǎn)業(yè)發(fā)展資金超百億元北京2025年9月5日 /美通社/ -- 9月4日，在北京市人民政府新聞辦公室舉行的"一把手發(fā)布?京華巡禮"系...

關(guān)鍵字：人工智能自動(dòng)駕駛集成電路 4S店

[美通社全球TMT]

人工智能引領(lǐng)體育未來(lái)：第三屆全國(guó)體育人工智能大會(huì)將于10月底在京啟幕

北京2025年9月4日 /美通社/ --?在全球新一輪科技革命與產(chǎn)業(yè)變革的澎湃浪潮中，人工智能作為引領(lǐng)創(chuàng)新的核心驅(qū)動(dòng)力，正以前所未有的深度與廣度重塑各行業(yè)發(fā)展格局。體育領(lǐng)域深度融入科技變革浪潮，駛?cè)霐?shù)字化、智能化轉(zhuǎn)型快車...

關(guān)鍵字：人工智能智能體 AI BSP

[美通社全球TMT]