女人被狂躁到高潮视频免费无遮挡,内射人妻骚骚骚,免费人成小说在线观看网站,九九影院午夜理论片少妇,免费av永久免费网址

源2.0-M32大模型發(fā)布量化版運行顯存僅需23GB 性能可媲美LLaMA3

時間：2024-08-25 21:59:11

關鍵字：模型顯存 GB 3G

手機看文章

掃描二維碼
隨時隨地手機看文章

[導讀]北京2024年8月23日 /美通社/ -- 近日，浪潮信息發(fā)布源2.0-M32大模型4bit和8bit量化版，性能比肩700億參數(shù)的LLaMA3開源大模型。4bit量化版推理運行顯存僅需23.27GB，處理每token所需算力約為1.9 GFLOPs，算力消耗僅為同等當量大模型L...

北京2024年8月23日 /美通社/ -- 近日，浪潮信息發(fā)布源2.0-M32大模型4bit和8bit量化版，性能比肩700億參數(shù)的LLaMA3開源大模型。4bit量化版推理運行顯存僅需23.27GB，處理每token所需算力約為1.9 GFLOPs，算力消耗僅為同等當量大模型LLaMA3-70B的1/80。而LLaMA3-70B運行顯存為160GB，所需算力為140GFLOPs。

源2.0-M32量化版是"源"大模型團隊為進一步提高模算效率，降低大模型部署運行的計算資源要求而推出的版本，通過采用領先的量化技術，將原模型精度量化至int4和int8級別，并保持模型性能基本不變。源2.0-M32量化版提高了模型部署加載速度和多線程推理效率，在不同硬件和軟件環(huán)境中均能高效運行，降低了模型移植和部署門檻，讓用戶使用更少的計算資源，就能獲取源2.0-M32大模型的強大能力。

源2.0-M32大模型是浪潮信息"源2.0"系列大模型的最新版本，其創(chuàng)新性地提出和采用了"基于注意力機制的門控網絡"技術，構建包含32個專家（Expert）的混合專家模型（MoE），模型運行時激活參數(shù)為37億，在業(yè)界主流基準評測中性能全面對標700億參數(shù)的LLaMA3開源大模型，大幅提升了模型算力效率。

模型量化（Model Quantization）是優(yōu)化大模型推理的一種主流技術，它顯著減少了模型的內存占用和計算資源消耗，從而加速推理過程。然而，模型量化可能會影響模型的性能。如何在壓縮模型的同時維持其精度，是量化技術面臨的核心挑戰(zhàn)。

源2.0-M32大模型研發(fā)團隊深入分析當前主流的量化方案，綜合評估模型壓縮效果和精度損失表現(xiàn)，最終采用了GPTQ量化方法，并采用AutoGPTQ作為量化框架。為了確保模型精度最大化，一方面定制化適配了適合源2.0-M32結構的算子，提高了模型的部署加載速度和多線程推理效率，實現(xiàn)高并發(fā)推理；另一方面對需要量化的中間層（inter_layers）進行了嚴格評估和篩選，確定了最佳的量化層。從而成功將模型精度量化至int4和int8級別，在模型精度幾乎無損的前提下，提升模型壓縮效果、增加推理吞吐量和降低計算成本，使其更易于部署到移動設備和邊緣設備上。

評測結果顯示，源2.0-M32量化版在多個業(yè)界主流的評測任務中性能表現(xiàn)突出，特別是在MATH（數(shù)學競賽）、ARC-C（科學推理）任務中，比肩擁有700億參數(shù)的LLaMA3大模型。

源2.0-M32大模型發(fā)布量化版運行顯存僅需23GB 性能可媲美LLaMA3

總之，源2.0-M32大模型量化版在保持推理性能的前提下，顯著降低了計算資源消耗和內存占用，其采用的GPTQ量化方法通過精細調整，成功將模型適配至int4和int8精度級別。通過定制化算子優(yōu)化，源2.0-M32量化版實現(xiàn)了模型結構的深度適配和性能的顯著提升，確保在不同硬件和軟件環(huán)境中均能高效運行。未來，隨著量化技術的進一步優(yōu)化和應用場景的拓展，源2.0-M32量化版有望在移動設備和邊緣計算等領域發(fā)揮更廣泛的作用，為用戶提供更高效的智能服務。

本站聲明：本文章由作者或相關機構授權發(fā)布，目的在于傳遞更多信息，并不代表本站贊同其觀點，本站亦不保證或承諾內容真實性等。需要轉載請聯(lián)系該專欄作者，如若文章內容侵犯您的權益，請及時聯(lián)系本站刪除。

換一批

北京經開區(qū)構建五大支撐體系，加快建設全域人工智能之城

北京2025年9月5日 /美通社/ -- 9月4日，在北京市人民政府新聞辦公室舉行的"一把手發(fā)布?京華巡禮"系列主題新聞發(fā)布會上，北京經開區(qū)對外發(fā)布，北京經濟技術開發(fā)區(qū)（簡稱"北京經開區(qū)&q...

關鍵字：人工智能模型開源 AI

[美通社全球TMT]

央視報道：中控技術時間序列大模型TPT 2正式發(fā)布，有望加速"人工智能+"產業(yè)應用

杭州2025年9月2日 /美通社/ -- 9月2日，央視《朝聞天下》欄目發(fā)布報道，重點關注中控技術在"人工智能+工業(yè)"領域的最新成果——時間序列大模型TPT 2（Time-series Pre-tra...

關鍵字：人工智能模型 PLAYER ASIA

[美通社全球TMT]

云天暢想加入元腦生態(tài)，加速教育行業(yè)AIGC應用落地

北京2025年9月2日 /美通社/ -- 近日，深圳云天暢想信息科技有限公司（下稱"云天暢想"）與浪潮信息正式簽署元腦生態(tài)戰(zhàn)略合作協(xié)議。雙方將聚焦教育行業(yè)AIGC應用落地，在AIGC實訓平臺、智能體平...

關鍵字： AI 模型開發(fā)平臺智能體

[美通社全球TMT]

北京經開區(qū)率先打造"高效辦成一件事"基層新范式多項改革舉措領跑全市

北京2025年8月28日 /美通社/ -- 8月28日，北京亦莊創(chuàng)新發(fā)布消息，北京經濟技術開發(fā)區(qū)（簡稱"北京經開區(qū)"，又稱"北京亦莊"）創(chuàng)新推出"一張清單、一鏈延伸、一套...

關鍵字：接線數(shù)字化智能化模型

[美通社全球TMT]

廣和通新一代Fibot具身智能開發(fā)平臺助力Physical Intelligence π0.5模型實現(xiàn)VLA泛化

深圳2025年8月28日 /美通社/ -- 8月27日，全球領先的無線通信與AI解決方案提供商廣和通發(fā)布新一代具身智能開發(fā)平臺 Fibot。Fibot已成功應用于Physic...

關鍵字： PHYSICAL 開發(fā)平臺模型 INTELLIGENCE

[美通社全球TMT]

IBM 聯(lián)合NASA發(fā)布開源 AI 模型重要突破：對太陽天氣進行預測和預警，保護關鍵技術及基礎設施

首個采用高分辨率太陽觀測數(shù)據(jù)訓練的太陽物理學人工智能 (AI) 基礎模型，旨在深入探索太陽動態(tài)表面，對可能干擾地球和太空技術的太陽天氣做出有效規(guī)劃。該模型已發(fā)布在 Hugging Face 開源平臺，旨在加快...

關鍵字： IBM NASA 開源模型

[美通社全球TMT]

AI應用創(chuàng)新系列01：對話式決策引擎，喚醒企業(yè)"沉睡數(shù)據(jù)"價值

上海2025年8月26日 /美通社/ -- 在全球數(shù)字經濟加速演進的時代浪潮中，海量數(shù)據(jù)資源正成為企業(yè)發(fā)展的雙刃劍。超66%的企業(yè)面臨"數(shù)據(jù)沉睡"危機——分散于供應鏈、財務、客戶運營等數(shù)十個系統(tǒng)的業(yè)務...

關鍵字： AI 模型軟件數(shù)據(jù)分析

[美通社全球TMT]