雖然性能仍不及ChatGPT 3.5,但開源的力量是無法估量的。
昨天凌晨,相信很多人都被 Meta 發佈的 Llama 2 刷了屏。OpenAI 研究科學家 Andrej Karpathy 在Twitter上表示,「對於人工智慧和 LLM 來說,這確實是重要的一天。這是目前能夠把權重提供給所有人使用的最為強大的 LLM。」

對於開源社區來說,這個大模型就是「全村的希望」。它的出現將進一步縮小開源大模型與閉源大模型的差距,讓所有人都有機會基於它構建自己的大模型應用。
因此,在過去的 24 個小時,Llama 2 成了所有社區成員關注的焦點。大家都在談論它的性能、部署方法以及可能帶來的影響。為了讓大家在第一時間了解這些資訊,我們在這篇文章中進行了總結。
Llama 2 性能究竟如何?
在展示評測結果之前,我們先來梳理一下 Llama 2 的基本資訊:
- 包含 70 億、130 億和 700 億三種參數變體,此外還訓練了 340 億參數變體,但並沒有發佈,只在技術報告中提到了。
- 在 2 萬億的 token 上進行訓練,相比於 Llama 1,訓練資料多了 40%,精調 Chat 模型是在 100 萬人類標記資料上訓練的。
- 支持的上下文 token 長度翻倍,由原來的 2048 升級到 4096。
- 免費可商用,但日活大於 7 億的產品需要單獨申請商用許可權。

在 Llama 2 發佈後,整個 Llama 項目的 Github star 量正在逼近 30k。

在 Meta 發佈的論文中,我們還可以看到 Llama 2 的一些性能情況:
- Llama 2 70B 在 MMLU 和 GSM8K 上得分接近 GPT-3.5,但在編碼基準上存在顯著差距。
- 在幾乎所有基準上,Llama 2 70B 的結果均與Google PaLM (540B) 持平或表現更好,不過與 GPT-4 和 PaLM-2-L 的性能仍存在較大差距。

也就是說,即使是參數量最大的 Llama 2 70B,性能目前也沒有超過 GPT-3.5,距離 GPT-4 差距更大。
為了測試一下 Llama 2 的實力,各路網友都在想辦法對其展開測試,比如讓他根據一些「荒唐」的資訊寫一封公司郵件。


還有人已經開始直播 Llama 2 和其他類 ChatGPT 產品的 PK:

在測試過程中,大家發現了一些問題,比如 Llama 2 受到的 RLHF 訓練似乎太多了點,這導致它非常守規矩:

在一位開發者製作的免費應用程序中,機器之心也上手體驗了一把。
首先,我們問一下 Llama 2 能做什麼?Llama 2 回答道:「我可以幫助你處理各種任務,比如回答問題、提供資訊,甚至幫助你完成日常任務。我只是一個人工智慧,無法在現實中執行任務,但我可以為你提供你需要的資訊或幫助……」。從語言上來看,Llama 2 支持中文輸入,但回答基本都用英文,中文理解、生成能力有限。


接著問它資料截止到什麼時候?從 Llama 2 的回答中,我們可以得知,它掌握的資料截止日期是 2022 年 12 月。

接著,我們向 Llama 2 詢問了一個不那麼貼切的問題。Llama 2 指出了標題的不合理性,並給出了一些建議:

但是,Llama 2 對雞兔同籠問題還是不擅長。


測試地址:https://llama-2.replit.app/
在Twitter上,Vicuna(小羊駝)項目創建者公佈了他們的系統測試結果,結論如下:
- Llama-2 表現出更強的指令遵循能力,但在資訊提取、編碼和數學方面仍明顯落後於 GPT-3.5/Claude;
- 對於安全性的過度敏感可能導致對使用者查詢的錯誤解讀;
- 在聊天性能上與基於 Llama-1 的領先模型(如 Vicuna、WizardLM)相當;
- 非英語語言技能有限。

以下是一些測試資料和結果:




哪些設備能在本地跑這些模型?
由於 Llama 2 開源了不同大小的版本,這些模型在本地部署方面非常靈活。如果你不想把自己的資料傳上網,那麼本地部署就是最好的選擇。這一想法可以通過陳天奇等人打造的 MLC-LLM 項目來實現:

項目地址:https://github.com/mlc-ai/mlc-llm
在之前的報道中,我們提到過這個項目。它的目標是讓你「在任何設備上都能編譯運行大語言模型」,包括移動端、消費級電腦端和 Web 瀏覽器。它支持的平臺包括:

在 Llama 2 發佈後,陳天奇等項目成員表示,MLC-LLM 現在支持在本地部署 Llama-2-70B-chat(需要一個帶有 50GB VRAM 的 Apple Silicon Mac 來運行)。在 M2 Ultra 上,解碼速度可以達到~10.0token / 秒。

當然,藉助 MLC-LLM,運行其他版本的 Llama 2 模型更是不在話下:7B 模型在 Apple M2 Max 上的運行速度約為 46 tok/s,在 RTX 4090 上約為 156 tok/s。

此外,藉助陳天奇等人發佈的「MLC Chat」APP(蘋果應用商店可以搜到),我們還可以嘗試在手機、iPad 上使用 Llama 2(無需聯網)。

Llama 2 將帶來哪些影響?
如果 Meta 沒有在今年 2 月份開源 Llama,你可能不知道「羊駝」原來有那麼多種寫法:基於這一開源模型的「二創」項目幾乎佔用了生物學羊駝屬的所有英文單詞。在 Meta 將模型迭代到 2.0 版本後,這些項目自然也被拉到了新的起點。
在 Llama 2 發佈不到一天的時間裡,能夠像 GPT-4 一樣處理圖像資訊的大型多模態模型「熔岩羊駝 LLaVA」的開發者就宣佈,他們基於 Llama 2 對 LLaVA 進行了更新。新版本增加了對 LLaMA-2 的支持,同時還支持使用學術界 GPU 進行 LoRA 訓練,以及更高的解析度(336×336)和 4-/8- 推理等功能。

此外,他們還發布了新的 LLaVA 變體的預覽版本,該版本基於最新的經過 RLHF 微調的 LLaMA-2-Chat 檢查點,提供更長的上下文窗口。這些新發布的版本支持並驗證了在 RTX 3090 和 RTX A6000 上進行的訓練,從而使大型多模態模型的訓練更加便捷、更加適用於廣大社區使用者。

當然,這只是一個開始。假以時日,那些基於 Llama 2 的模型會陸陸續續上線或更新,「千模大戰」一觸即發。

對於 Llama 的未來發展及影響,英偉達高級 AI 科學家 Jim Fan 也給出了自己的預測:
- Llama-2 的訓練成本可能超過 2000 萬美元。之前,一些大公司的人工智慧研究人員因為商業許可問題對 Llama-1 持謹慎態度,但 Llama-2 的商業限制大大鬆綁,未來很多人可能會加入 Llama 陣營,並貢獻他們的實力。
- 雖然 Llama-2 目前還沒有達到 GPT-3.5 的水平,在程式設計等問題上存在明顯短板,但由於它的權重是開放的,這些問題早晚會得到改進;
- Llama-2 將極大地推動多模態人工智慧和機器人技術的研究。這些領域需要的不僅僅是對 API 的黑盒訪問。目前,我們必須將複雜的感官信號(視訊、音訊、3D 感知)轉換為文字描述,然後再輸入到 LLM(語言與視覺融合模型)中,這樣做非常笨拙,導致資訊損失非常嚴重。直接將感知模組嫁接到強大的 LLM 骨幹上將更加高效。

對於研發閉源大模型的企業來說,Llama 2 的發佈也是意義重大。如果他們研發的模型本身不夠強大,或者和開源 Llama 2 及其衍生模型的差距不大,那麼其商業價值將很難變現。
如果你對 Llama 2 的未來影響也有一些看法,歡迎在評論區留言。