
出品|虎嗅科技組
作者|黃天媛
編輯|苗正卿
頭圖|Reflection AI官網
成立兩年後,想做“美國版DeepSeek”的Reflection AI終於交卷了。
美國時間10月5日,Reflection AI公布了首個開放權重模型 Beam,主攻編程、推理和智能體任務。(虎嗅注:開放權重模型指公開訓練好的模型參數,用戶可以下載、自己部署,能否修改和商用取決於許可證)
許多美國媒體和科技業人士,將Beam視爲美國對中國開放AI的回應。
他們公司自己也是這麼對標的。
按照公司官網的說法,Beam 在編程和智能體任務上的表現可與智譜 GLM 5.2 競爭,接近阿裏的 Qwen 3.8-Max,但在絕對能力上仍落後於 Kimi K3 等領先模型。
但它的意義不只在Benchmark。
Reflection有一套非常明確的定位:服務那些不願或無法使用中國模型,同時又希望擁有、控制自己AI能力的企業和政府客戶。
在美國本土,這樣的公司並不多見。Reflection同時擁有數十億美元融資、頂級GPU資源、Nvidia支持,以及美國政府和主權AI項目資源。
這也是爲什麼,一款還沒有站到開放模型最前沿的產品,仍然會受到如此高的關注。
Reflection到底是一家什麼公司?Beam又到底做到了什麼?
Beam的成績單
Reflection創始人在播客採訪中披露,Beam採用MoE架構,總參數約5000億,但推理時只激活約230億參數。
作爲對比,DeepSeek-V3總參數爲6710億、激活370億;月之暗面Kimi K2達到1萬億總參數、激活320億;智譜GLM-4.5則爲3550億總參數、激活320億。
同時,Reflection還強調,Beam從預訓練階段開始完全自主完成(沒有蒸餾),並針對Coding、推理和Agent任務重點訓練。

Reflection還尤其強調Beam的推理效率。
公司表示,依靠大規模強化學習,Beam完成相似難度推理任務時需要消耗的Token和推理計算量,可以達到GLM 5.3、GPT-6 Luna等模型的約1/3到1/4。
官方披露,Beam的預訓練數據達到23.8萬億Token。作爲對比,DeepSeek-V3使用了14.8萬億Token預訓練;Kimi K2約15.5萬億Token。Beam隨後進行了一輪高強度RL訓練,他們用10500張Nvidia GB300 GPU連續運行4周,總共生成超過1億次Rollout。
Reflection的判斷是,前沿模型的Scaling正在發生變化。
過去幾年,行業最熟悉的是擴大參數量和訓練數據,提升預訓練算力。但隨着預訓練逐漸成爲一門更成熟的工程,下一階段模型能力提升的重要變量,會越來越多來自把強化學習本身繼續Scale。
所以,Beam像是Reflection的一次技術驗證。
一家新公司能不能靠大規模RL,把一個只有較少激活參數的模型,推到接近中國頭部開放模型的水平。
它已經證明自己上了牌桌。
美國“DeepSeek”,爲什麼是Reflection?
Reflection並不是一家突然冒出來的模型公司。
它成立於2024年,由兩名前Google DeepMind研究人員Misha Laskin和Ioannis Antonoglou創辦。Laskin和Antonoglou在DeepMind期間,曾參與Gemini 1和Gemini 1.5相關工作。Antonoglou在DeepMind早期就加入公司,是AlphaGo核心團隊成員之一。
但有意思的是,Reflection創業之初,其實沒有準備自己從頭訓練基礎模型。
Laskin最近在播客中回憶,兩人創辦Reflection時,主要押注了兩個判斷:第一個判斷是,強化學習會讓大模型從會聊天,進一步走向Coding和Agent;第二個判斷則是,西方仍會不斷出現足夠強的開放模型,Reflection沒有必要重復訓練基礎模型,只要站在這些模型上繼續做強化學習和Agent研究。
從今天回看,第一個判斷已然成爲主流方向,但第二個卻落空了。
DeepSeek V3出現後,西方開放模型與中國開放模型之間的差距開始迅速拉大。Reflection又等了幾個月,希望美國出現一個足夠強的開放模型,但一直沒有等到。於是,它決定自己下場。
Beam就是這次戰略轉向後的第一份答卷。
過去一年,全球最強的閉源模型仍主要掌握在美國公司手中,但開放模型的重心,卻越來越向中國傾斜。
DeepSeek、Qwen、智譜、Kimi等中國模型不斷進入全球開發者的模型列表。OpenRouter排名顯示,在開放模型中,排名靠前的產品大量來自DeepSeek、智譜、小米、騰訊等中國公司。
Reflection和美國政府都想要的,是重新搶回這塊市場。
Reflection目前估值約250億美元,累計融資超過40億美元,其中Nvidia投資約8億美元。
今年7月,路透社報道,Reflection 與雲計算公司 Nebius 籤署超過10億美元的協議,獲取包括英偉達最新芯片在內的計算資源。
此前,Reflection 已與 SpaceX 籤下算力協議。按照 Axios 報道,經過初始爬坡階段,公司從今年7月起每月支付1.5億美元,協議持續到2029年。
Reflection 官網還稱,公司將參與美國能源部 Genesis Mission 科研計劃,爲美國國家實驗室提供開放模型。
一家成立兩年多、第一款基礎模型才剛剛發布的公司,已經獲得這個級別的資源,本身就說明投資者押注的並不只是Beam。
他們押的是美國重新擁有一個開放模型體系。
按照Reflection官網的介紹,公司不僅計劃開放模型權重,還在開發配套的開源軟件,並支持通過API調用,或在企業私有雲、本地服務器、與外部網絡物理隔離的環境中部署。
開放權重只是第一層。Reflection真正準備賣的是,模型+推理+軟件棧+基礎設施+企業部署。
它的主要客戶也不是普通消費者。在創始人的描述中,大型企業、政府機構、公共部門和“主權AI”客戶,才是未來開放模型最大的買家。
一個現實案例已經在韓國出現。
今年3月,Reflection與韓國新世界集團宣布籤署合作備忘錄,計劃建設一座250MW的AI數據中心,爲韓國企業和政府機構提供主權AI服務。項目將使用Reflection的開放權重模型和英偉達GPU,美國商務部長也出席了籤約活動並表示支持。

Reflection 已經拿到了訓練大模型的資源,也找到了願意討論合作的企業和政府客戶。接下來,Beam 要過的還是生態應用關和能力提升關。
這些答案,融資額和合作名單都給不了。
相關閱讀
- AI博主圈,正被「中戲北電」擠滿2026-10-08
- 原創 在印度又遭遇大麻煩,小米這次會被印方割去多少肉?2026-10-08
- 在南極深冰下,等一封宇宙來信—2026-10-07