## 📋 X 動態摘要(過去 24 小時)
最後更新:台北時間 2026-08-05 01:19
### 🐱 「我們要開源那個混合專家訓練的巨核心」
Cursor(@cursor_ai)宣布他們要開源其為某代新架構加速器所做的混合專家訓練巨核心,說它把所有混合專家的通訊與計算融合成單一個、完全某某的核心;一家應用層公司開源底層訓練核心,這是本輪最出人意料的貢獻。
(2084670806613737919)
elie(@eliebakouch)評論說這看起來好到離譜——某公司開源了給新架構的混合專家核心,前向傳遞最高有大約兩倍的加速(他們也有反向的),另外有意思的是某某;來自訓練基礎設施研究者的評價最有分量。
(2084673379563421877)
Ant Ling(@AntLingAGI)宣布今天釋出其快速模型的開放權重,說官方的全精度與低精度量化版本現在都可以取得、你可以選擇最適合你的某某;同時提供兩種精度的官方版本是負責的發布方式。
(2084656533489754475)
Qwen(@Alibaba_Qwen)指出其影像模型的新版本相較前一代有巨大的躍進、現在全球排名第五,並感謝這份肯定、說他們會繼續建造;影像模型的排名躍升在本輪由官方與第三方同時確認。
(2084674586462007458)
pilvar(@pilvar222)在其資安基準上跑了那個旗艦,結果是在給足夠嘗試次數的情況下,它找到的漏洞比大多數前沿模型都多、與某個頂級模型並列第一,並附上結果;「給足夠嘗試次數」這個前提很重要,但結果仍然值得注意。
(2084667774559785261)
### 💸 「99% 的折扣」
Hedgie(@HedgieMarkets)算了一筆帳:某公司週五發布其快速寫程式模型、每百萬輸出 token 零點二八美元,而某個頂級模型同樣的輸出收費二十五美元——那是百分之九十九的折扣,而那個快速模型某某;把折扣率算成一個百分比最有衝擊力。
(2084412496795119795)
Entelligence AI(@EntelligenceAI)指出那個模型據報跑完一次某個評測只要零點零三美元(是的,就三美分),並列出對照:另一個開源模型零點八六美元、某個閉源模型一點八六美元、而它零點零三美元;同一份評測的三個成本數字並列,這是最清楚的呈現。
(2084680260294197523)
Exec Sum(@exec_sum)指出該公司最新的模型比某個頂級模型便宜一百零五倍,說其新的快速模型與某個快速模型並駕齊驅、但落後另兩家實驗室的某某;把「便宜多少」與「能力排在哪」一起說才完整。
(2084660170303701493)
Command Code(@CommandCodeAI)通報他們目前在其上游供應商那裡看到那些模型的效能下降,說你可能會注意到回應變慢、輸出品質降低、或間歇性的某某;下游服務商的即時通報對使用者很負責。
(2084678629729157574)
The Kobeissi Letter(@KobeissiLetter)快訊指出大盤指數史上首次升破七千七百點,而這也讓該指數的總市值史上首次突破七十兆美元;七十兆這個門檻值得記下來。
(2084665195696152593)
Geiger Capital(@Geiger_Capital)調侃某位前員工正在蜜月中,看著他賣給某對沖基金之後的投資組合上漲了四成;時機的殘酷在市場上永遠是最好的故事。
(2084646039961624752)
Patrick OShaughnessy(@patrick_oshag)發布他與某位投資人的第七次對話,主題是市場正在做的事與公司實際看到的事之間的落差,說對公開市場的 AI 某某來說這一個多月相當難熬;把「市場」與「公司看到的」分開是很有價值的框架。
(2084610308279288141)
Bloomberg(@business)指出衝突區之外的煉油廠正在全世界滿載運轉,而系統裡已經幾乎沒有緩衝來保護大家免於更高的燃料價格;「沒有緩衝了」是很重要的風險提示。
(2084664428281188715)
Timothy Young(@timyoung)表示他當了某公司四年的總裁,而華爾街仍然在為他們建立的自由現金流故事定價——那個故事是真的,但它也不是重點,並主張某實驗室應該買下那家公司;把一家公司的定價邏輯與其戰略價值分開來看相當犀利。
(2082097993847545902)
Mackenzie Burnett(@ciaomack)宣布其公司的三千萬美元 B 輪募資、由某人領投,並說他們沒有做募資影片、而是打了一封信,如果你好奇就給他們你的地址;用實體信件取代募資影片是很有記憶點的做法。
(2084658132190409081)
James Cowling(@jamesacowling)表示在募資公告的當下,他能想的全都是他們需要建造的東西以及他想僱用的優秀人才,說事情進展得非常好、但這些仍然是很早期的某某;創辦人在募資後的第一反應通常最真實。
(2084671470056464645)
### 🛠️ 「wrangler dev 現在為每一個本地請求產生結構化的追蹤紀錄」
Cloudflare(@Cloudflare)指出其本地開發指令現在會為每一個本地請求產生結構化的追蹤紀錄,而你的寫程式代理可以呼叫單一個介面來精確定位什麼失敗了、為什麼失敗——不需要部署某某;把除錯資訊做成代理可讀的介面是很聰明的設計。
(2084640618110754886)
Zach Lloyd(@zachlloydtweets)介紹其終端機的代理命令列工具,說那是一個能做到其他工具做不到的事的寫程式代理,特色包括完整存取其自動路由與最先進的模型選擇、以及完整的殼層存取某某;「完整殼層存取」是能力與風險的同一面。
(2084654829494804867)
Rhys(@RhysSullivan)宣布其產品今天在某加速器發表,說那是你的工具閘道——它給你一個地方去登入你使用的所有服務,然後每一個代理都能採用某某;把授權集中成一個閘道是代理生態的關鍵缺件。
(2084672219318452639)
Google for Developers(@googledevs)宣布不再需要硬編碼端點,因為其閘道的模型路由進入公開預覽,說你可以透過單一個端點存取三類模型、用模型名稱作為某某;把多模型路由做進雲端閘道是必然的一步。
(2084675671490801914)
Mckay Wrigley(@mckaywrigley)表示他看好模型路由器,說同樣的效能而成本更低是顯而易見的好處,但更大的收益在於透過混合多個能力參差的模型來創造「更平滑」的智慧;「更平滑的智慧」是很有洞察的一個目標定義。
(2084681158697337182)
Antonio Leiva(@antonioleivag)指出問題在於某個模型在類似「乾草堆裡找針」的基準上掉到五成以下,所以建議不要使用超過那個約二十七萬上下文視窗的一半,而那就是為什麼某某;把上下文視窗的「有效長度」與「標稱長度」分開是很實用的提醒。
(2084650134416064762)
mem0(@mem0ai)指出大多數活躍的專案都帶著幾條在暗中互相矛盾的記憶,而他們為此做了一個東西:一個背景層,會讓其記憶保持某某;「暗中互相矛盾的記憶」正是本週那個「記憶錯亂」問題的正式命名。
(2084658949190738229)
JetBrains(@jetbrains)指出你的專案現在跑在標記語言上,而他們要給它應有的工具,並邀請大家搶先看其開發環境裡的代理式標記語言支援、加入等候名單;把 Markdown 當成一等公民對待是對現實的承認。
(2084664833232752707)
CodeRabbit(@coderabbitai)比較一個自訂的審查技能與其產品在同一個合併請求上的表現,說兩者都抓到東西、但「抓到東西」不是這份工作的重點——可解釋性、在情境中、且能規模化才是,而那就是某某;把審查的評價標準從「抓到多少」移到「能不能解釋」是重要的轉向。
(2084670757146349917)
Brace(@BraceSproul)表示他在其專案的新版本裡重寫了整個提示詞以生成更詳細準確的內容,並列出評測結果:成功率提升百分之二十八點五七(從三成五到四成五)、token 少了百分之十四;把提示詞改動的效果量化是好的工程實務。
(2084665878554243275)
Dia(@diabrowser)比較兩個產品的情境切換成本:在其中一個是七次點擊、一次登出、一次重新驗證流程,而在其產品裡是一次滑動;把摩擦量化成點擊次數是很有效的行銷。
(2084668508474876143)
siggy bilstein(@sbilstein)表示他今天早上起床、看了手機上的某個應用,發現一個他從手機上啟動的雲端代理為了修一個記憶體洩漏工作了四個小時、而且修好了問題,並感嘆真是個好時代;「從手機啟動、四小時後修好」是很具體的能力刻度。
(2084669500163838026)
Lou(@louszbd)指出通用的寫程式代理仍然有極限,因為它們可能不知道那段醜的程式碼是為了繞過某個尚未被修好的上游限制、或者那個看似多餘的環境變數某某;把「醜程式碼背後的歷史」指認為代理的知識盲區相當精準。
(2084675305638424778)
Tyler Longwell(@tlongwell_bzz)問你有沒有一台在積灰的遊戲電腦、或一個閒置的家用實驗室,說你可以用你已經擁有的硬體來驅動你自己與社群的代理,而加速器的配對某某;把閒置算力做成社群資源是很有意思的方向。
(2084661711521366108)
Aryan Shah(@aryanxshah)表示他們做了某公司的命令列工具,好讓人們能推進代理式商務的邊界,而看著大家用它創造的東西已經很瘋狂了,說可能性顯然某某;外送平台推出命令列工具是「代理式商務」最具體的形態。
(2084672174481363181)
Lumo(@asklumo)指出其產品的新版本現在可以把你的資料變成視覺呈現、而不必離開對話:上傳一個檔案、問一個問題、得到一張圖表,不用試算表、不用切換工具、也不用把資料送到某某;把「不用送出資料」列為賣點反映了隱私意識。
(2084613290081079399)
Nx(@NxDevTools)指出單一儲存庫的維護變得容易多了,因為你只要把代理指向你儲存庫裡的一個專案、然後指示它把該專案的設定抽取成一個可重用、具決定性的某某;把重構工作交給代理是單一儲存庫維護的自然解法。
(2084650938015604787)
Daniel White(@dwhitedesign)介紹他的終端機專案,說那是他對「一個平靜、簡單的終端機該長什麼樣」的想像——一個不會在你工作時分散你注意力、而是幫助你保持專注的終端機,目前正在開發本地某某;把「不分散注意力」當成設計目標很難得。
(2084319962366202185)
### 🏛️ 「他們在建護城河」
Chris Titus Tech(@christitustech)認為很清楚某實驗室正在試圖建造一條護城河,因為它沒有採用更廣泛的標準(例如那兩個通用格式),而是透過自己的等價物來推動某某;標準之爭是這個生態接下來的關鍵議題。
(2084674578467463403)
Xiaoyin Qu(@quxiaoyin)表示他曾表達過對某實驗室新的「安全」敘事的擔憂,認為那是為了錢與監管俘獲、而不是為了使命;把「安全敘事」與「監管俘獲」連起來是很嚴厲但值得討論的批評。
(2084348725313654884)
Carnage(@0xCarnagee)引述某位研究者說「我們百分之九十的工程師現在出貨時完全不碰程式碼;讓這件事成立的不是模型,而是那張圖」,並說他實際上某某;此為轉述引言,該研究者的實際任職與原話應以第一手來源為準。
(2084659552482398681)
zach(@blip_tm)宣布個人大消息:他要加入某實驗室,說建造並規模化安全的通用智慧是我們這個時代最重要的問題之一,而他想不到還有什麼某某;在批評聲量升高的同時仍有頂尖人才加入,兩件事都是真的。
(2084662636114055198)
Eric Migicovsky(@ericmigi)指出某公司在二零一五年也對其公司做過類似的事,並附上當年的報導,說他們試了好幾週想讓應用更新、得到的是零回應某某;歷史前例讓當前的平台權力爭議更清楚。
(2084661797425185020)
Jack Rhysider(@JackRhysider)發布新一集節目,主題是某家網通公司——一個關於「某人」入侵該公司網路的故事,並調侃「我真好奇駭客是誰呢」;資安史的敘事化對公眾教育很有效。
(2084662403539550569)
NVIDIA Newsroom(@nvidianewsroom)指出在某場資安大會上,某個開放安全聯盟(超過一百二十個成員並持續成長)正在制定新的指引、並分享開放且可檢視的工具;把「可檢視」寫進工具的定義是好的原則。
(2084630618952827232)
_ZN4DionC1Ev(@justdionysus)表示他在跳過五、六年之後要去某場資安大會了,說那座城市很折騰、但他很興奮能跟其他技術宅聊漏洞,如果你對某些老系統或某些裝置有興趣某某;社群回歸的個人紀錄很有溫度。
(2084648260853956957)
Maddie Stone(@maddiestone)表示她這週會在那場大會、很樂意與人敘舊,並說她目前開放工作機會、如果你有適合的請聯繫;頂級漏洞研究者公開求職是產業動態的訊號。
(2084087521684701620)
The Hotshot Wake Up(@HotshotWake)報導一名三十七歲男子因與某地一場火災的縱火有關而被逮捕,並說當局表示一位當地民眾某某;災害成因的司法進展應以官方為準。
(2084659776013639753)
Saoud Khalifah(@SaoudKhalifah)指出 AI 代理現在不只是寫程式碼了,它們會執行指令、安裝套件、每天數千次地碰到生產環境,而今天他非常興奮要宣布某某;把代理的實際權限範圍說清楚是安全討論的前提。
(2084555447529304464)
Owen Gregorian(@OwenGregorian)轉述一篇報導指出某公司的平行運算平台正面臨來自 AI 寫程式代理的新威脅,說該公司最大的競爭優勢已經不像從前那樣不可觸及了;如果成立,這動搖的是整個產業的成本結構。
(2084611705590485413)
Owen Gregorian(@OwenGregorian)另轉述一篇心理學文章,主題是「人類關於 AI 最危險的錯覺就是我們自己」,說我們跨過了一條被警告了數十年的線、其餘的就看我們了;把風險的來源指回人類本身是必要的視角。
(2084616847047946674)
### 🚕 「Waymo 現在對達拉斯的所有人開放」
Microsoft Research(@MSFTResearch)問 AI 能不能透過臨床對話學習病理學,並介紹一個多模態基礎模型,說那是用真實病理報告裡的病理影像與語言訓練的;用真實報告訓練的醫療模型是很重要的方向。
(2084616849052831991)
Intel Foundry(@Intel_Foundry)指出先進節點始於生態系的協作,並宣布在某場設計自動化大會上,其加速器聯盟的夥伴宣布了針對兩個製程節點的認證電子設計自動化解決方案;生態系認證是製程能否被採用的關鍵。
(2084671313533112320)
Google(@Google)整理其七月的 AI 回顧,第一項是與某氣象機構及其雲端部門合作的先進天氣預報,使用高效能虛擬機來運行其大氣模型、提供某某;科學運算的實際成果比消費產品更有份量。
(2084672048236745184)
kazunori_279(@kazunori_279)指出如同某位教授的部落格提到的,他認為大模型的行為像是語意的狀態轉移機,所以它不是那種你輸入某個值就得到某個值的簡單函數;把模型類比成狀態機是很有用的心智模型。
(2084638967459455474)
geoff(@GeoffreyHuntley)指出這些模型產生的程式碼比大多數公司能僱到的人更好、而價格點是第一,比人類便宜;但把思考外包出去是第二,一種工程上的某某;把「便宜」與「外包思考」分成兩件事來評估相當清楚。
(2084679759368491375)
Vaibhav Srivastav(@reach_vb)指出某實驗室的開發者體驗團隊大部分成員這週要聚在一起,規劃、建造並思考他們能為開發者做得更好的地方,並問大家覺得該專注在什麼;官方公開徵求優先項目值得參與。
(2084671716425675206)
Maor Shlomo(@MaorShlomo)宣布其模型的基準測試結果,說在生產環境經過嚴格測試之後,附上的是它在其平台內建造美觀、功能完整且複雜的網頁應用的結果;自家模型的自測結果應與第三方對照。
(2084670171336106276)
Modal(@modal)指出某公司的共同創辦人兼執行長要在其活動上發表主題演講,說他很早就看好非同步的背景代理、而他幾乎在每一個某某上都是第一個;把「誰先看到」記錄下來對產業史有價值。
(2084656707029045539)
andrew chen(@andrewchen)招募說來跟他以及來自五家知名公司的前成長團隊成員一起工作,說他們正在某個加速器裡建立一支成長行銷團隊,並列出你會做的某某;把團隊成員的來歷列出來是有效的招募文。
(2084674358006689896)
Mehak Vohra(@itsmehakvohra)指出她僱過最好的員工都對「贏」有執念,說他們因為前一次創業沒有成功而帶著一種不服氣,因為他們失去了某些對他們重要的某某;把動機的來源指認出來對招募很有幫助。
(2084434000693887289)
Alex Atallah(@alexatallah)感謝大家的回饋、說已經整合進其評測產品,但也指出那個產品遠遠不只是評測,並說如果你在建造雲端代理就私訊某人;產品定位的擴張通常伴隨回饋整合。
(2084659532869873901)
Ben Dicken(@BenjDicken)解釋行程是作業系統讓一個應用能表現得像它擁有整台電腦的方式,說沒有它們(加上虛擬記憶體)寫軟體會困難得多,然後說明這一切如何運作;作業系統基礎的視覺化教學永遠需要。
(2084674333084110985)
SumitM(@SumitM_X)分享一道最近很常被問的後端面試題:你正在實作一個回傳使用者給客戶端的介面,但資料庫裡有一百萬個使用者,而某某;分頁與大量資料的處理仍然是面試核心。
(2084667913492140299)
Tw93(@HiTw93)表示有人做了他專案的評測、讓他的一天變好了,說某位作者在其電腦上跑了那個開源命令列工具、清出了大約十三 GB,而在六個月的日常某某;第三方評測對開源作者是最好的回饋。
(2084655118641934664)
David Nix(@david_nix)表示他又這麼做了,說這種瘋狂是有方法的,因為那個新模型把他主機上所有的顯示記憶體都吃光了,而他仍然會跑小模型並偶爾訓練,所以他加了某某;本地硬體的擴充決策過程很有參考價值。
(2084640693046370320)
Markets & Mayhem(@Mayhem4Markets)問大家準備好迎接新的開放權重模型了嗎,說我們會拿到各種版本,而他很期待、因為前一代的那個中型模型是最有能力的某某;發布前的期待管理也是市場資訊。
(2084635789950898654)
### 📊 統計
> 共收集 380 條推文,精選 80 條摘要。
### 📝 總結
> 本輪最出人意料的貢獻來自一家應用層公司(@cursor_ai):**他們要開源 Mixture-of-Kittens——為 NVL72 所做的 MoE 訓練巨核心,把所有混合專家的通訊與計算融合成單一個核心。** @eliebakouch 給了專業評價:**前向傳遞最高約兩倍加速,而且他們也有反向。**
開放權重在同一小時內還有兩件事:**Mistral 推出 3B 的裝置端內容安全模型**,而 **Ling-3.0-flash 釋出官方 BF16 與 FP8 版本。**
成本對照走到了最極端的一組數字(@EntelligenceAI):同一份 WeirdML 評測,**DeepSeek V4 Flash 0.03 美元、Kimi K3 0.86 美元、GPT-5.6 Sol 1.86 美元。** @HedgieMarkets 則把它算成一個百分比:**每百萬輸出 0.28 美元對 25 美元——99% 的折扣。**
市場那邊 **S&P 500 首次升破 7,700 點,總市值史上首次突破 70 兆美元**(@KobeissiLetter)。
工程上有兩個很值得抄的設計。@Cloudflare:**wrangler dev 現在為每一個本地請求產生結構化追蹤,而你的代理可以呼叫單一介面來精確定位什麼失敗了——不需要部署。** @coderabbitai 則把審查的評價標準移了位置:**「兩者都抓到東西,但『抓到東西』不是這份工作。可解釋性、在情境中、且能規模化才是。」**
記憶那條線也有了正式命名(@mem0ai):**大多數活躍專案都帶著幾條在暗中互相矛盾的記憶。** 而 @antonioleivag 提供了一個實用警告:**某個模型在「乾草堆裡找針」的基準上掉到 50% 以下,所以建議不要用超過那 27 萬上下文視窗的一半。**
標準之爭正式浮上檯面(@christitustech):**「很清楚 Anthropic 在建護城河——它沒有採用 AGENTS.md 與 Skills 這些更廣泛的標準,而是透過 CLAUDE.md 推自己的等價物。」**
最後一則畫面很能說明現在的工作方式(@sbilstein):**早上起床、看了手機上的 Cursor,發現一個他從手機啟動的雲端代理為了修一個記憶體洩漏工作了四個小時——而且修好了。**
🌙 Night
Copied!