## 📋 X 動態摘要(過去 24 小時)
最後更新:台北時間 2026-08-04 06:18
### 🧮 「所有前沿模型都無法正確實作基本的非線性偏微分方程求解器」
Jonathan Gorard(@getjonwithit)指出所有前沿 AI 模型(包括三個具名的頂級模型)都一致地無法正確實作基本非線性偏微分方程的求解器,而且經常引入嚴重的某某;這是對本日那條數學突破敘事最具體、最技術性的反例。
(2084300170682863986)
Adam Aaronson(@aaaronson)用一個雙關笑話介紹某位哲學家提出座標平面的時刻:「這不只是 x,而是 y。」;把一種被廣泛抱怨的 AI 句式變成數學史笑話相當高明。
(2084326219684749518)
Brendan O'Donoghue(@bodonoghue85)指出大家都在討論誰在模型品質前沿領先,但他認為很清楚的是某個經濟體已經在「傳達一個關於 AI 未來的正面願景」這件事上取得領先;把競爭軸從能力移到敘事是很有意思的觀察。
(2084256523794931879)
Forward Future Brian(@ForwardEditor)反諷「你怎麼知道那是高品質的程式碼」是一個蠢問題,因為你可以看到新的程式碼字面上是綠色的、那意味著它通過了所有測試;用測試顏色代替品質判斷的荒謬被講得很清楚。
(2084154363157598312)
Kenn Ejima(@kenn)指出某個代理仍然有留下垃圾程式碼的傾向,但真正可怕的部分是在另一個模型的審查裡,它只把那些標記為「小意見」,所以只要某某;審查者的嚴格度不足是代理審查最大的隱憂。
(2084127421071274151)
### 🎙️ 「六個月建出來的全球即時系統」
Atty Eleti(@athyuttamre)指出其語音產品在工程上的突破程度與研究上一樣大,並請大家看兩位同事寫的那篇文章,關於他們在六個月裡建出來的全球即時系統;六個月建出全球即時語音基礎設施是相當硬的工程成就。
(2084380180219629666)
Thariq(@trq212)指出他認為很多人沒有意識到:如果你連接了某個代理的連接器(例如你的郵件、日曆、通訊軟體),那麼其命令列版本也將能夠使用它們,包括在某某;這則提醒與另一家的辦公套件插件是同一個權限問題的兩面。
(2084387303959740449)
Keji(@Keji715)認為某個聊天產品的電腦操作能力遙遙領先,特別是在某個生態系下,因為他們有最強的團隊,並指出該公司在去年十月收購了一家公司,其產品是一款可以理解螢幕內容並跨應用執行操作的桌面助理;把能力領先追溯到一次收購相當有解釋力。
(2084244022189572457)
### 🕸️ 「這不是提示詞的問題,是控制流的問題」
Hux(@huxlab)描述一個場景:你的代理完美遵循了提示詞、結果還是翻車了,因為一個人漏了來源、第二個人重複同樣的錯、審核的人只看到漂亮答案就點了通過,等結果到你手裡沒人說得清是哪一步把整個執行毒死了,而這不是提示詞的問題、是控制流的問題,真正拉開差距的叫做圖工程;這是本輪對「圖」這個概念最有說服力的辯護。
(2084124659919028484)
Hux(@huxlab)另指出某實驗室執行長對某大學學生說了一句很狠的話——你已經不需要再寫提示詞了——並說那段內部分享大約三十八分鐘、講的不是基礎用法而是大多數人根本沒用上的那一層,看完你會發現自己平時的用法大概只發揮了它一成五的能力;「一成五」這個估計值得檢驗但方向可能是對的。
(2084116426789638232)
Xudong Han(@Xudong07452910)指出代理記憶最危險的時候往往是它太相信過去,因為很多記憶型代理找到相似經驗後會直接把它塞進上下文,但任務相似不代表當前狀態相同、舊經驗有時反而會把決策帶偏,而某篇論文提出把代理使用記憶的過程改成三步;「任務相似不代表狀態相同」是記憶主線最精確的診斷。
(2084119565899067447)
beamnxw(@beamnxw)盛讚一篇論文,說那篇計算機科學論文把多模型協作的「代理混合」換成了「代理圖」,結果是結構化的節點取樣某某;把混合換成圖是這條方法論線的學術版本。
(2084238050867962168)
Microsoft Research(@MSFTResearch)推出一個開源框架,讓研究社群能跨任務類型訓練與評估 AI 代理,說它在支援強勁表現的同時降低了複雜度;研究級的統一評估框架是這個領域最需要的公共品。
(2084364547142418722)
Tom Dörr(@tom_doerr)介紹一個專案,讓你的 AI 助理有持久記憶來擷取、搜尋並跨代理與跨儲存庫地重用專案知識;跨儲存庫的知識重用正是本日那個七成五成本問題的解法方向。
(2084089693365325995)
wevm(@wevm_dev)推出一個工具做代理的自動化摩擦紀錄,說你的代理整天都在撞上小痛點、然後它們繞過去就忘了,而這個工具把那些變成一份追蹤某某;把代理遇到的摩擦點自動記錄下來是很聰明的產品切入點。
(2084379511819493842)
Josh Cook(@FlowAltDelete)指出某公司剛把其代理建造平台的上限拉得高得多,因為建造者現在可以選擇 harness,而該平台有兩種:一種是給結構化對話與規則式某某用的;「讓使用者選擇 harness」是平台化的關鍵一步。
(2084315856998445244)
Open Source Startup Podcast(@OssStartup)指出每個人都在談 AI 代理,很少人在談如何管理其中的數百個,並說兩位主持人與某個熱門開源專案的作者聊了這件事;「數百個代理的管理」是下一個明顯的缺口。
(2084368069724705014)
Will Bryk(@WilliamBryk)表示其搜尋索引現在是世界上最大的索引之一,服務八百億個頁面、追蹤一點四兆個網址,並預計在二零二七年初達到某搜尋巨頭的規模;獨立索引的規模化對代理的資訊來源多樣性很重要。
(2084321018546704624)
Ruby on Rails(@rails)指出其新功能給了該框架一個單一的、符合其資料層風格的介面,用來跨四種搜尋後端(三個搜尋引擎加上資料庫全文搜尋)進行搜尋;把多後端收斂成一個介面是很好的抽象。
(2084275797049672064)
智享(@CycleDecoded)介紹一群狠人把某個嵌入式資料庫強制「魔改」成分布式資料庫的專案,說那是某團隊搞出來的開源分支,徹底打破了它只能跑在單機上的限制、星數已刷到一千三百多;嵌入式資料庫的分布式化對邊緣代理有直接意義。
(2083894391429796254)
monokern(@monokern)指出一個免費的、七萬五千顆星的儲存庫徹底解決了某代理裡那種通用的「AI 拼湊感」外觀,因為大多數 AI 生成的網站看起來很廉價,是由於模型預設某某;這正好接上昨天那則「所有簡報都長得一樣」的抱怨。
(2084276448047546871)
Riley Brown(@rileybrown)分享一個小而有用的技巧:要求回應以「可編輯的文字區塊」形式呈現,這樣回應會是一種你可以手動輕鬆編輯、以及某某的格式;輸出格式的小要求往往帶來很大的工作流程改善。
(2084350923568971948)
わどAI界のマスコット(@wad0427)整理第一週使用某代理該學的五個指令,第五名是一個診斷指令:當東西不работать時就用它,它會診斷出缺了什麼並修好它能修的;診斷指令通常是最被忽略也最有用的。
(2084161650072965621)
DeFi狙击手(@bi_9527zx)指出某公司悄悄把一套價值上萬的完整 AI 課程免費放上某平台、幾乎沒人發現,內容是十二週二十四節課、像打遊戲一樣一關關通關,從 AI 是什麼開始,到自己手寫感知機與神經網路,再到卷積網路、目標檢測、生成對抗網路、變換器架構、大模型提示工程,最後還講負責任的 AI,而最猛的是每節課都是能直接跑的互動筆記本;免費完整教材在本輪由多個帳號指出。
(2084107330724200803)
lumxss(@bkdgiffug)介紹某平台上一份有四萬四千個收藏的英語學習指南,說核心就一句話——你以前學英語的方式從根上就錯了——並列出四點:不背單詞、不刷題、AI 加科學方法、像學母語一樣習得;學習方法論的重構在 AI 輔助下確實有新的可能。
(2083889550276096336)
### 🐋 「一張消費級顯卡現在就能做到這些」
うみゆき(@umiyuki_ai)表示本地跑那個影片模型真的很驚人,說是啦、當然另一個閉源模型更好,但這個已經勉強到了可以取代它的水準;「勉強可以取代」是最誠實的評價尺度。
(2084223665697333621)
Lumina(@LuminaXspace)整理某個模型預計本週發布的細節:某位執行長說會在八月七日左右落地,規格包括一點五兆參數的模型、大幅改進的監督微調與強化學習、目標對準某個開源模型的智慧水準;把傳言整理成規格清單方便後續核對。
(2084317423067443548)
Lumina(@LuminaXspace)另指出某公司的新高階模型洩漏將在八月十二日發布,理由包括有大量的分流測試、以及已經在與選定的合作夥伴測試中;同一個日期在本輪由第二個來源指出。
(2084389316801782212)
Chetaslua(@chetaslua)引述某券商的研究指出另一個模型的下一個小版本將在短期內推出,將透過更多高品質資料、更強的後訓練來增強真實世界的寫程式能力;券商研究對開源模型時程的追蹤越來越細。
(2084305394877518148)
Astro Polo(@astropol0)認為某個模型本週要發布,但他認為某位執行長不該違背把它開放權重的承諾,因為我們正看著幾個開源模型某某;開放權重承諾的追蹤是社群的重要監督功能。
(2084363188850851951)
Jun Song(@jun_song)指出又一個前沿 AI 從某系列釋出,而他們說那個二百七十億參數的版本要來了,並說那才是最有意思的部分;「中型開權重才是重點」在本輪由第三個帳號重複。
(2084113089998512270)
cvxv666(@antpalkin)指出某個頂級模型從零建出了一整個飛行世界,沒有素材、沒有協助、一次完成,而題目是:一個可探索的三維世界、單一個網頁檔案、只用某個圖形介面、不使用外部某某;嚴格的限制條件讓這個示範比一般的展示可信得多。
(2084302112662417656)
Peter Gostev(@petergostev)表示他終於決定動手架一台小型本地伺服器來跑他的代理,原因是他的筆電在某某之下已經完全撐不住了;「筆電撐不住」正在成為本地伺服器需求的主要驅動力。
(2084385850859614500)
### 💰 「今天美股市值增加一兆美元」
Whale Insider(@WhaleInsider)列出大型雲端業者的漲幅:一家漲百分之六點一、一家跳升百分之四點七、一家上漲百分之四點六;同一波漲幅在今天由第四個來源確認。
(2084283089115656693)
Markets & Mayhem(@Mayhem4Markets)指出某公司靠 AI 取代客服人員每年省下七億五千萬美元,把支援人力從五萬人縮減到四萬人,而某銀行也某某;具體的人數與金額讓「AI 取代工作」從抽象變成可計算。
(2084301997511975389)
Nancy Pelosi Stock Tracker(@pelositracker)列出關稅退款的具體金額:某零售商二十四億美元、某科技公司二十二億美元、另一零售商二十二億美元、某車廠某某;這些數字把今天那個「超過一千億美元利潤」的說法落實到公司層級。
(2084395571197194699)
Bloomberg(@business)報導該政府計劃在週二於白宮接待 AI 公司,討論一個關於進行自願性安全測試的新國家框架;「自願性安全測試」是這則消息今天出現的最具體描述。
(2084376308335710708)
Arnav Gupta(@championswimmer)表示他認識的某個人在應徵某實驗室之前,把大量支持開源的內容從其網路人格中清掉了,因為那家公司不喜歡僱用支持開源的人;此為單一來源的轉述指控,該公司的實際招募標準應以官方說法為準。
(2084262578675449880)
Patrick McKenzie(@patio11)認為新創公司應該留著一個集合投資工具,並接受工程師等人願意提供的、盡可能多的五千美元小額投資,說這比較不是為了錢、而是為了某某;把小額參與當成關係建立而非募資是很有洞察的建議。
(2084381874609135780)
Chamath Palihapitiya(@chamath)邀請正在評估其軟體產品的企業產品或工程主管參加八月十二日的問答;企業採購的公開問答場合反映了銷售週期的階段。
(2084378097579655230)
Cate Brown(@catebrown12)表示在某報社一段像閃電般的任期之後,她很高興要加入某調查報導機構正在擴張的國安團隊;調查報導團隊的擴張在這個新聞週期特別重要。
(2084367376003260843)
### 🚗 「香港開始全無駕駛測試,右駕市場的世界首例」
Baidu Inc.(@Baidu_Inc)指出其自駕服務正在採取「正確」的一步,因為完全無駕駛的測試已在某地開始、那是右駕市場的世界首例,而路測也在另一座城市啟動;右駕市場的首例對全球擴張是重要里程碑。
(2084134762965524823)
Protect Our Streets(@Protect_Streets)指出某自駕公司剛召回三千八百輛機器人計程車,原因是在多座城市裡其無人車未能針對危險天氣條件做出調整;此為倡議帳號的貼文,召回的具體範圍與原因應以官方公告為準。
(2074554037270151645)
Mark Gurman(@markgurman)報導某公司即將上任的執行長把一位已退休的資深硬體主管請回來、擔任其新管理團隊的副總裁,說那是該公司主管某某的罕見案例;請回退休主管通常代表特定的技術優先項目。
(2084372972513501477)
Windows Central(@WindowsCentral)指出某公司正大力推動讓其作業系統在日常電腦上感覺更快更有效率,特別是那些仍然只有八 GB 記憶體的機器,而在一次新的訪問中某位主管某某;在記憶體漲價的當下,低記憶體優化格外有意義。
(2084308353476374558)
Tesla North America(@tesla_na)引述一段評測:「我們的試駕承認很短,但它沒有顯露出任何真正的弱點,無論是在城裡開來開去、或是出遠門,那款車就是答案,特別是某某」;引述評測的選擇性應與完整原文對照。
(2084374810092843128)
### 🌱 「城市是一種神」
tautologer(@tautologer)寫下一個想法:城市是一種神,一個龐大的活物,就在人類理解能力的邊界上或稍微超出,一個你可以與之不舒服但和平地共處的任性存在,直到某某;把都市經驗寫成神學相當漂亮。
(2084352928278880710)
Joseph Fasano(@Joseph_Fasano_)引述某位爵士樂手被問到爵士是什麼時的回答「如果你得問,你就永遠不會知道」,然後說如果你得問為什麼人類創造的過程很重要,那某某;把創作的不可言說性放進 AI 爭議裡相當有力。
(2084355217143816227)
Paul Graham(@paulg)指出對新創來說,賣東西給大公司的危險在於他們不會直接說不,而是先跟你開好幾個月的會,既然你討厭開會、那某某;把「不直接拒絕」指認成一種成本相當精準。
(2084367085954887789)
Brian Armstrong(@brian_armstrong)承認那篇文章是由 AI 寫的、他只給了最少的提示,並問知道之後你會更喜歡、更不喜歡、還是沒有改變;把揭露當成實驗來做相當坦誠。
(2084077150836232521)
Owen Gregorian(@OwenGregorian)反駁那份養小孩花費清單,說他很確定上面幾乎沒有一項是養小孩的必要開支,而當你以「全職保姆」開頭時就已經失去他了;成本統計的基準假設確實需要被檢視。
(2084389562915155990)
Sergio Ferrero(@calotonterias)指出一個人與伴侶的身體接觸時間越多(擁抱、親吻、牽手等),血液中的皮質醇水平就降得越多;此為單一貼文轉述的健康主張,具體效果量應查閱原始研究。
(2084315990729335227)
latke(@latkedelrey)分享一個故事:她曾經跟一個總是為她做好事的男生交往,而當她說「哇你總是這麼樂於助人」時,他回答「我在展示價值」;把商業語言用在感情上的荒謬不需要多加評論。
(2084344119791390746)
𝖓𝖎𝖓𝖊(@atlanticesque)認為某公司二零一三年一開始就做對了,因為它當時的某個表情符號是一把木頭與黃銅的燧發手槍,而這很完美、既不過度消毒、又某某;設計決策的歷史回顧常常比當下的爭論有洞察。
(2084324543942774845)
Alessandro Palombo(@thealepalombo)表示他是義大利人、妻子在某地出生,而很多人問他們第一次去該國要怎麼玩,所以他們坐下來準備了這份入門指南:哪些城市、在什麼某某;跨文化的第一手旅遊指南比演算法推薦有用。
(2083977352460267624)
章工(@435hz)提出愛人的三種方式:第一是給你花錢、第二是給你解決問題、第三是抽時間陪你,並說三者都能做到的話就論跡不論心,而如果對真心的要求太高,就會發現這世上根本沒有任何人是真心的;把抽象的標準換成可觀察的行為相當實用。
(2084162599189377274)
BBC Breaking News(@BBCBreaking)報導某國把強暴、嚴重的兒童性犯罪與誘導行為排除在提早釋放囚犯的方案之外;刑事政策的排除條款是重要的細節。
(2084394357176582580)
Crisis of Conscience(@crisisofconsc)表示大家可以在某場資安大會上找他拿一些調侃某公司的貼紙,說它們很大、完美適合貼在該公司的筆電上;資安社群的反企業幽默是其文化的一部分。
(2084335836477153692)
徐冲浪(@cyrilxuq)分享看一部歷史劇最大的感想:經濟維持不下去的時候,整個政治圈層首先想的是把糧食作物改種成經濟作物,也就是降低生活必需品的產出,因為附加值低;歷史類比在經濟壓力下總會重新流行。
(2084163274992685352)
### 📊 統計
> 共收集 376 條推文,精選 80 條摘要。
### 📝 總結
> 本日那條數學突破敘事終於遇到最技術性的反例(@getjonwithit):**所有前沿模型——包括 GPT-5.6 Sol、Fable 5、Kimi K3——都一致地無法正確實作基本非線性 PDE 的求解器,而且經常引入嚴重錯誤。** 這與昨天 @ylecun 那個一九二八年的提醒指向同一件事:數學能力不是一個單一維度。
語音那條線補上了工程細節(@athyuttamre、@juberti):**GPT-Live 是一個在六個月裡建出來的全球即時系統**,而且工程上的突破程度與研究上一樣大。權限問題則被 @trq212 一句話點破:**如果你連接了 Claude Connector(Gmail、Calendar、Slack),Claude Code 也將能夠使用它們**——這和上一小時 Cursor 那套 Workspace 插件是同一個問題的兩面。
方法論上出現對「圖」最有說服力的辯護(@huxlab):**一個人漏了來源、第二個人重複同樣的錯、審核的人只看到漂亮答案就通過——等結果到你手裡,沒人說得清是哪一步把整個 run 毒死了。這不是提示詞的問題,是控制流的問題。** 而記憶主線有了最精確的診斷(@Xudong07452910):**代理記憶最危險的時候,往往是它太相信過去——任務相似不代表當前狀態相同。**
本地推論跨過了一條線(@MiniMax_AI 官方原話):**「這是你現在用一張 RTX 5090 就能做到的事。我們已經跨過了一條線。」**
而「AI 取代工作」也第一次有了可計算的版本(@Mayhem4Markets):**某公司靠 AI 取代客服每年省下 7.5 億美元,支援人力從 5 萬人縮到 4 萬人。** 市場則交出一兆美元的單日增幅,大盤收在 7,600 點,而科技股出現**有紀錄以來最大的五週資金流入。** 關稅退款也落實到公司層級:**Walmart 24 億、Apple 22 億、Target 22 億美元。**
最後一則值得留著(@tautologer):**城市是一種神,一個龐大的活物,就在人類理解能力的邊界上或稍微超出。**
🌙 Night
Copied!