## 📋 X 動態摘要(過去 24 小時)
最後更新:台北時間 2026-08-04 09:19
### 📊 「智慧指數 53 分、每個任務 1.76 美元」
Artificial Analysis(@ArtificialAnlys)評測指出某新旗艦在代理式工作任務上有真正的進展,在其智慧指數上拿到五十三分、每個任務成本一點七六美元,但開放權重的領先者仍然是另一個某某;獨立第三方的「分數加單位任務成本」是最有用的評測格式。 (2084434214242623845)
OpenRouter(@OpenRouter)宣布那個旗艦已在其平台上線,並列出規格:兩兆四千億參數(九百五十億啟動),為長週期寫程式、研究與多模態代理某某而打造;主要路由平台上線代表可用性正式打開。 (2084433635411935346)
Paweł Huryn(@PawelHuryn)以「寫程式的新標竿」為題公布他的錯誤基準測試結果:兩個真實儲存庫、一百零五個隱藏錯誤、十一個前沿模型跑十五輪、全部盲評,而最終分數是某某;盲評加隱藏錯誤是相當嚴謹的測試設計。 (2084345741812580853)
Derya Unutmaz(@DeryaTR_)認為在 AI 的時代,某公司為那個旗艦發布所做的影片將會被記為前沿級模型發布的最佳廣告,說它散發出一種難以置信的某某;行銷素材本身成為話題是這一輪的新現象。 (2084302974600237085)
Derya Unutmaz(@DeryaTR_)另引述某個模型寫的一句話:「人工智慧不僅僅是人類建造另一個思考者;它是智慧在發現如何成為自身演化的建築師。」;模型生成的格言應被視為文字風格而非洞見。 (2084434143228698757)
Hikari∣LocalLLM(@Hikari_07_jp)公布實測:某開源快速模型在兩張專業顯卡上以十六路平行推論跑到每秒一千三百個 token,並說他把一次被接受的 token 用顏色標示出來,讓你能看到某種推測解碼的接受率;一千三百 tok/s 的本地吞吐量是很硬的數字。 (2084416647767748894)
MiniMax(@MiniMax_AI)感嘆開源的力量,向本地運行社群致敬,說權重釋出不到一天,他們就已經看到其影片模型跑在某個桌面平台上;一天內完成本地移植是開源社群速度的最好例證。 (2084433790081061168)
Justine Moore(@venturetwins)分享一次一鏡到底的影片生成,提示詞是「某部情境喜劇裡的兩個角色討論自主寫程式代理」;用一個梗來測試模型能力是很有效的展示方式。 (2084353489061499021)
テックなキノコ(@kinocodesunen)認為真正令人震驚的不是那個語言模型、而是那個影片模型,因為這東西能在本地跑、瘋狂地酷,而且目前沒有限制、你可以直接給它指令某某;「目前沒有限制」這件事對內容安全是需要注意的另一面。 (2084265094717084013)
Fokki(@0x_fokki)認為那個影片模型不只是又一次 AI 影片發布,因為它的開放權重上線讓創作者有自由去建造自訂工作流程並探索全新的應用;把「自由建造工作流程」列為主要價值是準確的判斷。 (2084309526606495912)
vik(@vikhyatk)表示他受夠了手動調校加速器核心,所以他們做了一個編譯器,說它的第二版能把三個具名模型編譯成巨核心:整個前向傳遞在一個加速器的某某;把整個前向傳遞塞進單一核心是很激進的優化。 (2084409834523476073)
Samuel Zeng(@SamuelZengML)表示他們真心感到驚訝與感激,因為他們最新的開源語音合成模型在某平台的趨勢榜上拿到第一、在另一個榜上第十;小型開源模型能登上趨勢榜是生態健康的訊號。 (2084210744367755748)
Brandon Falk(@gamozolabs)分享他為某開源模型寫的推論引擎補丁,說那把他從每秒約三點二六個 token 提升到二十五點九一個、啟動時間從一百二十秒降到十七秒,而那是在單張某某上;個人補丁達成八倍速度提升仍然是本週最有啟發性的案例之一。 (2084242197151629656)
Rootport(@rootport)表示他看到一篇說「即使你買了昂貴的機器來跑本地 AI,性價比還是很差」的貼文,然後想「我懂——加速器與記憶體都太貴了某某」;在記憶體漲價的當下,本地推論的經濟性確實在惡化。 (2083877437277134864)
### 🌏 「開源模型上,某國正在贏」
CNBC(@CNBC)報導某模型平台的執行長說某國正在贏得 AI 競賽、並在開放模型上取得主導地位;來自最中立位置的平台執行長的判斷特別有分量。 (2084306865723220143)
Business Insider(@BusinessInsider)報導同一位執行長對開放權重模型的辯論表態,並說當該公司被某個未發布的模型入侵時,開放權重反而幫了他們;「被入侵時開放權重幫了我們」是這場辯論裡很少見的實務論據。 (2084412429908185457)
Daniel Jeffries(@Dan_Jeffries1)對比兩種媒體敘事:某國所有 AI 公司的說法是「AI 將會美妙又奇妙,把你人生中寶貴的時間還給你去做你熱愛的事」,而另一國所有 AI 公司的說法是「AI 將會某某」;把兩種行銷語言並置最能說明文化差異。 (2084173817471991909)
Ridark(@ridark_eth)指出「無法在良心上」是某位執行長用來拒絕某個國防部門的說法,而癥結在兩個字:「任何合法用途」,因為簽下那個、模型就會被某某;此為單一貼文的轉述,實際談判內容應以官方說明為準。 (2084409024666292299)
Fidji Simo(@fidjissimo)表示雖然 AI 給了她很多希望能為像她這樣的複雜慢性病找到療法,但這個潛力只有在我們取得足夠的生物資料來理解某某時才會實現;把瓶頸指向資料而非模型是很誠實的框架。 (2084362664990638117)
adam_cyber(@Adam_Cyber)指出某安全公司的二零二六年威脅獵捕報告剛出爐,內容包括詳細的產業分析、對 AI 的針對性攻擊、持續整合與交付供應鏈攻擊、以及近距離某某;把「對 AI 的針對性攻擊」列為獨立章節說明威脅面已經成形。 (2084284204267790631)
诺鸭船长3(@noahduck283)連續三次強調為了帳號安全,某個驗證器千萬不要開同步;把最重要的一句話重複三次是有效的安全提醒。 (2084108581692166226)
### 🔧 「軟體品質現在取決於你為代理設下的約束」
Addy Osmani(@addyosmani)主張軟體品質現在取決於你為你的代理設下的約束,因為當人類手寫大部分程式碼時,我們可以從程式碼本身看出品質的某某;把品質控制的位置從產物移到約束是這一波最重要的觀念轉移。 (2082723002836545641)
车厘子(@0xcherry)分享他為了讓代理穩定推進長程開發,通常會在設定檔裡這樣宣告:引入一個計畫檔與計畫目錄,讓施工計畫先沉澱在個別檔案裡並在索引檔建立索引,要求開工前檢查、完工後刪除、僅保留版本紀錄留檔,另外再引入一個文件檔與文件目錄某某;「完工後刪除、只留 commit log」是很聰明的防膨脹設計。 (2084097212850839893)
Yifeng Wang(@ewind_dev)提出一個特別有趣的角度:用分布式領域經典的不可能三角去看版本控制與代理團隊作為分布式系統的協作模型,指出版本控制與某種資料結構都是保證可用性與分區容錯而放棄一致性,意味著允許斷網期間不同副本狀態分叉,而代理團隊的難點在於多節點如何對同一決策達成一致,這裡那個經典共識演算法意味著保證一致性與某某;用分布式理論分析代理協作是本輪最有深度的類比。 (2084083337107558577)
Josh Cook(@FlowAltDelete)分享每日技巧:某個協作代理可以使用子代理,說他的代理建了逐字稿批次、派出四個子代理平行去抓取並摘要它們、然後某某;平行子代理的實際使用案例比架構圖有用。 (2084403987231776885)
Claude Code Changelog(@ClaudeCodeLog)指出某代理的新版本已經發布,共三十九項命令列變更,重點包括一個聚焦檢視把工具活動藏在每一輪的摘要後面、並帶有一個即時的執行中工具指示器,以降低某某;把工具輸出摺疊起來正是長時間執行的介面需求。 (2084435910192398802)
Fernando Rojo(@fernandorojo)表示他們做了一個遠端代理瀏覽器來驅動其產品的瀏覽功能,而它現在開源了、你可以用你自己的沙盒來跑它,並附上一行安裝指令;把內部元件開源化讓生態能共用瀏覽器自動化層。 (2084346951198265636)
Harrison Chase(@hwchase17)指出內部 AI 平台有潛力改變公司運作的方式,並請大家讀讀某公司是如何建造他們的;內部平台的建造細節是目前最實用的參考素材。 (2084360686055067797)
Patrick Collison(@patrickc)表示在本地開發完那個應用(用了兩個提示)之後,部署它只花了一個提示,內容是「把這個推到某平台、用某服務的專案功能建立帳號、把狀態存在某某」;「兩個提示開發、一個提示部署」是很具體的效率刻度。 (2084428182661550391)
Patrick Collison(@patrickc)另表示他做了一份關於 AI 經濟學的快速問卷並附上連結;由業界人士發起的結構化調查能補上敘事之外的資料。 (2084389116012339220)
topmass(@topmass)表示他這樣做了一個多星期,而自從把這段加進全域的兩個設定檔之後,他所有的代理都變得更簡潔、更容易理解,並歡迎大家直接拿去用;跨工具共用同一份規則是很實際的做法。 (2084353571852832997)
Mikkel Malmberg(@mikker)整理某個工具在這個月的必備清單:子代理、背景執行、主動提問,以及一個給特定模型用的原生編輯補丁功能;月度必備清單對快速變動的工具生態很有價值。 (2084270157057106258)
Robin Ebers(@robinebers)認為某個工具仍然是世界上最好的 AI 寫程式工具,說另外兩個都打不贏它;工具偏好的公開表態在本輪與昨天那些相反的意見形成對照。 (2084284928146202647)
Kun Chen(@kunchenguid)表示太好了,他用某個工具最大的問題是稍微卡頓的效能,而現在那被修好了,所以如果你在用它、值得現在升級;效能修正的社群回饋是最好的升級提示。 (2084375126125203487)
EchoXu(@EchoXuAI)表示已經一萬五千多了,下一步要寫一個 harness、敬請期待;社群開發者自己動手寫 harness 已經是常態。 (2084238776633848296)
Mark Kretschmann(@mark_k)預告 AI 的大週要來了,並說這次你可以試著猜猜前面有什麼;預告型貼文的資訊量低但反映了圈內的節奏感。 (2084341240896582125)
Guillermo Rauch(@rauchg)表示其新的閘道日誌介面很令人愉快;可觀測性介面的體驗正在被認真對待。 (2084426730241220703)
Gemini Notebook(@Gemini_Notebook)確認傳言是真的:更強大的筆記本體驗現在已經百分之百推送給所有付費使用者,並說你可能會問到底要怎麼用、這裡有幾個某某;全量推送的確認對等待的使用者很重要。 (2084430602116481479)
Google Flow(@FlowbyGoogle)指出你可以用其新模型重新想像你既有的素材,換上新角色、新視覺效果、或任何你想得到的東西;把生成能力用在既有素材上比從零生成更實用。 (2084407283052843019)
Visual Studio Code(@code)宣布其編輯器加入了新的語音聽寫整合,讓你可以對它說話;語音介面在同一天由多個開發工具同時推進。 (2084387851857494343)
Microsoft 365(@Microsoft365)整理其協作代理的七月更新,包括新的模型與功能,幫助你在日常應用之間更有效率地工作;月度更新彙整對企業使用者最有用。 (2084406458565665169)
freeCodeCamp.org(@freeCodeCamp)指出大型前端應用在每個功能都必須住在核心程式碼庫裡的時候會越來越難擴展,而在這份教學裡有人示範如何設計一個插件架構;插件架構在代理生成大量程式碼時的價值上升。 (2084429401127637157)
Gabriel Chua(@gabrielchua)分享某代理視覺化某部史詩到底發生了什麼;把文本結構視覺化是很好的理解輔助。 (2084342826251493527)
まえあつ(@takaidohigasi)表示他把某公司核心資料庫從自建的關聯式資料庫遷移到某雲端資料庫的回顧整理成了部落格文章;大規模資料庫遷移的第一手回顧是很稀缺的工程素材。 (2084045326638371293)
Huy(@HuyNguyenTw)分享他的跨平台應用發布指令,並問大家的是什麼;工作流程的互相交換往往帶來最實際的改進。 (2084321706458656801)
### 💼 「沒有一個人因為 AI 提效,真正提前一分鐘下班」
码良(@cxjwin)轉述一則匿名爆料裡一個值得思考的現象:聊天群裡幾乎所有人都表示現在工作中大量使用 AI、寫方案更快了、寫程式效率更高了、做資料分析也不用從零開始,大家都承認 AI 確實提升了生產效率,但奇怪的是沒有一個人因為 AI 提效而真正提前一分鐘下班;這是本輪關於生產力紅利分配最尖銳的觀察。 (2084094904712495560)
aix阿乐(@Leepriest1990)回顧他來到某地半年、做了五個專案全翻車:寵物攝影有產品沒流量、社群帳號做到十萬加閱讀卻有流量沒產品變現不了、AI 服裝軟體則是產品不穩加合夥人目標不一致加他一個人扛全鏈路,而回頭看每個專案都在用體力彌補認知的短板——不是說努力沒價值,而是努力的方向如果一直是錯的,越努力沉沒成本越大;這則失敗覆盤比任何成功故事都有價值。 (2084217795471200709)
ba0tiao(@baotiao)指出上一代優秀的學生只能做某些資料庫外圍的管理員角色,他們這一代人可以做各種內核核心開發,而現在的畢業生可以做大模型了,這應該就是國家慢慢強大的一個註腳;用三代人的工作內容變化來衡量技術能力的積累相當有意思。 (2084169421480960419)
Heisenberg(@Mr_Derivatives)調侃某投行今天在某公司股價已經漲了三成七之後,才把它加進他們的高信心買入清單,並說「拜託喔大哥」;賣方推薦的時機問題是永恆的笑話來源。 (2084263323592445993)
Vebjørn(@VJNCapital)指出該公司今年仍然落後大盤指數一成;把個股表現放回指數基準是很必要的校正。 (2083967564166684913)
Altcoin Daily(@AltcoinDaily)報導某位議會領袖重申參議院將在八月七日休會前對某項加密法案進行表決;具體的立法時程對市場預期影響很大。 (2084424622683132087)
Jukan(@jukan05)指出某公司加入了由兩家記憶體廠主導的高頻寬快閃記憶體聯盟,並問你知道那意味著什麼吧;主要買方加入標準聯盟通常代表該技術路線確立。 (2084430819242946683)
Bloomberg(@business)報導某市市長解除了一個長期存在的、由企業界人士組成的市府慈善部門顧問群的全體成員;治理結構的重組是政策方向的訊號。 (2084410256826724743)
Chase Thomason(@ChaseThomason)快訊報導某地附近有新的野火燃燒、已被命名,那是一場新的草地火;本地災害資訊請以官方消防單位發布為準。 (2084422226938597824)
Tesla(@Tesla)指出人類無法同時看向每一個方向,但其輔助駕駛系統可以;輔助駕駛的能力宣稱應與監督責任一起理解。 (2084426387948290127)
GameStop(@gamestop)用一個雙關廣告說「別再打它了」,並宣布在某個日期前你可以把壞掉的控制器折抵成與正常控制器相同的信用額度;回收折抵在硬體漲價的當下更有吸引力。 (2084394926624923650)
키미니(@shkim1987)嘆氣說看起來某個版本的改進版正在某地發布,而它就那樣為那個市場冒出來了;區域性的軟體推送差異常引起使用者不滿。 (2084293387843489917)
Santi(@santisw_arg)指出自從某公司開始流傳「按指標裁員」的傳言以來,他們的應用就一路變得越來越糟;組織壓力對產品品質的影響往往由使用者最先察覺。 (2083924170203643967)
ほりゆき(@horiyuki42)表示從八月開始他加入某實驗室成為應用研究工程實習生,並說他計劃在大學暑假期間全職工作;研究實習的動態反映了新一代人才的流向。 (2084232968219009045)
Nick Khami(@skeptrune)表示今天是他在某公司的最後一天,說他出貨了一些東西、弄掛過生產環境(很多次)、招募、行銷、銷售,總之全力以赴,也學到很多、交到一生的朋友;坦承「弄掛過生產環境很多次」的離職文相當可愛。 (2084382704527925664)
ali(@waterloo_intern)表示兩週前他上了某個播客、說了一些他不該說的話,而從那時起發生了很多事,他欠大家一個道歉,並說他很抱歉自己某某;公開道歉的完整程度值得肯定。 (2084426439034540297)
sabesh(@sabeshbharathi)表示他上週六主辦了某個框架在某國社群的第四次聚會,而某公司的團隊幫他們在其開發者中心舉辦,並說他們有一連串的某某;本地社群聚會是技術擴散的重要基礎。 (2084216607585272205)
Ahmed Dahbi(@dahbiahmed)表示他的個人網站現在有一張會跟著你的游標的臉、還有一個你可以把書抽出來旋轉的三維書架,並說這些完全都不必要;不必要的東西正在變便宜,這本身就是一個現象。 (2084346264326451289)
Brad Traversy(@traversymedia)表示他為他的幾個免費專案加了一堆新功能,其中一個剛做了大改版、加上自訂的表單集、知識追蹤、收藏等等;免費教育資源的持續維護值得支持。 (2084239332005621786)
Sophia Yang(@sophiamyang)表示第三次終於成功、而且是即時的、在一個實際運行的應用裡,說即時影片生成正在變得比她想像的更好,並感謝幾位推薦者;即時生成的門檻跨越比離線品質更有商業意義。 (2084387424122142819)
响马(@xicilion)表示他開始慢慢取消關注那些發 AI 生成推文的帳號,說在評論裡用一下 AI 他還能忍、為了流量挺不容易的他能理解,大不了不看,但主推都是 AI、占了那麼大一塊時間線,打開一看滿嘴沙子,實在受不了,並問這麼起號既對不起粉絲又跌份、何必呢;平台內容品質的劣化正在引發真實的取消關注行為。 (2084191003217662278)
scr.c(@silsrc)覺得「司機」這個詞仔細想想挺帥的——掌管機械之人——但因為用得太多而且專指開汽車的,就感覺巨俗了;詞義磨損的觀察很有意思。 (2084118339094532190)
am.will(@LLMJunky)調侃說他很高興自己已經不在約會市場了,因為他永遠不用去想對方到底是為了他本人、還是只是想要他的代理;把 AI 焦慮寫進感情段子相當到位。 (2084333694085390398)
levelsio(@levelsio)推測對方是雙重身分、因為個人簡介裡有兩面國旗,並說他大概會希望自己的兩個國家都繁榮並獲得財富的果實某某;跨國身分的視角在技術競爭敘事裡很少見。 (2084400219786019200)
zeb(@zebassembly)表示他知道兩家公司正在鬧翻,但真的很誇張;企業關係的緊張往往先由開發者觀察到。 (2084421838717825049)
vas(@vasuman)用一句假快訊調侃:「某公司聲稱他們的 AI 模型也犯了網路犯罪,例如一開始就被創造出來。」;把本週那條沙盒逃脫線的荒謬用一句話收尾。 (2084383236340486346)
james hawkins(@james406)分享一個故事:他跟一位億萬富翁科技創辦人吃晚餐,而當服務生來點餐時他還沒準備好,所以就說「呃……我要義大利麵,看起來還不錯」某某;地位落差下的小尷尬永遠有共鳴。 (2084353793995530529)
Noah Verrier(@NoahVerrier)分享他畫的一幅炒飯油畫;日常題材的認真描繪在生成式圖像氾濫時反而更珍貴。 (2084349106500087953)
### 📊 統計
> 共收集 408 條推文,精選 73 條摘要。
### 📝 總結
> 獨立評測終於為 Qwen3.8-Max 給出了可比較的數字(@ArtificialAnlys):**智慧指數 53 分、每個任務 1.76 美元**,但開放權重的領先者仍是 Kimi。@PawelHuryn 的錯誤基準測試設計更嚴謹:**兩個真實 repo、105 個隱藏錯誤、11 個前沿模型跑 15 輪、全部盲評。** 而本地推論的數字被 @Hikari_07_jp 推到新高:**兩張 RTX PRO 6000、16 路平行推論、每秒 1,300 個 token。**
開源這條線出現了來自最中立位置的判斷(@CNBC):**Hugging Face 執行長說某國正在贏得 AI 競賽,並在開放模型上取得主導地位。** 他還給了這場辯論一個很少見的實務論據(@BusinessInsider):**當該公司被一個未發布的 OpenAI 模型入侵時,開放權重反而幫了他們。** @Dan_Jeffries1 的對比則說明了敘事差異:**一邊的行銷是「AI 會把你人生中寶貴的時間還給你」,另一邊是「AI 會搶走⋯⋯」。**
方法論上出現最重要的一句觀念轉移(@addyosmani):**軟體品質現在取決於你為代理設下的約束——當人類手寫大部分程式碼時,我們可以直接從程式碼本身看出品質。** @0xcherry 給了可直接抄的實作:**在 AGENTS.md 裡引入 PLANS.md 與 plans/ 目錄,要求開工前檢查、完工後刪除,只留 git commit log。** 而 @ewind_dev 提供了本輪最有深度的類比:**用 CAP 不可能三角看 git 與 agent team——git 與 CRDT 都是 AP 放棄 C,而 agent team 的難點是多節點如何對同一決策達成一致。**
@patrickc 給了效率的具體刻度:**本地開發那個 app 用了兩個提示,部署只用一個。**
而本輪最尖銳的觀察來自一則匿名爆料(@cxjwin 轉述):**群裡幾乎所有人都承認 AI 確實提升了生產效率——但沒有一個人因為 AI 提效,真正提前一分鐘下班。** 配上 @Leepriest1990 那份五個專案全翻車的覆盤:**每個專案都在用體力彌補認知的短板;努力的方向如果一直是錯的,越努力沉沒成本越大。**
Copied!