## 📋 X 動態摘要(過去 24 小時)
最後更新:台北時間 2026-10-06 16:16
### 🤖 AI 模型與實驗室
0x_kaize(@0x_kaize)指出 Google 新模型 Gemini 4 Argon 以 1,525 分登上 Text Arena 第一,寫作能力超越 Claude;Google 在寫作類評比重奪領先。
(2107161160470413411)
Wall St Engine(@wallstengine)報導月之暗面完成最後一輪私募、估值達 500 億美元,目標 2027 年初在香港上市;中國大模型新創加速進入公開市場。
(2107317188583727298)
Leo 的游戏人生(@leo114119)推測有網友疑似被灰度到 DeepSeek 新模型,並展示前所未見的「鵜鶘騎車」測試結果;此為未證實猜測,但顯示社群密切關注 DeepSeek 下一版。
(2107365489290915875)
storagereview(@storagereview)實測兩台 DGX Station GB300 叢集,GLM-5.3 單台輸出 188 tok/s、雙台並發達 5,018 tok/s;桌邊工作站已能承載大型開源模型的高並發推論。
(2107183402042400849)
christopherowen(@christopherowen)整理在四台 DGX Spark 上運行 DeepSeek V4.1 Flash 的完整指南;小型本地叢集部署開源模型的文件日益完善。
(2107196373238153473)
sudoingX(@sudoingX)在 24GB RTX 5090 筆電上測試 Cloudflare 的 Clef 27B 與 9B 決策模型;決策型模型已可在高階筆電本地運行。
(2107368793706230140)
george_onx(@george_onx)宣布推出首個會思考的決策模型 GLiDE,在 Decision Index 以 6.9 分領先 Jev;決策模型賽道出現新競爭者。
(2105726320357634303)
Arindam_1729(@Arindam_1729)表示有人讓 Jev 搭配爬蟲與 GPT agent 分析 5,137 個職缺並找出 3 個賺錢利基;決策模型開始用於市場研究。
(2107189291793424710)
mubeitech(@mubeitech)介紹 Karpathy 推薦的航空業簡化技術英文 ASD-STE100,被發現能有效減少模型幻覺;以受控語言約束模型輸出成為熱門提示技巧。
(2107366544132935793)
### 💳 Codex 28 天挑戰與訂閱
Tibo(@thsottiaux)宣布 28 天挑戰第 2.1 天,對所有以 ChatGPT 帳號登入的用戶免費開放 Auto-review;OpenAI 持續以每日更新推動 Codex 體驗。
(2107368734981517634)
Darren(@dtzy_88)說明 Codex Auto-review 會配一個審核 agent 監看主 agent 每一步,只攔截高危與偏離原意的動作;長任務可減少手動核准,但仍需信任審核模型的判斷。
(2107369456825704705)
Vaibhav Srivastav(@reach_vb)表示他所有 Codex 任務預設「Approve for me」並搭配 Auto-review;OpenAI 內部人員也將自動審核作為預設工作流程。
(2107379601521672241)
lencx(@lencx_)批評 Codex 第一天提速、第二天開放 Auto-review 本可一起發布,拆成每日一條顯得刻意;28 天挑戰的行銷節奏引發部分反感。
(2107373223595921808)
ai_fengshou(@ai_fengshou)轉述 The Information 報導,Meta 內部 Claude Code 使用者從 6 萬人砍到 3 萬人,Microsoft 10 億美元 AI 預算砍掉三分之一;大企業開始以行政手段壓低 Claude 使用成本,此為轉述報導。
(2107358946055123145)
Zhoumancang(@Zhoumancang)轉述《華爾街日報》報導,近 400 家公司中僅 11% 能準確計算 AI 支出;token 計費與 agent 行為的不確定性讓企業難以控管成本。
(2107352816771531217)
jeremychone(@jeremychone)認為 Sol 6.1 很划算、價格約為 Opus 5.5 的三分之一,且擅長 Rust 程式設計;在成本敏感場景 OpenAI 仍有競爭力。
(2107160377872232557)
suyuan1711(@suyuan1711)認為個人助理 agent 場景中沒有模型比 Opus 5.5 更自然好用,Grok Bot 背後模型相形見絀;個人 agent 體驗高度取決於底層模型。
(2107356951877497161)
shipwithstef(@shipwithstef)表示朋友試用 Claude Code Auto Mode 後又改回 --dangerously-skip-permissions;權限自動化體驗不佳會讓使用者退回高風險設定。
(2107371930802118704)
### 🛠️ 開發工具與 Agent
yokatsuki(@yokatsuki)整理 Claude Code v2.1.290–2.1.291 主要更新,包括強化 Bash 權限檢查與 WebSearch 額度改為補充制;Claude Code 持續修補權限安全問題。
(2107354358631346256)
itm_aiplus(@itm_aiplus)報導 Claude Cowork 停止提供「本機執行」選項,模型推論與虛擬機全面轉向雲端;需要資料留在本地的使用者需重新評估工作流程。
(2107357746794561739)
lencx(@lencx_)介紹 Cognition 發起的 Agent Memory Repo 開放規範,以 Git 倉庫管理 agent 長期記憶並保留版本歷史;agent 記憶開始走向標準化與可審計。
(2107353001656791272)
yupi996(@yupi996)介紹開源工具 Leviathan,宣稱 agent 每查一個日誌問題只讀 436 個 token,傳統 grep 則需 10 萬以上,但中文搜尋效果待驗證;日誌檢索最佳化可大幅降低 agent 成本。
(2107364985751953633)
CY160909(@CY160909)指出把 2 萬 token 日誌交給 subagent 並不省錢,隔離保護的是主脈絡而非費用;subagent 的成本模型常被誤解。
(2107355422977867959)
miyatti(@miyatti)分享自製 Dots 技能 SKL_resume,可強制恢復中途停止的 Codex 任務;使用者開始以技能補強 orchestrator 的可靠性。
(2107364934074221052)
KinGao476942(@KinGao476942)分享 Grok Bot 上手時建議設置的 21 個 bot 分工,從總管、開發到排程;個人用戶開始組建完整的 agent 團隊。
(2107345071091941833)
nickwm(@nickwm)整理 Grok Bot 近兩週更新,包括可主動發文的 proactive bots;xAI 的 agent 產品從被動回應轉向主動執行。
(2107291948360839536)
wieslawsoltes(@wieslawsoltes)推出 VB6 Studio Web,在瀏覽器中重現經典 Visual Basic IDE 並由 coding agent 驅動;懷舊開發環境結合 AI 重生。
(2107352461568565518)
AlexStLouis10(@AlexStLouis10)指出 GTA 5 據稱已透過 AI 移植到 WebAssembly 並可在瀏覽器遊玩;此類移植可能涉及版權問題,但顯示 AI 輔助逆向與移植能力大增。
(2107340032805892276)
Tushkiz(@Tushkiz)認為給每個工程師配 coding agent 並不會自動加快交付,agent 最有幫助的任務具有明確特徵;導入 agent 需重新設計流程。
(2107360937565159563)
ashwaanthh(@ashwaanthh)認為各實驗室都在推 agent harness,但真正重要的是可讀的計畫、可除錯的追蹤與明確限制等「無聊」功能;可觀測性才是 agent 落地關鍵。
(2107357137751998749)
Unplugged_kk(@Unplugged_kk)主張能阻擋部署的 AI agent 需要 SLO,追蹤工具可用性、p95 延遲與資料新鮮度;agent 營運開始套用 SRE 方法。
(2107372832858546682)
Thomas_Live(@Thomas_Live)宣布 Microsoft Entra 攻防手冊新增 Agent Identities 章節;agent 身分已成為企業身分安全的新攻擊面。
(2107368327219651044)
samgoodwin89(@samgoodwin89)調侃「如果 npm 不修」已是死碼,新 registry 勢在必行;Effect 生態對 npm 的不滿可能演變為分叉。
(2107375568568377574)
nestframework(@nestframework)宣布推出官方 @nestjs/http-client,基於 fetch、零相依並支援重試與攔截器;NestJS 減少對第三方 HTTP 函式庫的依賴。
(2107369761499726269)
ryanflorence(@ryanflorence)認為後端已不再適合用 JavaScript 開發,因為應用不需要 SSR、SSR 頁面只需 web components;Remix 作者的觀點引發前後端技術選型討論。
(2107192928825471416)
### ☁️ 雲端、硬體與資安
TablePlus(@TablePlus)推出 VMPal,專為 Apple Silicon 與 AI agent 設計的虛擬機;為 agent 提供隔離的 macOS 執行環境。
(2107323861205491790)
### 💰 財經與時事
Meta8Mate(@Meta8Mate)整理 Binance Intelligence 三款產品,包括全員免費的 Binance AI 與可自然語言轉策略的 AI Pro;交易所積極以 AI 爭取用戶。
(2107275727154688376)
WuBlockchain(@WuBlockchain)報導 Polymarket 公布 Protocol V2,目標 11 月 2 日全面切換主網;預測市場基礎設施進行重大升級。
(2107324478887972938)
NFTCPS(@NFTCPS)指出 OKX 在 OKX Now 推出最高約 10% 年化、按週發放的 OKX Money,但不支援中國大陸用戶;高收益產品風險較高,投資前應審慎評估。
(2107367639643501009)
### 📊 統計
> 共收集 341 條推文,篩選出 301 條候選,精選 57 條摘要(均為本輪新內容,未沿用上一輪)。
### 📝 總結
> 本時段主軸是 OpenAI 28 天挑戰進入第二天:Codex Auto-review 對所有 ChatGPT 帳號免費開放,以審核 agent 監看主 agent 的高危操作,但社群批評更新拆分過細且 Claude Code 早有類似功能。企業端出現成本收緊訊號,報導指 Meta 內部 Claude Code 使用者減半、Microsoft 削減 AI 預算,《華爾街日報》也指出僅 11% 企業能算準 AI 支出。模型方面,Gemini 4 Argon 登上 Text Arena 寫作第一,月之暗面估值 500 億美元籌備港股上市,GLM-5.3 在雙 DGX Station 上並發達 5,018 tok/s。工具與安全層面,Agent Memory Repo 規範以 Git 管理記憶、Microsoft Entra 攻防手冊納入 agent 身分,顯示 agent 治理正從概念走向具體標準。
🌙 Night
Copied!