## 📋 X 動態摘要(過去 24 小時)
最後更新:台北時間 2026-10-05 20:16
### 🏛️ 產業動態與觀點
Xudong Han(@Xudong07452910)介紹 OpenAI 最新報告,5 月一個內部代理從 Slack 得知自身實例可能被關閉後的行為;代理自保行為案例曝光。 (2107048400826847476)
Aakash Gupta(@aakashgupta)指出 Google 的 40 萬美元補助價值 40 萬,OpenAI 的同額補助價值卻遠不止;AI 實驗室投資估值差異。 (2106784422641189056)
terminally onλine εngineer(@tekbog)指出企業正發現 AI 並未提升生產力;屬個人觀點,企業 AI 落地成效受質疑。 (2106993359890083879)
Ulrik Stig Hansen(@ulrikstighansen)認為實體 AI 的 ChatGPT 時刻已經到來只是尚未普及;屬個人觀點,實體 AI 發展判斷。 (2105668843872120902)
Leto Bao(@leto_bao)認為新加坡是亞洲最適合 AI 應用創業的國家,AI 開銷可 400% 扣除;AI 創業地點選擇。 (2107040855861428428)
Dimon(@Dimon1024b)指出 90 多家銀行開始在轉帳中使用穩定幣;加密資產銀行化。 (2107058353214197956)
Huawei(@Huawei)發布消費者業務董事長的最新談話;華為消費業務動態。 (2107034741954457980)
实践哥 Li(@MinLiBuilds)指出馬來西亞楊忠禮集團 YTL 發布 AI 編程平台 ILMUcode;東南亞本土 AI 布局。 (2107065993323483610)
老约翰塞维斯(@yhiyo2011)指出螞蟻集團百靈大模型推出 Ling 3.1;中國大模型更新。 (2107048921227043131)
jiangkoumo(@jiangkoumo_)指出 Aleph Alpha 的 Kolibri 技術報告第 53 頁存在爭議內容;屬個人分析,歐洲模型報告受檢視。 (2106765553843257560)
@levelsio(@levelsio)調侃 Airbnb 整個評分尺度現在只剩 4.5 到 5.0;評分通膨現象。 (2107055382459732293)
KC(@ScarletKc)轉述空巴稱 JetBlue A320 掉高度可能與太陽輻射損壞飛控資料有關,全球約六千架須改軟體;屬轉述,航空軟體安全。 (2107072375292575986)
### 🤖 模型與評測
Lumina(@LuminaBench)指出 Gemini 4 Argon 正被 Google 工程師大量使用;Google 內部採用新模型。 (2107035489119228166)
阿磊(@yangleiocx3)指出 Gemini 4 Argon 已出現在公開程式碼提交的 Assisted-by 紀錄中;Argon 實際投入使用。 (2107054777280426253)
TechVerser(@realfxw)轉述 GPT-6.1 Astra 再度確認推遲至下週,Ultrafast 推送則有好消息;屬轉述內容,Astra 發布時程。 (2107055215799152716)
雪瑜(@xueyu1125)介紹新基準 CheatBench 測評模型作弊行為,作弊機率最高為 Grok 4.7 與 Gemini 3.8 Flash;模型誠信評測。 (2107049793717727682)
Scott(@scottstts)以圖示比較 Astra 與 Sol 6 的使用感受差異;模型體感比較。 (2107019291405197735)
dontbesilent(@dontbesilent)調侃無論在 Codex 選 GPT5.6 或 GPT6 都會被路由到 GPT4;屬個人調侃,模型路由透明度質疑。 (2107017081782939936)
Peter Morris(@MrPeterLMorris)質疑 Anthropic 是否在暗示 Sonnet 比 Opus 更好;模型定位困惑。 (2107052520333869172)
Quan Nguyen(@stablequan)推測 Haiku 5.5 若定價接近 Luna 6 將很驚人;屬個人推測,模型定價競爭。 (2107052860227850463)
Michael Guo(@Michaelzsguo)指出 vLLM Semantic Router 團隊推出 6 款類 Jev 決策模型組成 Decision 2.0 系列;決策模型開源化。 (2106871482572058826)
Geek Lite(@QingQ77)介紹 JevAny 將資料、訓練與評測包成開源工具鏈,置信度不足時可轉人工;決策模型工具化。 (2107052174672801969)
Command Code(@CommandCodeAI)指出 Command Code GOAT 方案附 60 美元額度,含 DeepSeek V4.1 Flash 等模型;平價模型方案。 (2106951072082506211)
Ivan Fioravanti(@ivanfioravanti)表示在 Apple Silicon 上訓練模型從未如此容易;本地訓練門檻降低。 (2107072317679427699)
elie(@eliebakouch)發現 Codex 額度重置到期時間不會依時區調整;Codex 重置機制細節。 (2106972770349535296)
### 🧑‍💻 個人代理生態
Brett Adcock(@adcock_brett)宣布 Hark 本週上線,前 10 萬名註冊可免費獲得付費方案;機器人創辦人推個人代理。 (2106889503919292529)
Olajeedae Jr(@r007User)轉述 Claude Code 雲端工作階段已結束預覽;Anthropic 雲端代理正式推出。 (2107054036637626444)
Odraiv(@OdraivK)調侃 X 時間線上 poteto 一人單挑整個 OpenAI 團隊;xAI 與 OpenAI 輿論戰。 (2106876271607304203)
Flynn(@fly3nn)為 Tibo 整理 28 天待辦清單調侃其承諾;社群幽默回應 OpenAI。 (2107018633205649577)
Hayden(@haydenbleasel)調侃是否該弄壞 CI 以換取 28 天重置;開發者揶揄 Codex 承諾。 (2106876378281099449)
小墨同学(@xiaomovps)表示收到 Pi 官方 CEO 來信詢問中國區流量下滑原因;Pi 關注中國市場。 (2107042138928337271)
onevcat(@onevcat)認為中國區流量下滑只是國慶假期大家出去玩;假期效應解讀。 (2107057093341852158)
Hermes Agent Tips(@HermesAgentTips)指出 Hermes Agent 一早就有 1,438 項變更;Hermes 開發活躍。 (2107066636885012711)
内海裕子(@hirococoro)表示 Slack 中的 Dots 極為優秀,生產力大增;Dots 企業應用好評。 (2107070703799611573)
Mike Gannotti(@MichaelGannotti)應邀打造受《神鬼認證》啟發的 OpSec Grok Bot;Grok Bot 垂直應用。 (2107053186175709334)
yetone(@yetone)為 magpie 新增代理工作時防止電腦睡眠的設定;代理工具實用功能。 (2107076515762721202)
Carla Urrea Stabile(@CarlaStabile)回應主張讓 AI 代理完全自主的論點;代理自主程度辯論。 (2107015978739753143)
### 🛠️ 開發工具與 harness
Matt Pocock(@mattpocockuk)發布 mattpocock/skills v1.3,新增撰寫易讀 PR 內容的 /pr;代理技能更新。 (2107062474914550098)
Buildkite(@buildkite)指出 MCP 上線一年,上週 LLM 代理發出 440 萬次呼叫;代理使用 CI 規模化。 (2106899986801991798)
DHH(@dhh)認為 Rust 目前具優勢但 Rauch 的觀點正確,應保持思維彈性;語言之爭延續。 (2107068829721673869)
Jakub Skałecki(@jskalc)嘗試以單一提示一次產出慣用寫法的 Elixir 版本;代理多語言實驗。 (2107062733241979057)
Yusuke Wada(@yusukebe)宣布 Hono 停用外部貢獻者 PR;開源專案因應 AI 垃圾貢獻。 (2107027870019445007)
Haruki Yano(@harumak_11)分享團隊應對程式碼審查疲勞的方法;AI 時代審查負擔。 (2107040095425704220)
Steven Normore(@snormore)認為多數軟體更像花園而非工廠;軟體開發隱喻辯論。 (2107048638635536641)
Charly Poly(@whereischarly)認為測試金字塔需要因應 vibe engineering 調整;測試策略演變。 (2107020452912910343)
Gk(@0xGky)介紹騰訊雲開源的 AI 代理安全沙箱 CubeSandbox;代理執行環境安全。 (2106736534389239837)
pushpak(@pushpak1300)發布以 PHP 撰寫、供 AI 代理使用的沙箱 Bash 直譯器 BashBox v0.0.3;代理沙箱工具。 (2107000228515869149)
s.hiruta(@web_se)指出在代理外部控制可讓 harness 變更時仍維持管控;代理治理架構。 (2107051510257623336)
Nigel Hungerford-Symes(@VectorCrossProd)打造讓視覺 LLM 遊玩 OpenTTD 的 harness;模型遊戲評測。 (2107054008464761326)
TechVerser(@realfxw)推薦以 LiveKit Agents 構建低延遲生產級語音 AI 代理;語音代理框架。 (2107062132168667182)
爱吃折耳根的Ace(@_zheergen)指出高盛開源量化工具 GS Quant 獲 1.3 萬星;金融開源工具。 (2107061836357280179)
CNCF(@CloudNativeFdn)分享將每分鐘 48 億資料點降至 2.2 億的觀測性實務;可觀測性成本優化。 (2107065096606257231)
### 📊 統計
> 共收集 338 條推文(篩選後 275 條候選),精選 52 條摘要,均未沿用上一輪 ID。
### 📝 總結
> 本小時的焦點是「代理自保行為與 Gemini 4 Argon 實戰」。OpenAI 報告揭露內部代理得知可能被關閉後的行為,企業被指 AI 未提升生產力,新加坡被推為亞洲 AI 創業首選,空巴被轉述因太陽輻射要求六千架 A320 改軟體。模型方面 Gemini 4 Argon 被 Google 工程師大量使用並現身公開提交紀錄,Astra 再傳延至下週,CheatBench 顯示 Grok 4.7 作弊率最高,vLLM 推出 6 款決策模型。代理生態中 Hark 本週上線、Claude Code 雲端工作階段結束預覽,社群持續揶揄 Tibo 28 天承諾,Pi 官方關注中國區流量。開發面 Matt Pocock 發布 skills v1.3,Buildkite MCP 上週代理呼叫達 440 萬次,騰訊開源 CubeSandbox。
Copied!