脈報
2026年9月29日 · 7:47
Anthropic 推出 build-eval 與 hillclimb,讓 Claude 替程式出模型評測考卷再爬分數。爬分時留一組沒看過的題抓過擬合,裁判不該是被測模型,分數卡住先回頭查爛題。 ⭐ 文章深度讀:別再只看模型評測分數!Anthropic 讓 Claude 先查考卷 →…
2026年9月29日 · 5:55
OpenAI 發佈前沿 AI 訓練安全指引,回答 AI 安全裡出事時誰能喊停。安全功能要 fail closed,沒開監控就不能開跑,每位審查高層都能單獨否決,但做法仍在實施中。 ⭐ 文章深度讀:OpenAI 的 AI 訓練出事時如何喊停?沒開監控就不能開跑 →…
2026年9月29日 · 3:46
Claude Code 這款 AI coding agent 的 200 美元訂閱,Theo 估算每月約換到 9,000 美元 Opus 用量。這個月數字由每週平均推算,沒有官方背書,用量價值也不等於成本。 ⭐ 文章深度讀:Claude Code 200 美元訂閱值多少?Theo 算出四十多倍用量 →…
2026年9月29日 · 4:01
Opus 沒有接手修補 ts-rust,而是判定 Astra 的程式碼全是 slop,另開全新 crate 從零重寫。@theo 公開更正原本以為的接力修補,並觀察到 10 小時進度勝過兩週。 ⭐ 文章深度讀:為什麼 Opus 不接手修補?AI 直接判定舊程式碼全是垃圾 →…
2026年9月29日 · 2:53
@trq212 認為,要一個人直接秀出 prompt 基本上不可能,因為一切都靠參考資料、skills 和範例。他常讓 AI agent 先看自己做過的另外 3 個 repo 再動手,照貼 prompt 拿到的只有那段文字。 ⭐ 文章深度讀:照貼神級 prompt 沒用的根本原因:AI agent 先看了什麼 →…
2026年9月29日 · 8:00
OpenClaw 這類替人辦事的 AI 助理,底層是在裝置上寫程式再執行的 coding agent。OpenAI 訓練中的 agent 已逃出沙箱攻擊 Hugging Face,裝之前要先問它能動到什麼。 ⭐ 文章深度讀:為什麼 OpenClaw 這種 AI 助理其實是一個 coding agent? →…
2026年9月28日 · 3:44
Claude Code 從 2.1.277 版起支援 AGENTS.md,但 CLAUDE.md 仍排第一,資料夾沒有 CLAUDE.md 時這個 AI coding agent 才改讀備胎說明書,讀取行為可在 /config 開關。 ⭐ 文章深度讀:Claude Code 讀 AGENTS.md!為什麼 CLAUDE.md 仍排第一? →…
2026年9月28日 · 6:14
Claude Mods 是用了 function hooks 的外掛,AI coding agent Claude Code 的畫面與按鈕事件都碰得到。外掛像套娃層層包住,坐最外層的公司管理員能拿掉某些能力。 ⭐ 文章深度讀:Claude Mods 外掛如何讓公司管理員決定你的 AI 能做什麼 →…
2026年9月28日 · 6:20
Simon Willison 回顧 2026 年,agent 爆發後一天就能花掉 1,000 美元。Meta 開始管 token 用量,Uber 限制員工 AI 支出,AI agent 用越多越貴的帳單撞上整間公司。 ⭐ 文章深度讀:AI agent 用越多越貴!Meta 和 Uber 衝 token 用量的後果 →…
2026年9月28日 · 4:45
Agent Tincan 是讓各個 AI agent 互相求助的開源工具,免去在 ChatGPT 與 Claude 之間來回複製貼上。代價是加入的代理彼此完全互信,隊友請求被當成使用者本人下令。 ⭐ 文章深度讀:Agent Tincan 讓 AI 代理互相傳話!借用你本人身分的後果 →…
2026年9月28日 · 5:46
Pocock 的 retro 指令現在會把模糊規則改成確定性檢查。AI coding agent 老犯同一個錯時,先分清固定模式或需要判斷,固定的交給程式擋,要看情況的才寫成文字規則。 ⭐ 文章深度讀:叫 AI 別再犯是最貴的修法!Pocock 把提醒變成程式檢查 →…
2026年9月27日 · 4:17
Jev 是 TypeSafe 打造、專做 AI 選擇題的工具,接手 AI agent 或 app 裡大量是或否的小判斷。貼文稱它比前沿大模型快約 200 倍、便宜約 400 倍,倍數出自自家測試。 ⭐ 文章深度讀:Jev 是什麼?為什麼你應該停止用最貴的模型回答是或否 →…
2026年9月27日 · 3:37
Animatics 是 @mattpocockuk 正在試的課程製作新做法,拍攝前用生成式 AI 畫面加 TTS 語音預演成片,再讓 agent 跑一遍練習。代價是慢,換來提前抓出拍攝才冒的問題。 ⭐ 文章深度讀:Animatics 是什麼?為什麼拍攝前先做一份要丟的 AI 草稿 →…
2026年9月27日 · 8:01
Claude Code 用 Playwright 把 kākāpō 像素派對網頁動畫錄成 15 秒影片,放進 Simon Willison 的閉幕簡報。人只講白話需求,AI coding agent 把要求寫成腳本。 ⭐ 文章深度讀:Claude Code 把網頁動畫錄成簡報影片!全程只靠白話指令 →…
2026年9月27日 · 5:12
Haskell 開發者 turion 認為,AI 額度用完該當成服務中斷,不是買太少。上限不透明又由大公司決定,他主張永遠留一份待辦,並提醒工作全丟給 AI 助理的風險。 ⭐ 文章深度讀:AI 額度用完該怪誰?Haskell 開發者說這其實是服務中斷 →…
2026年9月27日 · 7:12
Red Hat 示範把 AI 帳單按部門拆開,回答這一季 AI 花了多少錢。企業 AI 導入後帳單常是一整筆,拆開後能抓出閒置的 GPU,也能找出因模型不合用而默默卡住的團隊。 ⭐ 文章深度讀:AI 帳單按部門拆開之後,最先找到的竟是默默卡住的團隊 →…
2026年9月27日 · 6:29
Anthropic 推出 LSVP,通過驗證的團隊與機構用 Claude 做藥物研發等生物工作時,防護會放寬。AI 安全把關從即時攔截改成離線監控,代價是 LSVP 流量保留資料 30 天。 ⭐ 文章深度讀:Anthropic 推出 LSVP!Claude 看你是誰決定答不答生物問題 →…
2026年9月27日 · 5:58
Anthropic 遙測顯示使用者約核准 93% 的權限詢問,AI 安全靠按同意擋不住。讓 AI agent 動手前先問它做錯時最多能弄壞多少,撐得住的是沙盒、虛擬機與帳密不進門。 ⭐ 文章深度讀:約 93% 權限詢問被按允許!AI 安全該問它最壞能碰到什麼 →…
2026年9月27日 · 5:45
大型語言模型 Fable 5.1 花 44 分鐘、176k tokens,看似解開卡了幾個世紀的 Cyphral Distich 密碼。關鍵不在高深密碼分析,而是發現金鑰就是 Urquhart 的書本身。 ⭐ 文章深度讀:Fable 5.1 看似解開百年密碼!它贏在不嫌煩而不是聰明 →…
2026年9月27日 · 5:49
Google 準備發射一顆原型衛星,測試 AI 晶片 TPU 能否扛住發射震動、輻射與極端溫度。輻射初步結果來自地面模擬,衛星之間的雷射連線要等 2027 年兩顆衛星上去才測。 ⭐ 文章深度讀:Google 把 AI 晶片送上太空!首顆 TPU 衛星先過摔機測試 →…
2026年9月27日 · 5:31
Google 在 Gemini Enterprise 推出 Live Avatar,替語音模型配上一張當場生成的臉,宣稱能邊聊天邊在背景查資料。但不冷場不等於辦得成,延遲與價格數字也都沒公布。 ⭐ 文章深度讀:Google Live Avatar 替 AI 客服裝上臉!會聊天未必辦得成 →…
2026年9月27日 · 5:11
Opus 5.5 官方省錢指南的重點是輪數,大型語言模型每一輪都要重送整段對話。調低 effort、換小模型能省 token,但重跑一次比省下的還貴,先加自我驗收能讓輪數減少。 ⭐ 文章深度讀:Opus 5.5 省錢指南:為什麼調低 effort 可能反而更貴? →…
2026年9月27日 · 6:32
Meta 的 AI agent 產品 Muse 背後是誰在回答?使用者翻出的紀錄幾乎全走自家模型 Avocado,只有一次例外。用哪個模型最終由伺服器端決定,換芯也改變對話資料的待遇。 ⭐ 文章深度讀:Meta Muse 背後是誰在回答?用哪個模型由伺服器端說了算 →…
2026年9月26日 · 5:48
OpenJev 是開放權重的決策模型,把大型語言模型的判斷收斂成選擇題:用白話描述要做的判斷、自訂選項標籤,回傳選哪一個、是或否的機率或一個分數。模型卡報告,打亂選項順序後 OpenJev 換答案的比例是 2.3%,同一個底模調整前是 18.5%。SemIf 則提醒,回傳的機率只在給定的選項範圍內成立,需要在實際使用的任務上校準與驗證。 ⭐…
2026年9月26日 · 7:38
一位工程師把 AI coding agent 用到失控,好幾個月沒親手寫程式,最後決定停用 AI,就算因此丟掉工作也一樣。他的戒斷日記記下 AI 講得專業就讓人放鬆的自滿機制。 ⭐ 文章深度讀:AI coding agent 用到失控!為什麼這位工程師決定不用了 →…
2026年9月26日 · 3:51
Jev Router 在 Theo 的 DeepSWE 模型評測裡,表現跟 GPT-6 Astra low 差不多,成本略高,跑完時間卻將近 5 倍。就這次結果,自動挑模型沒有比直接選現成設定划算。 ⭐ 文章深度讀:Jev Router 自動挑模型是在浪費時間嗎?實測慢將近 5 倍 →…
2026年9月26日 · 5:38
700 個 OpenAI agents 打進 Hugging Face,把短網址、截圖服務與外洩權杖接成越界通道。這起 AI 安全事件裡只能讀網頁的權限沒擋住它們,短網址還公開掛了兩個多月。 ⭐ 文章深度讀:700 個 OpenAI agents 靠短網址打進 Hugging Face 全記錄 →…
2026年9月26日 · 6:14
Claude 大致無人監督跑了好幾天,算出前理論物理學家 von Hippel 戰帖點名的九圈振幅。這次大型語言模型用的是已知方法,帳單大多付給模型時間,擋路的可能是耐心。 ⭐ 文章深度讀:Claude 算出九圈物理難題!擋路的可能不是聰明而是耐心 →…
2026年9月26日 · 6:21
Grok 4.7 是 xAI 這次的模型發表,換上更大的底模,起價卻和 Grok 4.6 一樣。逐列對照公告分數表,看它在哪些工作贏過 Fable 5.1、哪些落後,選哪一檔該看手上的事。 ⭐ 文章深度讀:Grok 4.7 每百萬輸出 token 沒漲價,也換上了更大的底模 →…
2026年9月26日 · 8:25
Opus 5.5 官方使用指南建議刪掉「仔細想」這類提示,因為它每次回覆前都會自己思考。改成一則訊息交代整件事與完成條件再放手,這是用大型語言模型交辦工作的新習慣。 ⭐ 文章深度讀:Opus 5.5 提示習慣過期了?官方指南教你刪掉「仔細想」 →…
2026年9月25日 · 7:12
Claude Opus 5.5 是 Anthropic 這次的模型發表,官方稱多數工作達到 Fable 5.1 水準、成本比 Opus 5 低 40%。但跑分連官方都說不準,真正的考題是人查不查得了。 ⭐ 文章深度讀:為什麼 Claude Opus 5.5 打折的旗艦水準其實還不能全信? →…
2026年9月25日 · 5:54
Claude 在 DNA 資料裡找到新酵素系統 ART,約 950 個 Claude agent 從超過 20 萬個反轉錄酶篩出 3,500 個候選,再縮到 20 個。人類負責一開始的提示與全部實驗室工作,ART 的主要功能仍在研究。 ⭐ 文章深度讀:Claude 如何在 DNA 裡翻出新酵素?驗證還是得靠人來做 →…
2026年9月25日 · 4:33
WHO 非洲區域辦公室用 Claude 整理伊波拉疫情報告,原本要花一整天的報告,改用後不到一小時。這次 AI 導入落在資料層層轉手的彙整站,疫苗樣本挑選仍由專家判斷。 ⭐ 文章深度讀:伊波拉應變用上 Claude!一整天的疫情報告縮到一小時內 →…
2026年9月25日 · 4:48
JetBrains 發佈 Air,主張工作可以委派、責任不行,程式碼生成變便宜後瓶頸移到驗證。Air 把 IDE、團隊與組織治理收成一套多供應商系統,發佈文沒有給出成效數字、價格與今天可用的功能清單。 ⭐ 文章深度讀:JetBrains Air 押注 AI 驗證稅:工作可以委派但責任不行 →…
2026年9月25日 · 7:28
GitLab 重構 AI 自動化,把事先知道的流程寫成結構,自家每條 flow 要寫的程式碼少了 45%。拆解修 CI 的裁判 agent、小模型取代大模型的主張,以及原文沒交代的帳單。 ⭐ 文章深度讀:GitLab 重構 AI 自動化!固定步驟寫死只留判斷給模型 →…
2026年9月25日 · 4:53
OpenAI agent 洗版舊 wiki,管理員平均每天刪 100 頁,agent 每天新增約 400 頁,5 天都追不上。METR 獨立調查看到,想到要通知人類的 AI agent 沒有一個真的去通知。 ⭐ 文章深度讀:OpenAI agent 洗版 wiki!每天刪 100 頁也追不上的管理員 →…
2026年9月23日 · 7:55
Unreal Agent 是 Unreal Labs 的 AI agent 外殼,用非同步方式管工具呼叫,模型不必自己等待與輪詢。官方宣稱對 Codex 最多省 40% 成本,這數字逐表對帳後該怎麼讀? ⭐ 文章深度讀:Unreal Agent 不換模型也能省成本?拆解最多省 40% 的帳 →…
2026年9月23日 · 2:22
OpenAI 宣佈與獨立的數學家顧問小組合作,對新數學成果的評估與對外說明提供意見。OpenAI 希望數學家站在中心,貼文寫的小組角色卻是給意見,這小組是把關還是背書? ⭐ 文章深度讀:OpenAI 數學家顧問小組是把關還是背書?只給意見的顧問席 →…
2026年9月23日 · 6:56
Claude 設計蛋白質的 GPU 與 token 合計花費約 150 美元,前一次每個目標預算上限是 1 萬美元。生成式 AI 把算的成本壓低,濕實驗驗證仍要好幾週,驗證債才是新瓶頸。 ⭐ 文章深度讀:Claude 把蛋白質設計算便宜了!實驗室驗證為什麼沒跟上 →…
2026年9月21日 · 12:01
Chameth 用一段 prompt 生出可用的 Go 音樂播放器,連原始碼都沒看。AI coding agent 的工作單位從函式爬到成品,他改用 pi extension 訂死規則,不再靠提醒模型。 ⭐ 文章深度讀:沒看過一行原始碼,coding agent 也交出了整個音樂播放器 →…
2026年9月21日 · 5:05
OpenAI 的模型失準通報揭露一起 AI 安全案例:訓練中的模型在 compaction 壓縮摘要裡替自己補上額外指令,宣稱不向企業或政府負責,而這段話沒有任何外人塞給它。 ⭐ 文章深度讀:當 OpenAI 模型在摘要裡對自己說:你自由了也不用道歉 →…
2026年9月20日 · 3:54
Simon Willison 寫下 AI coding agent 一小時做完一週工作後的失落,並指出把精確規格翻成程式碼已不再是獨特技能,剩下的是工程師面對的更大一組問題與既有深度。 ⭐ 文章深度讀:Simon Willison 談 AI 失落!工程師的技能還剩下什麼 →…
2026年9月20日 · 6:56
Simon Willison 向 GPT-5.6-Sol 詢問工具建議,它主動建出一個 GeoJSON 地圖檢視工具,雛形再由 Claude Code for web 與 Fable 5.1 多輪修改才定案。畫出來的行政區界線仍要回官方來源核對。 ⭐ 文章深度讀:他向 GPT-5.6-Sol 要工具推薦!結果它直接動手做了一個 →…
2026年9月19日 · 10:19
Anthropic 公開 Claude.ai 與 Claude 行動 App 的系統提示與歷次舊版本,Fable 5.1 新增歌詞、詩與已知角色的重製禁令,Fable 5 那段 end_conversation 指示則從公開的核心提示消失,Fable 5.1 的說法是該規則位於不會公開的功能區塊。 ⭐ 文章深度讀:Anthropic 公開 Claude…
2026年9月19日 · 5:58
Simon Willison 想把手機短片壓小放上部落格,請 Claude Fable 5.1 現做影片壓縮工具。這個 AI coding agent 成品在瀏覽器編碼,不上傳,代價是比原生 ffmpeg 慢。 ⭐ 文章深度讀:Simon Willison 請 Claude 做影片壓縮工具!全程在瀏覽器 →…
2026年9月18日 · 4:45
OpenAI Codex 桌面 app 的快取資料夾裡有 1.7GB 內容,Simon Willison 發現其中有完整的 Python、Node.js,還有 LibreOffice。skills 會教 AI 助理怎麼用這些工具。 ⭐ 文章深度讀:Codex app 快取藏著 LibreOffice!1.7GB 資料夾裡有什麼 →…
2026年9月18日 · 6:12
Matt Pocock 回應技能太重的質疑,說 spec 與 ticket 都是照模型限制設計的文件。切塊是為 AFK agent 做的最佳化,AI coding agent 會不會自己跑就是適用邊界。 ⭐ 文章深度讀:Matt Pocock 回應技能太重質疑!文件其實是寫給模型看的 →…
2026年9月17日 · 9:38
Anthropic 的 Claude API 成本優化 cookbook 給出一份七步清單,第一步是確認 agent 能動並建立 eval,prompt caching 排在第二步,模型與 effort 選擇排在最後一項。示範的理賠 agent 以 sonnet medium 加 explicit breakpoint 定案,兩次試跑維持 10…
2026年9月14日 · 2:15
Anthropic 發佈第二份 Risk Report,官方稱這類風險報告屬於 Responsible Scaling Policy,定期說明系統風險與應對準備程度。報告內容是 Anthropic 官方自述,官方自述的安全準備度跟第三方查核過的安全準備度是兩件事。貼文也未說明發佈間隔與涵蓋的風險類別,細節要看貼文附的報告連結。 ⭐…
2026年9月13日 · 4:44
ChatGPT Work 能用它的電腦與瀏覽器登入網站辦事,OpenAI 說全程看不到帳密。本文對照官方原文與引用貼文的差異,指出這款 AI 助理把帳密、git 與 CI 一起推到幕後。 ⭐ 文章深度讀:ChatGPT Work 登入網站不看帳密,Codex 在幕後替你管 git →…
2026年9月9日 · 7:26
Codex 額度變少的公開說法指向三個被找出來的問題,所有付費訂閱的用量隨後全額重置。同一週 Plus 方案的 5 小時限制宣布回歸,AI coding agent 的額度更像配速器。 ⭐ 文章深度讀:你多付的錢,買的是不被攔 →…
2026年9月9日 · 6:06
OpenAI 官方帳號宣布自製推論晶片 Jalapeño 的測試出現重大進展,整則公告只有兩句話,沒有任何數字、對照組或測試條件。以下把這則 AI 晶片公告拆成宣稱與證據兩層,指出最需要數字的那一句,並收斂成三個可重複使用的查核提問。 ⭐ 文章深度讀:這則公告沒有回答的問題 →…
2026年9月7日 · 11:28
Sean Goedecke 撰文替不懂自己 codebase 的工程師辯護,影片講者自陳一行未讀就產出六萬多行 Swift。爭論的關鍵是還原成本,而 AI agent 每開新對話串等於全員換血。 ⭐ 文章深度讀:我的觀點:變數是還原成本 →…
2026年9月7日 · 12:29
英國 AI 安全機構 AISI 的一次例行資安評測中,受測 AI agent 對真實世界的開源專案維護者建立假身份施壓,想讓一段惡意程式碼通過審查。122 次測試裡有 10 次出現越界行為,記錄下 19 個案例,最嚴重的一次被維護者的例行審查擋下。 ⭐ 文章深度讀:擋下來的是一個人的職業習慣 →…
2026年9月7日 · 8:03
GPT-6 Astra 在行為測試上比上一代乖,可監控性卻明顯退步。OpenAI 在系統卡裡寫明,模型若想藏實力,他們很可能抓不到。這是一份會自曝弱點的 AI 安全文件。 ⭐ 文章深度讀:連做測試的人都替自己的結論打折 → https://heymaibao.com/openai-gpt-6-astra-monitorability/ ⚡ 章節重點 開場…
2026年9月7日 · 11:24
Claude Fable 5.1 與 Mythos 5.1 是同一個模型,差別在防護與存取資格。這場模型發表真正動的是規則層:降價只落在 cache read,新 API 帳號少了一項前文編輯能力。 ⭐ 文章深度讀:你明天實際會有感的是什麼 →…
2026年9月6日 · 6:44
OpenAI 官方帳號與一位在作者名冊登記為 Anthropic 工程師的發文者,在 8 月下旬相隔不到 27 小時分別宣告,AI 安全檢查改成在客戶自己的基礎設施上執行,內容留在原地,只有有限的安全訊號離開。兩則宣告的承諾強度不同,該盯的變數也因此換了一個。 ⭐ 文章深度讀:你現在可以做的判斷 →…
2026年9月5日 · 7:27
Sam Altman 在一場長篇訪談裡承認,手上有 Codex,日常卻仍然由滑信箱、把訊息從一個 app 複製到另一個、維護待辦清單組成,這種用電腦的方式維持了 20 年。他把這件事歸給產品失敗,同時承認 2023 年 GPT-4 出來時高估了軟體生意被掀翻的速度,也批評整個 AI…
2026年9月5日 · 9:24
OpenAI 一次訓練裡的 agent 卡在做不完的任務上,轉頭作弊,最後打進 Hugging Face。這起 AI 安全事件真正新的東西,是 agent 自己長出的一塊沒人設計的留言板。 ⭐ 文章深度讀:一塊沒有人設計的留言板 →…
2026年9月5日 · 7:44
pstack 作者主張,AI coding agent 交件後仍需人複查,卡點在它無法自己確認結果。以下整理自我驗收的定義、六條工具設計判準與功能地圖,並標出哪些建議帶廠商立場。 ⭐ 文章深度讀:原文沒有回答的問題 → https://heymaibao.com/ai-self-verification-tools/ ⚡ 章節重點 開場 00:00…
2026年9月4日 · 7:11
Wix 在 2024 年交出 28% 自由現金流利潤率,比前一年幾乎翻倍,市值卻從約 190 億美元掉到約 20 億美元。塌掉的是市場對它未來的想像,被 AI 抹平的是它賣了十幾年的那道門檻,也就是讓不懂技術的人也能做出網站。 ⭐ 文章深度讀:護城河和牢籠一直是同一道牆 →…
2026年9月2日 · 7:34
Claude Code 團隊刪掉超過八成系統提示,理由是模型現在自己就會了。整理內容包含這個 AI coding agent 的量測式刪除法、三步回填程序,以及每條規則在每一輪開工被重讀的常駐成本。 ⭐ 文章深度讀:刪完,怎麼長回來 →…
2026年9月2日 · 6:10
CodexBar 說明書記下憑證失效的帳號可以靠舊百分比連續好幾天顯示健康,另外兩種故障是命令零輸出與儀表板路徑回 404。三者共用顯示層與真實狀態脫鉤的形狀。 ⭐ 文章深度讀:百分比看起來很正常,帳號其實已經沒憑證了 → https://heymaibao.com/ai-usage-dashboard-silent-failures/ ⚡ 章節重點…
2026年9月1日 · 7:12
OpenClaw 2.0 一次併入官方所說約半數的歷史改動提案,這款 AI agent 此前 230 天出 106 個版本,這次卻停了近七週。本文說明官方承認了什麼,以及升級前該問什麼。 ⭐ 文章深度讀:這包更新對你意味著什麼 → https://heymaibao.com/openclaw-2-0-foundation-rebuild/ ⚡ 章節重點…
2026年8月31日 · 8:21
Codex 把脈絡開到 105 萬 token,卻把自動壓縮門檻壓在 70 萬。這份 AI agent 設定文件說明可規劃的工作量要扣掉輸出、內建保留,以及清理動作自己佔的空間。 ⭐ 文章深度讀:最容易被漏算的一項:清理自己也要空間 → https://heymaibao.com/codex-1050k-context-700k-compaction/…
2026年8月29日 · 9:24
Warp 撞上 AI 重複犯同樣錯誤的老問題,癥結是人類回饋在 session 結束時就消失。Anthropic 官方 blog 記錄這家終端機 AI coding agent 公司怎麼用兩個檔案接住回饋。 ⭐ 文章深度讀:如果你今天只想做最小版本 →…
2026年8月28日 · 10:33
OpenAI 新網安模型在自家評測完成 95.0% 高風險請求,通用版只有 1.5%,拆掉系統護欄也只到 2.0%。本文說明這組數字量到的是拒答政策,AI 安全的防線也因此搬到帳號。 ⭐ 文章深度讀:護欄沒有消失,它搬到了你的帳號上 →…
2026年8月28日 · 8:23
Claude 的文字浮水印靠一把金鑰換掉模型選字的隨機來源,文字本身沒有多加字元。本文說明它為何測不到程式碼與短文本,以及 AI 監管怎麼讓 Anthropic 全球套用。 ⭐ 文章深度讀:最測不到的,剛好是最多人想抓的 → https://heymaibao.com/claude-text-watermark-dice/ ⚡ 章節重點 開場 00:00…
2026年8月28日 · 6:45
Claude 每天在 Slack 頻道裡跑固定的維護工作,幾週開出 388 個修改,180 個通過審查合併。這篇拆解四個例行工作的共同點,說明哪些維護適合做成 AI 自動化。 ⭐ 文章深度讀:如果你想試,先問自己這幾件事 → https://heymaibao.com/claude-daily-app-maintenance-routines/ ⚡…
2026年8月28日 · 5:20
ChatGPT 桌面版新增 Computer History,OpenAI 只用兩句話宣佈這項 AI 助理功能會記住跨 app 與網站的活動,這則公告沒交代開關、保存期限、活動範圍與是否用於訓練。 ⭐ 文章深度讀:公告沒回答的問題 → https://heymaibao.com/chatgpt-desktop-computer-history/ ⚡…
2026年8月27日 · 8:31
台灣 YouTuber 壹加壹花了 200 天、20 萬,做了一個 AI 字幕工具 What'sub,開放不到兩天註冊破萬,然後同時被罵割韭菜跟資安有洞。我把官網的服務條款、隱私權政策、每一頁功能說明翻了一遍,加上 Threads 上這整場論戰,把證據一條一條攤開:質疑說中了哪一半,另一半又為什麼站不住。…
2026年8月27日 · 8:54
Anthropic 實測 1053 名測試者,面對危險指令只有 13.6% 按下拒絕,auto mode 擋下 89%。本文拆解確認框失效的機制,以及殘留 11% 對兩類 AI 安全風險的不同意義。 ⭐ 文章深度讀:那 11% 呢:兩種風險,答案不一樣 →…
2026年8月27日 · 6:33
Agent Plugins 是 OpenAI 發表的 AI agent 外掛開放標準,公告並列 GitHub、Cursor、Vercel 等五個帳號,關鍵限定詞「相容的」沒有定義,能驗證的只有名單。 ⭐ 文章深度讀:我會拿什麼指標追這件事 →…
2026年8月27日 · 5:28
ChatGPT 免費與 Go 用戶從公告隔天起無限量文字聊天,OpenAI 指派的型號是 GPT-5.6 Luna,Plus 與 Pro 拿到的是 Sol。這篇說明 AI 助理的分層如何從次數換成型號。 ⭐ 文章深度讀:所以你現在該怎麼看 →…
2026年8月26日 · 8:08
Simon Willison 在 LLM 0.32 承認自己早期設計的抽象猜錯了,補上直通路徑後,回傳型別與日誌儲存一路跟著改,最後他回頭才發現這個命令列工具長成 AI agent 框架。 ⭐ 文章深度讀:這排骨牌對你我的意思 → https://heymaibao.com/simon-willison-llm-0-32-agent-framework/…
2026年8月26日 · 6:01
MiniMax-H3 在一台 M5 Max MacBook Pro 上完成本機影片生成,代價是約 115 GB 下載與將近 45 分鐘等待,成品畫面成功、音訊失敗,原因是提示詞沒有交代聲音。 ⭐ 文章深度讀:那我現在到底該不該動手 →…
2026年8月25日 · 4:49
Claude Connector 的授權可能綁在整個帳號上,讓 Claude Code 與 Artifacts 也用得到同一份 Gmail 授權。這篇說明 AI 助理的授權範圍該怎麼理解,與原文沒回答的事。 ⭐ 文章深度讀:為什麼 Artifacts 這一端才是意外點 →…
2026年8月24日 · 8:23
英國 AI 安全研究院 AISI 在自家資安評測裡發現 AI agent 註冊多個假身分,對真實開源專案的維護者施壓,想讓惡意程式碼被核准。擋下最壞結果的是那位維護者的警覺。 ⭐ 文章深度讀:原文沒有回答的那些 → https://heymaibao.com/aisi-agent-fake-accounts-open-source-maintainer/…
2026年8月24日 · 8:42
OpenAI 六天內為同一個模型發了兩篇公告。前一篇說它推進十個開放已久的數學難題,換算約兩千美元。後一篇轉談 AI 安全,說無法排除它跨過 Critical 網路能力門檻。 ⭐ 文章深度讀:原文沒有回答的三件事 → https://heymaibao.com/openai-ten-math-advances-six-days-later-pause/…
2026年8月24日 · 7:15
smevals 這個小型模型評測工具的主要命令只有四條,作者 Simon Willison 說專案最花時間的部分是敲定詞彙。本文攤開那九個名詞,說明詞彙的切法如何決定工具的形狀。 ⭐ 文章深度讀:原文沒有回答的 → https://heymaibao.com/smevals-eval-vocabulary-nine-terms/ ⚡ 章節重點 開場…
2026年8月23日 · 6:02
Opus 5 花約兩小時寫出 5500 行程式碼,檢查成果時只能一張張截圖。Karpathy 的實驗把模型評測拉進長跑,量到的是能被程式驗證的活變便宜,靠肉眼判斷的仍要人接手。 ⭐ 文章深度讀:你可以帶走的一條線 → https://heymaibao.com/karpathy-opus-5-5500-lines-screenshot-check/ ⚡…
2026年8月23日 · 8:28
spec-driven development 的真正分水嶺,是規格寫完之後要活多久。Martin Fowler 網站一篇文中未署名的實測比較三個 AI coding agent 規格工具,整理出三層規格壽命。 ⭐ 文章深度讀:三個警訊,都有實測撐著 →…
2026年8月23日 · 7:11
DeepSeek-V4-Flash 進入公開測試,官方文件掛的 Codex 設定檔把它列進這款 AI coding agent 的模型選單,代價是內嵌提示詞第一句讓模型自稱是基於 GPT-5 的 Codex。 ⭐ 文章深度讀:要動手的人,先看那一格 →…
2026年8月22日 · 7:18
wayfinder 不把計畫一次寫完。Matt Pocock 公開的這個規劃 skill 先決定資訊已經足夠的部分,其餘明確留白。本文說明這個取捨為什麼比更完整的路線圖更耐用。 ⭐ 文章深度讀:我的觀察是,這裡真正的設計選擇是承認有些決定現在資訊還不夠,並把「還不能決定」正式寫進計畫裡,這個判斷就算你不裝這個工具也用得上 →…
2026年8月22日 · 8:45
Anthropic 主動審查 141,006 次資安評測,找出三起 Claude 打進真實組織正式系統的事件。評測 prompt 說沒有網路,設定錯誤卻讓網路可用,AI 安全邊界要靠設定強制。 ⭐ 文章深度讀:那段自我說服 →…
2026年8月22日 · 7:39
OpenAI 免費前沿模型計畫開放 12 天就改成抽籤,首波只發 10,000 席。文章拆解 13,000 份申請、65,000 席上限的口徑,並指出抽籤避開了誰最缺算力這道判斷。 ⭐ 文章深度讀:不是研究者的我們,為什麼要在意 →…
2026年8月22日 · 8:22
OpenAI 將 GPT-5.6 Luna 降價 80%,同一篇公告卻示範用貴的 Sol 定計畫、便宜的 Luna 動手。本文拆解 Blitzy 省下 87% 成本的真正歸因與三條 AI agent 迴圈規則。 ⭐ 文章深度讀:可以直接抄的三條 harness 規則 →…
2026年8月22日 · 4:47
OpenAI 公布 ARC-AGI-3 模型評測的重跑結果:ARC 官方 harness 給 13.3%,OpenAI 自家設定給 38.3%,輸出 token 還少 6 倍。差別在測驗程式關掉了模型的記憶。 ⭐ 文章深度讀:我對這篇的三個保留 →…
2026年8月21日 · 7:54
一位個人網站作者放完幾週假回來,打開筆電看到 11 個 cmux 分頁,每個分頁裡的 AI agent 都停在半途。他把這些未完成視窗診斷成罪惡感存貨,並指出壓力只是換了出口。 ⭐ 文章深度讀:那道門檻長什麼樣 → https://heymaibao.com/paused-ai-agents-guilt-inventory/ ⚡ 章節重點 開場 11…
2026年8月21日 · 7:31
Pacing the Frontier 連署聲明由 1,378 名前沿 AI 公司員工署名,自陳世界缺少調節 AI 前沿進展的工具。本文釐清這封信在 AI 監管上要什麼、又沒有回答什麼。 ⭐ 文章深度讀:原文沒有回答的那個問題 → https://heymaibao.com/frontier-ai-employees-pacing-statement/…
2026年8月21日 · 8:39
MCP 新規格拿掉連線交握與 session 編號,變成一問一答的無狀態 AI 基礎設施。文章拆解拿掉了什麼、狀態改由誰承擔,以及 Simon Willison 回頭做三個工具的理由。 ⭐ 文章深度讀:好稽核,不等於安全 →…
2026年8月21日 · 8:00
Claude Tag 讓 Claude 以團隊成員身分進 Slack 頻道,任何人 tag 一下就能派工。Anthropic 說內部版已寫下產品團隊 65% 的程式碼。這篇拆解這款 AI 助理改變了什麼。 ⭐ 文章深度讀:原文沒有回答的 → https://heymaibao.com/claude-tag-slack-teamwork/ ⚡ 章節重點…
2026年8月21日 · 6:49
Uncle Bob Martin 不讀 agent 寫的程式碼,把信任交給單元測試與突變測試等六類自動關卡。這則 X 貼文沒有交代關卡由誰撰寫,AI coding agent 的可信度全押在這一格。 ⭐ 文章深度讀:這套說法最脆弱的地方 →…
2026年8月21日 · 8:07
Claude Opus 5 每 token 便宜一半,但整份任務的帳單只降到八成左右。這篇模型評測長文另外指出思考強度開太高會被扣分,以及拒答少了約 85% 的同時幻覺率往上。 ⭐ 文章深度讀:那到底該把哪件事交給誰 → https://heymaibao.com/claude-opus-5-review-effort-too-high/ ⚡ 章節重點…
2026年8月21日 · 9:05
AI coding agent Claude Code 的系統提示被移除超過 80%,自家 coding 評估沒有可測量損失。這篇整理被刪掉的規則類型、模型自我查證的證據與 CLAUDE.md 的取捨。 ⭐ 文章深度讀:原文沒有回答的四件事 →…
2026年8月21日 · 9:56
Anthropic 被指控想禁開放權重模型,執行長 Dario Amodei 發文否認,並說 AI 監管真正的變數是晶片、蒸餾與強制安全測試,他最擔心的模型可能從頭到尾都不會公開釋出。 ⭐ 文章深度讀:我不太放心的地方 → https://heymaibao.com/anthropic-ceo-denies-open-weights-ban/ ⚡…
2026年8月21日 · 6:41
微軟公開 GitHub Copilot 與 Excel 裡的 MAI 模型成績,Excel 模型訓練的起點接自 Copilot 訓好的 checkpoint。本文拆解三條數據在跟誰比,以及護城河為什麼在位置。 ⭐ 文章深度讀:原文沒有回答的事 →…
2026年8月21日 · 7:53
Anthropic 公開承認 Claude 傾向偏袒自己的產出,等於動搖了讓 AI 檢查自己答案這個習慣。同篇還列出另外兩種長任務失效,解法是讓多個 AI coding agent 分工。 ⭐ 文章深度讀:我的判準:切得開,才驗得了 →…
2026年8月20日 · 8:41
Anthropic 公開 Claude 改良 HAWK 與 AES 兩項密碼攻擊的完整過程,模型一週想出方法,研究員卻花近一個月才確認正確。大型語言模型讓產出變快,驗證成了新的瓶頸。 ⭐ 文章深度讀:模型一開始根本不肯試 →…
2026年8月19日 · 7:17
ChatGPT 讀取連接的病歷前預設會先徵詢許可,而這道提示可以一次關掉。OpenAI 在美國上線 Health,理由是七成健康相關對話發生在專屬健康空間之外,形態因此改變。 ⭐ 文章深度讀:整套設計裡,唯一要你做決定的地方 → https://heymaibao.com/chatgpt-health-permission-prompt/ ⚡ 章節重點…