Scribe
Scribe

Ti piace? Rendi Scribe ancora migliore lasciando una recensione

Ottieni l'estensione Chrome

Sfoglia

  • Video Popolari
  • Video Recenti
  • Tutti i Canali

Strumenti Gratuiti

  • Scaricatore di Sottotitoli Video
  • Generatore di Timestamp Video
  • Riassuntore di Video
  • Contatore di Parole Video
  • Analizzatore di Titoli Video
  • Ricerca Trascrizioni Video
  • Analisi Video
  • Creatore di Capitoli Video
  • Generatore di Quiz Video
  • Chat con Video

Prodotto

  • Prezzi
  • Blog
  • Ottieni l'estensione Chrome

Developers

  • Transcript API
  • API Documentation

Legale

  • Termini
  • Privacy
  • Supporto
  • Mappa del sito

Copyright © 2026. Realizzato con ♥ da Scribe

— Se questo ha reso la tua vita più facile (o almeno un po' meno caotica), lascia una recensione! Promettiamo che ci renderà felici. 😊

Related Videos

我的 AI agent 連續跑了 27 個小時,/goal 功能怎麼用?

Video thumbnail
129.62k771 Parole3m readGrade 18
Condividi
Channel
Gary Chen
就在上週,我讓 AI 跑了整整二十七個小時 對,過程中沒有人為介入 我的 Agent 跑了整整二十七個小時 如果你跟 AI 的互動現在還停留在你問一句 它答一句的模式 那這支影片你一定要從頭看到尾 因為這支影片我會告訴你到底該如何奴役你的 AI 定好目標後就讓他不眠不休的為你幹活 解放真正的生產力 很多人以為自動化就是把任務丟給 AI 讓它自己跑 但如果你每隔十分鐘就要回去確認它做到哪 要不要改方向,有沒有偏題 做完一輪還要你去審核後再丟給它跑下一輪 這樣真的是自動化嗎? 你的注意力還是被綁在那邊 把任務從你手上移到 AI 手上 只走完了自動化的前半段 後半段是把那件事從你的心上徹底移開 讓你的時間,腦力可以放在其他更重要的事情上 真正的自動化是解放你的注意力 Cognitive Science 早就證實了 只要你心裡還掛著一件沒處理完的事 不管你現在有沒有親自在做它 就是會佔用你的腦力 那些掛在腦子裡的事 比方說等 AI 跑完之後 我要記得改那個按鈕的 UI 或是這個方向好像不對 等一下我得記得調整 這每一件事情都在偷偷吃掉你的注意力 而注意力,才是這個時代真正稀缺的東西 今天這支影片只有乾貨 你會知道怎麼樣讓 AI 真正為你所用 執行長任務時不會偏離目標 最後的產出也貼合你的品味 影片分成三個部分 第一,我們會拆解最近主流的 AI 工具跟實驗室 針對 AI 做 long-running task 分別推出了什麼新功能,又做了哪些研究 第二,從這幾個工具的設計原理來看 讓 AI 能長時間運行的秘密到底是什麼 要怎麼做才能讓你的 agent 不眠不休的為你工作 第三,你該如何立刻把這套東西應用到你的工作上面 看完這支影片之後 我希望你不再只是 AI 的協作者 而是 AI 時代下的管理者,那我們直接開始 如果你有在關注 AI agent 的圈子 你會發現一件很有趣的事情 Claude Code , OpenAI Codex 還有 Hermes Agent 這三間公司幾乎在同一時間 推出了一個一模一樣的新功能 甚至名字也都一樣,叫做 goal 這個功能是幹嘛的? 簡單講就是你只要在對話框裡打斜線 goal 然後寫下你想要它達成的目標 它就會自己跑下去,直到完成為止
我看社群媒體似乎不夠重視這個趨勢 這些公司推出的這個功能 其實都是想要解決一個所有 AI 工作者都遇到過的問題 那就是 AI 會偷懶 你一定有過這種經驗 叫 AI 做一件事,它做到一半 停下來問你「我可以繼續嗎?」 你要 A 還是 B ?或者更糟 明明沒做完,但卻跟你說他做完了 寫了一個漂亮的總結,然後把球丟回給你 你想要的就是 Agent 可以直接做完 沒做完真的不要回來煩我。但它就是會停 到底為什麼會這樣呢? Anthropic 在2025年底發了一篇研究 他們發現 LLM 做到一半會停下來的根本原因 叫做 context anxiety 翻譯成中文就是上下文焦慮 用白話文解釋的話 就是 LLM 在執行任務的時候 會一邊看自己的 context window 用了多少 當它感覺到 context 快滿了,就會開始慌 然後就莫名其妙開始 wrap up 想要快點交差了事,然後就停了 這是刻在 LLM 基因裡的一種惰性 我稱之為下班心態 而 goal 這個功能就是為了對抗這種惰性而生的 接著我們聊聊 goal 的運行原理 goal 在工作的時候通常會有兩個角色協作 一個是做髒活的實作者 另一個是負責確認產出品質以及任務進度的評審 實作者負責執行你的指令,產出東西 評審在每一輪結束後都會檢查一次 用戶給的目標完成了嗎? 只要答案是沒有 評審就會點出問題,並叫實作者繼續往下做 就像你把一根胡蘿蔔吊在豬鼻子前面 豬只要還沒吃到那根胡蘿蔔,它就不會停下來 而你只有在這隻豬真的到達終點的時候 才會給他吃胡蘿蔔 goal 這樣的功能讓你不再需要每三分鐘跑回來檢查 催它,戳它 它讓 agent 有能力自我鞭策 自己跑到你給他定好的終點 講到這邊,業界內的觀眾應該會聯想到 去年中有一個滿火的插件也在做一樣的事情 叫做 Ralph Loop 這個插件的命名我覺得很有意思 Ralph 就是辛普森家庭裡那個有點傻 但永遠不會放棄的小孩 整個插件的精神就是 無論如何都會持續做到底的循環 當時這個插件 也在 AI 編程圈掀起一陣風潮 而今天這三家公司 把這個理念變成了官方 feature 接著我們說一下具體怎麼使用 goal 這個功能
其實這背後沒什麼大哉問 就在 Claude Code , Codex 或者 Hermes Agent 的對話框打上斜線 goal 然後說明你希望他能完成的任務就好了 當然還有一些更進階的設置 像是限制他可以使用 token 的上限等等 更詳細的使用說明,各位可以查閱官方文檔 我會把連結放在資訊欄 功能的使用方式很簡單暴力 但真正的問題是 要怎麼寫這個提示詞才能讓 goal 跑出正確的東西 而不是另外一個 AI slop ? 如果你很隨興的丟一個 prompt 像是把這個專案改得好一點 AI 會做一兩個小改動 然後說我已經讓它變得更好了 五分鐘內就把這個任務完成 為什麼?因為好一點是一個沒有邊界的目標 AI 不知道什麼叫做好一點 它就只能猜,只能自己定義 而他定義的 definition of done 你通常不會滿意 再看一個寫得好的例子 把網站結帳頁面的反應速度降到 0.2 秒以內 用速度測試工具驗證 過程中其他的功能要保持完好無缺 只能改結帳這個區塊的程式碼跟相關測試 別的地方不要動 每改一次 就記錄下你改了什麼,測出來的速度是多少 下一個最值得試的方向是什麼 如果速度測試工具跑不起來 或者所有想得到的方法都試過了 那就停下來 告訴我你試過什麼,卡在哪 需要我給你什麼資訊才能繼續 你看出差別了嗎? 第二個版本裡面有五個關鍵的元素 第一是 Outcome 也就是這個任務如果完成了應該是什麼狀態 在這個例子中是反應速度 0.2 秒以內 第二是 Verification 怎麼證明它真的完成了? 也就是用速度測試的工具驗證 第三是 Constraints 哪些事情你不能做? 也就是除了結帳頁面以外的其他所有功能 第四是 Iteration policy 也就是每次嘗試之間要做什麼? 我的例子是要求 AI 記錄改了什麼 結果是什麼,還有可能的下一步 第五是 error handling AI 在什麼狀況下要暫停並回報 而不是無腦的一直做下去 一份好的 goal prompt 的設計關鍵 不是 prompt 多會寫 而是你把所謂的完成定義得有多明確 完成的定義寫得好 它就會一直跑,跑到完成為止 而且完成後是你要的樣子
定義寫得爛, AI 就草草結束 三分鐘就收工,產出不是你想要的 不如不要浪費這些 token 講到這邊你可能會說 那寫程式的人很爽 因為測試通過,反應速度低於 0.12 秒 或者是 lint 乾淨 這些都是明確可驗證的標準 但大部分的白領知識工作不是這樣啊 你的圖好不好看?你的網頁有沒有品味? 你的文章寫得好不好?你的產品好不好用? 你做的影片是不是有質感? 這些東西沒有單元測試 也很難定義何謂過關,何謂失敗 那這種佔了我們白領工作絕大多數比例 偏向質化的工作 該如何套用一樣的邏輯 讓 AI 可以長時間替你打工? 在回答這個問題之前 我想先說一下 Anthropic 的另一篇研究 他們讓 Claude 去設計一個漂亮的網頁 然後也運用了剛剛提到的 一個執行者搭配一個評審的架構去設計這個網站 但網頁設計得漂不漂亮是一個極度主觀的事情 你叫 AI 自己評自己做的網頁漂不漂亮 明明做得超爛超醜,滿滿的機油味 它還是會把自己的設計定義成現代感,高質感 所以 Anthropic 把漂亮的網站這個模糊的概念 拆成了四個明確的維度 第一個維度是設計品質 整個網頁有沒有向用戶傳達出一個整體的設計語言? 顏色,字體,排版 有沒有共同營造出一種獨特的氛圍跟識別感? 第二個維度是原創性 有沒有刻意的設計選擇 還是用了一堆預設的模板? Anthropic 團隊羅列了一些 AI 很愛用的設計元件 比方說一張卡片上面有漸層的顏色 這種太通用的模板就會被判定沒有原創性 第三個維度是技術執行 字體階層,間距,配色,對比 這些技術細節有沒有整齊?保持一致? 如果每個頁面的標題字體大小都不一致 那這一關就沒過 第四個維度是可用性 這個維度不管美感,純看實用性 比方說使用者看得懂這個介面在幹嘛嗎? 找得到主要按鈕嗎? 能不能很直覺的就完成他們進來這個網站的最初目的? 更有趣的是 他們在這四個維度之上 還會故意加重 Claude 平常做不好的那些維度的權重 例如他們發現 Claude 在技術執行跟可用性這兩個維度通常做得不錯 但在設計品質跟原創性這兩個維度上 常常產出平庸到不行的網站 所以他們就把評審評分的權重 故意往這兩個弱項偏 每個模型都有自己的一些傾向 而你設計的評分標準,可以當作一個 benchmark 校正模型的預設行為 讓模型朝著你想要的方向前進 訂完前面講到的幾個維度後 他們把這份 rubric 餵給評審 並讓評審自己去看實際做出來的網頁 然後用 Playwright 打開瀏覽器 自己截圖,然後打分 不是讓它看程式碼 是讓評審看使用者真的會看到的畫面 Anthropic 用以上的評估架構去做了一個美術館的網站 跑到第九個
iteration 的時候 Claude 做出了一個還不錯的東西 深色主題的 landing page 版面乾淨,視覺精緻 但基本上就是你預期的美術館網站該長的樣子 但到了第十輪 它把整個網站重新想像成一個空間體驗 用 CSS 透視渲染出一個 3D 房間 地板是黑白方格 藝術品像在真實畫廊一樣掛在牆上,不規則排列 觀眾不是用 scroll 跟 click 在頁面之間跳 而是穿過虛擬的門走進不同展廳 這就像是 Claude 突然被梵谷附身了一樣 他們的研究人員也說 這是他從來沒看過 不可能從單一次 prompt 產出的創意躍遷 而且這個躍遷不是線性的 並不是每一輪都比上一輪好 有可能第十輪的產出反而遠遠比第十五輪的產出更漂亮 更有創意 但只要評審跟執行者繼續對話下去 複雜度會增加,野心會增加 然後在某幾輪 會出現那種我自己都想不到的飛躍 所以你看出來了嗎? 不論是 goal 這個功能的設計 或者是 Anthropic 的研究 又或者是前陣子 Andrej Karpathy 推出的 auto research 其實全部都指向同一件事,那就是 Evaluation 不是 prompt engineering 不是 context engineering 而是你身為使用者 能不能定義清楚什麼叫做得好 並請他根據你的指示去做評分 Evaluation 代表的是一個評分標準 也是審核者,評估者 在每一輪的迭代中都要守住的原則 就是有這些原則跟評估標準 審核者才能逼執行者不斷迭代 並朝著你真正想要的結果前進 最後我想聊聊 那我們一般人 究竟要怎麼把自己工作領域裡的品味 拆解成 AI 可以 follow 的準則呢? 這一題我自己也摸索了很久 最後收斂成了一套六個步驟的 SOP 在這邊分享給各位 第一步是先讓 AI 做一輪你的工作 先不要急著寫 rubric 或者任何評估標準 如果你要請 AI 寫作 先丟 5 到 10 個你想寫的主題進去 讓它隨便跑 這是在測驗你使用的這個 AI
現在的基準能力 也就是所謂的 baseline 第二步是親自看一遍 AI 的 baseline 產出 每一個都看 然後去感受哪些你看了會皺眉? 更重要的是,皺眉的具體原因是什麼? 是因為開頭沒有吸引人注意的 hook ? 沒有提供具體例子闡述你要說明的概念? 把這些皺眉的理由寫下來 這些會是你 rubric 的雛形 到最後你會有一份清單 裡面寫著 AI 踩過的地雷 像是第一句話又是『在這個快速變化的時代』 整篇都在用一般人不會用的成語 或者文章裡面沒有任何具體的人名或數字 第三步是把這些東西給分類 拆成幾個不同的維度 就像剛剛提到 Anthropic 的做法一樣 這樣之後的 AI 評審就可以根據你分類出來的維度去打分 舉個例子 你列出了 50 條皺眉的理由 可能最後收斂成三大類 第一類是邏輯鬆散 這個分類的定義是文章邏輯有斷層 前文跟後文接不起來 第二類是沒有人味 定義是寫出來的內容沒有作者個人視角 沒有具體例子 在文章中一直使用像是破折號這類人類不會使用的標點符號 第三類可能是文章開頭沒 hook 第一句話就讓人想關掉,根本讀不下去 這三個維度就是你寫作 rubric 的骨架 我們也回顧一下 Anthropic 是怎麼做的 他們也是先看了一堆 Claude 做的網頁 把皺眉的點聚合 最後收斂出了設計品質,原創性,技術執行 還有可用性這四個維度 一模一樣的動作,只是不同領域而已 第四步是把每個維度 整理成具體的案例當作 reference 這一步是整套 rubric 的核心 你不能寫避免 AI 味這種抽象描述 要寫絕對不要用破折號 絕對不要用『不是 A ,而是 B 』這種句型 你的案例要足夠具體 評審才能夠一掃文字就馬上幫你抓戰犯 或許你覺得這樣講還是太抽象 沒關係,我們一起來看 Anthropic 是怎麼寫的 他們在官方的 front end design 這個 skill 裡面 為原創性這個維度提供了幾個具體的案例 像是絕對不要用 Inter , Roboto Arial , system fonts 這四種字體
還有絕對不要用紫漸層蓋在白色卡片上 他們不是寫要保持原創性 而是通過經驗以及人的品味 把那些 AI 一犯再犯的錯誤一個一個點名出來 放到我們剛剛的例子上 寫作的 rubric 完全可以照搬這套寫法 你所謂的沒有人味這個維度可以這樣寫成 絕對不要用破折號連接兩個短句當作節奏感 絕對不要用不是 A ,而是 B 這種句型 絕對不要用在這個快速變化的時代 在 AI 時代這種起手式 每一條,都是評審一掃就抓得到 可以推斷的標準 第五步是要用多樣化的案例去取代單一的案例描述 Anthropic 在 blog 裡面自爆過一個血淚教訓 他們一開始在 rubric 寫了一句話 請設計成博物館等級的質感 結果跑出來所有產出 都變成博物館風 非常的單一且沒有多樣性 後來他們把這句整個刪掉 改成在文件裡列出 11 種美學風格 比方說 brutalist , art deco pastel , industrial 還有 retro-futuristic 然後讓 Claude 在設計時根據當下狀況選擇其中一種 確保產出的多樣性 有實作經驗的朋友應該都知道 AI 很容易因為你給的範例而有 overfitting 的狀況發生 也就是過度遵從你給的範例 所以你要寫多個方向才能確保多樣化 激發 AI 創意 第六步,也是最後一步 就是把你的 rubric 餵給評審 agent 直接跑跑看產出如何 如果你有扎實的執行完前五步 這個時候你應該已經有一份相當扎實的 rubric 下一步理所當然的就是 把這份 rubric 放進你的 goal prompt 裡面 跟你的 AI 說這些就是他要遵循的審核標準 請確保在以上 rubric 沒有達成之前持續迭代 不要停下 但這邊有個注意事項 建議你剛開始跑的時候還是要人工檢查一下 看看 AI 執行每一輪後的產出 確保評審判斷的結果 跟你親眼看的結果是否一致 如果不一致 那大概率是你的 rubric 寫法 還沒抓到你內心真正渴望的那個品味標準 這時候你要做的事情就是回去改 rubric
跑個三四輪之後 你就會發現你心裡對做得好的定義 正在被你一條一條的梳理出來 當你有這種感覺的那一刻 你就不再只是 AI 的協作者了 而是能夠定義自己品味的 AI 管理者 這就是我最近自己梳理出來的一套 SOP 希望可以對你有幫助 講到這邊 也帶到整支影片最想跟你說的事 寫 evaluation 的 rubric 表面上是給 AI 用的 但實際上它是在逼你把那些一直以來 只存在你腦袋裡的模糊品味具體寫成文字 一旦寫成文字, AI 就可以幫你守住它 幫你大規模執行它 當初我也花了大量的時間在摸索如何定義自己的品味 所以我準備了兩個提示詞 第一個提示詞可以幫助你把過去 AI 的壞產出 收斂成 AI 評審可以拿來打分的 rubric 另一個是回到影片最一開始提到的 goal 功能 這個提示詞幫你把一個模糊任務 改寫成 AI 可以長時間執行的 goal 提示詞 包含完成標準,驗證方式,限制條件 可以動什麼,不能動什麼 以及卡住時要怎麼回報 有需要的朋友可以在影片下方資訊欄查看完整文章 還有領取提示詞 看完這支影片後 我給你的小練習是 挑一件你最常做 又最需要你個人品味的任務 可能是寫貼文,回客戶 email 做行銷圖,寫產品文案 又或者是影片剪輯 靜下心來 花 30 分鐘去跑以上六個步驟 試試看能不能讓 AI 的產出更穩定 更貼近你的預期 那以上就是今天的內容 如果對你有一點幫助 記得幫我按讚追蹤加分享 這是我持續創作下去的動力,我們下次見
Video correlati
My Daughter Survives WORLD'S TINIEST CAR
31:45
My Daughter Survives WORLD'S TINIEST CAR
Jordan Matter
6.1M views
Survive 100 Days In Nuclear Bunker, Win $500,000
32:21
Survive 100 Days In Nuclear Bunker, Win $5...
MrBeast
340M views
Survive 30 Days Chained To Your Ex, Win $250,000
37:04
Survive 30 Days Chained To Your Ex, Win $2...
MrBeast
187M views
50 Ways To Use Chocolate
47:11
50 Ways To Use Chocolate
Nick DiGiovanni
12M views
Destroy Your House, Win a New One!
34:35
Destroy Your House, Win a New One!
Stay Wild
2.5M views
Men Vs Women Survive In The Wilderness For $500,000
31:48
Men Vs Women Survive In The Wilderness For...
MrBeast
217M views
Opening his Dream Christmas Present
24:18
Opening his Dream Christmas Present
The Royalty Family
9.1M views
1000 Players Simulate Civilization: Boys vs Girls
52:36
1000 Players Simulate Civilization: Boys v...
MrBeast Gaming
12M views
Ronaldo vs My Unbeatable Goalie Robot
26:34
Ronaldo vs My Unbeatable Goalie Robot
Mark Rober
29M views
50 YouTubers Fight For $1,000,000
41:27
50 YouTubers Fight For $1,000,000
MrBeast
433M views
Defeat This Minecraft Boss, Win $100,000
26:08
Defeat This Minecraft Boss, Win $100,000
Karl
21M views
Beast Games | Episode 1 (Full Episode)
35:35
Beast Games | Episode 1 (Full Episode)
MrBeast
63M views
BOYS vs GIRLS Trapped in a TINY ROOM
32:40
BOYS vs GIRLS Trapped in a TINY ROOM
Jordan Matter
50M views
Survive 100 Days In Prison, Win $500,000
39:36
Survive 100 Days In Prison, Win $500,000
MrBeast
136M views