這暑假輔導下我侄子學 AI,他按照“做中學”的原則,做了兩個對家人實用的健康相關的 Agent Skills,還挺有意思。以及順便推薦下他用到的豆包搜索 API,很適合這類需要讓 Agent 能檢索外部資料的場景,如果使用強度不大每個月免費送的 500 次就夠用了。
我爸是養生愛好者,喜歡看養生節目,往家人羣裏轉發養生文章,雖然大部分都不太靠譜,但我現在也懶得反駁了。
我侄子是 AI 愛好者,喜歡學習 AI 技術,最近暑假在家無事,也學會了用 Agent,還看了我送的那本《圖解 Skill》,就拿着榔頭到處找釘子,想用 AI 做點好玩的事,不知道怎麼就盯上了我爸轉發的養生文章。
侄子的想法是做一臺“養生謠言粉碎機”:把文章鏈接、短視頻文案發給 Agent,它能識別誇大療效、僞科學話術、斷章取義和營銷軟文,給出可信度評級與通俗解釋,最後再生成一段“適合轉發給爺爺奶奶看”的溫和回覆。
最開始還雄心勃勃要寫個 AI Agent,我建議他還是從 Agent Skill 開始,不用一口氣喫成一個胖子。做個 Agent,哪怕是基於現成 SDK,還有不少 UI 的工作要做,而且現在 Agent 對 Skill 都支持很好,他這種需求對 UI 要求也不高,輸入一段文字或者鏈接,返回自然語言結果就好,Skill 就足夠了。
即使是做一個 Agent Skill,真去做也會發現不是那麼容易的事。
他的第一版做得很快。讓 AI 幫寫了段提示詞,把文章全文丟進去,讓模型直接輸出評級和闢謠理由。但很快發現 AI 是有幻覺的,有時候給出的結論看着頭頭是道,追問依據就露餡了,要麼含糊其辭,要麼給出的“參考來源”本身也不靠譜。畢竟醫療健康這種事,還是要有最新權威的科學依據纔有說服力。
這其實是所有大模型都有的幻覺問題:大模型的知識是訓練時的靜態快照,有截止日期,而且生成的時候是可能會編造的,沒證據的事也能說得像真的。
要解決這個問題,最簡單有效的辦法就是讓它能聯網查詢最新信息,而且是權威信息,這樣才能降低幻覺。 想讓 Agent 幹嚴肅的活,光靠模型腦子裏的知識不夠,必須給它配一個靠譜的外部檢索工具。
所以我建議他讓 Agent 藉助外部工具去找證據。
【2】傳統搜索是爲人設計的
順着這個思路,他一開始想的是接個傳統搜索引擎的 API。但很快發現新的問題。
傳統搜索是爲人設計的。人輸入關鍵詞,得到一堆鏈接和摘要,需要自己點開閱讀後判斷哪條可信,搜不到就自己換個詞再搜。整個流程裏,判斷和迭代都是人在做,搜索引擎只負責根據關鍵字和算法給你一堆網頁。
Agent 要的東西完全不同。 它需要自己把一個模糊的問題拆成具體的檢索條件,需要一次拿到結構化的、帶來源和時間的結果,如果發現結果不足以幫助自己完成任務,還需要繼續發起下一輪檢索。
另外 Agent 並不一定知道哪些來源權威、哪些只是營銷號編造的。
【3】他最後接的是豆包搜索 API
豆包搜索是火山引擎面向 AI Agent 做的聯網信息服務,跟豆包 App 裏那個 AI 搜索同源,字節把它開放成了 API,正式面向企業和開發者開放服務,免費贈送 500 次搜索/月,個人開發者的 Skill 項目,一次任務通常就檢索兩三輪,這個額度足夠覆蓋日常開發和自用,對他的項目來說正好。
用下來,最實用的是“可信度”和“可用性”這兩點。
可信度 ,靠的是權威分級和垂類知識。現在網上 AIGC 生成的內容越來越多,還有專門針對 AI 搜索做的 GEO 注入(就像以前對搜索引擎做 SEO 一樣,現在有人專門優化內容讓 AI 更容易引用),檢索結果裏混進不可靠信息的概率比以前高多了。豆包搜索的返回結果裏每條都帶權威性標註,可以在檢索層就把信息源過濾乾淨。
可用性 ,靠的是深度加工和全面的字段。返回結果是前置做好結構化處理的內容,Agent 拿到就能用,省掉了額外抓取頁面、理解頁面的步驟,也省 Token。
開發方面倒沒怎麼讓我操心,官方有一個示例 Skill 正好可以借鑑:https://github.com/bytedance/agentkit-samples/tree/main/skills/byted-web-search ,把鏈接給 Coding Agent,讓它照葫蘆畫瓢就可以。
而且從示例代碼中還發現幾個有價值的參數:
-
• query-rewrite:口語化的問題會被改寫成更容易命中的檢索詞。Agent 生成查詢時給出的關鍵字有時候很奇怪,加上這個參數後可以明顯提升檢索質量 -
• auth-level:優先只要權威來源,返回結果裏每條都帶權威性標註 -
• time-range:支持按照當前、當週、當月、當年檢索,也支持自定義日期區間YYYY-MM-DD..YYYY-MM-DD(開始日期不能晚於結束日期)
auth-level
參數尤其適合覈查養生謠言這種場景,第一輪檢索只看衛健委、疾控、專業學會、醫院和高校,就能過濾掉絕大部分不靠譜的信息源。權威結果不夠時再去掉過濾擴搜,按證據層級人工篩。
寫好後,我拿一條養生謠言去測試了下:“每天早上空腹喝一杯醋能軟化血管,已經喫降脂藥的人也可以停藥改喝醋。”效果很不錯。
先是一句話結論,再列出包含權威網站鏈接的關鍵證據,最後還貼心地整理出適合老人看的微信留言。
做好了後,我爸再轉發養生知識,侄子就用他的 Agent 去檢索,用 Skill 生成的微信消息去回覆。
雖然 AI 糾正的確實很準,但是後來羣裏有點尷尬,畢竟就算是發的文章是謠言,每次被這麼在羣裏糾正也有點怪怪的。
【4】新方向:體檢行動助手
正好微博 VibeLab 有一個來去之間出的題還挺好,就是針對體檢報告生成日常健康行動方案。這倒是個好主意,粉碎謠言雖然好,但治標不治本,如果能給出一些針對性的健康建議其實更好。
於是侄子找到了新的方向:體檢行動助手 Skill。
雖然有前面養生闢謠 Skill 的經驗,但還是有些新的挑戰。
闢謠是判斷別人的說法對不對,而體檢報告解讀得先把報告上的數據準確讀出來,判斷哪些指標異常、異常到什麼程度,再去找權威依據來解釋這些異常意味着什麼,最後還得給出具體可以做的事情。
這裏面有一些問題需要注意:
-
1. 數據準確性。 體檢報告經常是拍照或掃描件,OCR 識別小數點、單位、陽性陰性、箭頭方向經常會出錯。要是一個“甘油三酯 1.8”被識別成“18”,後面的判斷就全錯了。所以必須加一步確認環節,把識別出的關鍵數據展示給用戶對照報告確認下。 -
2. 安全邊界。 體檢報告不是養生文章,這涉及到真實的健康決策。AI 如果說了句“你這個指標沒事不用管”,然後人家真信了沒去複查,出了問題誰負責?所以必須非常剋制,不能診斷疾病,不能替代醫生,不能建議喫什麼藥、停什麼藥。能做的只是幫忙整理信息、提供科普知識、提醒該去看醫生的就去看。 -
3. 證據覈驗。 這部分倒是剛好可以重用之前的豆包搜索代碼。 -
4. 隱私保護。 搜索時絕對不能把用戶的姓名、報告編號、完整病史發給搜索 API。發出去的只能是標準化的指標名加上一般人羣條件,比如“空腹血糖 一般成人 指南”。
雖然都用到了搜索,但是和謠言粉碎機不同,體檢報告的搜索策略要精細得多。謠言粉碎機重點是這個說法對不對,一般搜一輪就夠了。
而體檢指標要搜兩輪:
第一輪找指南。
比如“甘油三酯 一般成人 國家衛健委 指南 生活方式”,目標是找到當前的官方建議和正常範圍。
auth-level
參數在這裏就非常關鍵,體檢指標的解讀必須以權威來源爲準,一個營銷號說“甘油三酯高就要每天跑五公里”可能會害人。
第二輪找限制。 比如“甘油三酯 禁忌 何時就醫 證據侷限”,這輪是主動找反面信息:哪些人不適用一般建議?什麼情況下必須就醫?有沒有常見的誤區?這一步容易被忽略,但恰恰是避免 AI 給出正確但危險建議的關鍵。
證據覈驗完成後,最關鍵的一步是把異常指標轉化成本週行動。 比如說用戶體檢報告中“甘油三酯偏高”,給出具體的行動建議:
-
• “這週三次飯後散步 30 分鐘” -
• “預約內分泌科複查”
每個行動都帶觸發條件、完成標準和暫停信號:出現胸痛、頭暈這類症狀就應該立刻去看醫生。
完整的 Skill 是一套流水線:
讀取報告 → 確認數據 → 風險分流 → 豆包搜索覈驗 → 生成行動 → 每週覆盤
其中風險分流用的是確定性的規則,比如說:
-
• 紅色(急症/危急值) -
• 橙色(已確認異常) -
• 灰色(數據未確認) -
• 綠色(未發現異常)
每種顏色對應不同的行動類型,紅色代表“立即就醫”類行動,灰色代表“確認數據”類行動,避免出現危害健康的離譜建議。
正好拿我自己今年的血脂報告做了次測試。Skill 先從 PDF 中讀出數據,再讓我逐項確認:空腹甘油三酯 152 mg/dL,被報告標記爲 High;同時結合歷年趨勢,發現這個指標近幾年一直在正常與略高之間波動。我還補充說明自己每天服用降脂藥已有三年。確認完成前,系統一直停留在灰色,不做醫學解釋;確認後才按規則分到橙色,表示存在已確認異常,需要近期諮詢醫生,但並不等於疾病診斷。
隨後 Agent 只用“甘油三酯、一般成人、生活方式、複查、用藥隨訪”等去標識化關鍵詞調用豆包搜索 API,沒有上傳報告或精確數值。覈對國家衛健委、ACC/AHA 和 FDA 原文後,最終給了三個本週行動:聯繫醫生覈對報告留言、用藥記錄和複查時間;晚餐選擇無糖無酒精飲品;完成五次中等強度活動。每項都有觸發條件、完成標準和暫停信號,也明確提醒不能自行調整藥物。
【5】不止健康場景
這套“檢索工具 + 流程設計”的組合,也可以應用到其他類似的場景。
比如論文檢索。用
time-range
把範圍圈定在近一年,再配合權威來源過濾,做某個方向的文獻初篩,比自己在搜索引擎裏一頁頁翻高效多了。
比如做行業調研。用
auth-level
把營銷號和二手轉載過濾掉,剩下的基本都是官方發佈、機構報告和正經媒體,省掉了人工鑑別信息源的大量時間。
另外豆包搜索返回的內容本身就是 Markdown 格式,Agent 拿到結果直接就能理解和使用,不用再拿着鏈接自己寫爬蟲抓一遍頁面、清洗 HTML、做頁面理解,檢索和內容獲取一步到位。
【6】兩個 Skill 做下來的收穫
侄子跟我分享說,他的收穫是對 Agent 理解更深刻了。原來以爲最難的是寫代碼和提示詞,後來發現這兩部分反而是最簡單的,都是 Agent 幫助完成的。 難的是怎麼給 Agent 提供好用的工具 ,比如養生闢謠,就需要靠譜的檢索工具:搜什麼、怎麼判斷搜到的東西可不可信、什麼時候該換個詞再搜、什麼時候該承認找不到。
而豆包搜索的
auth-level
、
query-rewrite
、
time-range
這幾個參數,恰好把這些工作方法變成了可配置的選項。Agent 不需要自己學會判斷來源是否權威,
auth-level
直接在檢索層過濾;不需要自己學會改寫查詢,
query-rewrite
自動優化。這讓開發者可以把精力放在業務邏輯上,而不需要和搜索引擎較勁。
光有工具還不夠,複雜的場景,還可以給 Agent 設計好科學的流程 ,避免 Agent 每次都要從頭去摸索工作流程,就像體檢行動助手的流水線:
讀取報告 → 確認數據 → 風險分流 → 豆包搜索覈驗 → 生成行動 → 每週覆盤
這兩個 Skill 都開源了,項目地址:https://github.com/karryliu10/karryliu-skills 。用的時候需要去 https://console.volcengine.com/search-infinity/web-search-exp 申請下 API Key,每個月有 500 次免費額度。
如果你在用火山引擎的 Agent Plan,豆包搜索在裏面直接就能調用,還可以搭配字節最新的 Doubao-Seed-Evolving 模型一起用,它是字節推出的持續最強 Seed 模型,沒有版本號,無需更換模型 ID,自動後臺升級爲最新模型。在中文理解和複雜推理上的有明顯提升,拿來跑這類中文覈查任務挺合適。
另外侄子在開發 Skill 過程中,我還教了他一些具體的經驗:
-
1. 沒必要做一個 Agent,Skill 就可以做很多事情了 -
2. 不要有太多顧忌,先做出來再優化 -
3. 讓 Agent 幫助寫 Skill 和腳本 -
4. 寫腳本的時候,沒必要從零開始寫,去 GitHub 找可以開源運行的例子作爲參考或者二次開發更高效 -
5. 遇到困難可以和 Agent 一起討論方案,但是要給足上下文 -
6. 驗證很重要,做完要用各種場景驗證,根據驗證結果去優化
希望這些經驗對你也有所啓發。