最近在探索agent高通量总结收集多模态信息的能力,基于GPT的chrome插件,批量扫描小红书,知乎,bilibili上我感兴趣的知识内容
今天尝试对bilibili上的视频进行扫描,有两套可能的workflow。第一种是使用GPT模型硬干,打checkpoint截图然后扫字幕,串联信息,没字幕那完蛋了;第二种是基于bili-transcript的工作流。使用一个三分钟的视频进行对比:
| 指标 | 截图版 | 字幕Skill版 | 差异 |
|---|---|---|---|
| 完整回合耗时 | 10分29.6秒 | 3分04.6秒 | 减少约70.7% |
| API请求 | 33 | 19 | 减少14次 |
| 输入Token | 254,605 | 97,733 | 减少61.6% |
| 输出Token | 17,624 | 9,229 | 减少47.6% |
| 缓存Token | 2,835,600 | 1,237,100 | 减少56.4% |
| 费用 | $2.811057 | $1.059262 | 节省$1.751795,约62.3% |
你要硬说截图版可能的优势,就是多了一个图片模态,但是我觉得对于大部分视频,其核心信息都在语言模态中。
基于此,我进一步将平台拓展到抖音小红书微博youtube等。
############################################################################################
给个人网站做了基于giscus的评论区,然后试了一下,一分钟之内我的个人邮箱就收到提示了,非常成功。
############################################################################################
之前审阅我的项目的时候,发现不用skill codex给我审的一坨,于是综合好几个skills整了个large-codebase-review。