最近在探索agent高通量总结收集多模态信息的能力,基于GPT的chrome插件,批量扫描小红书,知乎,bilibili上我感兴趣的知识内容

今天尝试对bilibili上的视频进行扫描,有两套可能的workflow。第一种是使用GPT模型硬干,打checkpoint截图然后扫字幕,串联信息,没字幕那完蛋了;第二种是基于bili-transcript的工作流。使用一个三分钟的视频进行对比:

指标截图版字幕Skill版差异
完整回合耗时10分29.6秒3分04.6秒减少约70.7%
API请求3319减少14次
输入Token254,60597,733减少61.6%
输出Token17,6249,229减少47.6%
缓存Token2,835,6001,237,100减少56.4%
费用$2.811057$1.059262节省$1.751795,约62.3%

你要硬说截图版可能的优势,就是多了一个图片模态,但是我觉得对于大部分视频,其核心信息都在语言模态中。

基于此,我进一步将平台拓展到抖音小红书微博youtube等。

############################################################################################

给个人网站做了基于giscus的评论区,然后试了一下,一分钟之内我的个人邮箱就收到提示了,非常成功。

############################################################################################

之前审阅我的项目的时候,发现不用skill codex给我审的一坨,于是综合好几个skills整了个large-codebase-review。