VIDEO
84
一套 AI 进阶协作三步法:先让 AI 独立运行建立基准,再用人工介入进行对照评估,最后将有效方案优化为稳定、可扩展的日常工作流。 
Yesterday 5 chapters View Source →
00:00 1
hello Hello 今天我跟鱼衣来三亚出差,然后做一个节目的录制。然后因为鱼衣是我们公认的,就是用 AI 用得非常疯的一位同事。然后最近呢,他就是有了这个额度的限制要求之后,比如你的 package 包里面 20 美金,然后能够跑掉的额度它就不跑完,对,200 美金然后不跑完不休对吧,然后甚至是要加班去跟 AI 去打磨。然后我就一直很好奇,因为最近模型的状态、模型的能力都在上来,我也很好奇他跟 AI 协作的方式有没有出现一些变化,他跟 AI 协作有没有一些方法论。我们来听听鱼衣是怎么协作的。
00:42 2
如果是谈到非常具体的模型的一些变化,这个是一个比较长的话题,但我给一个更通用的做法。就是我遇到新的模型,或者我有一些新的工作流也好,或者是想要去尝试的点也好,我会怎么去做。一般而言我就是三步。第一步呢,就是我所的大家会觉得很疯的地方,其实那只是我的第一步。就是对,就不怎么干预好像。
01:47 1
对,就 AI first 百分百的让 AI 去跑,然后管住自己想要插手的小手手。对,这上我其实一直都觉得怎么这么偷懒啊,怎么能就是不要人在环中呢?这点上我就觉得这个鱼衣这个动作可能跟我一开始预期的就不太一样。
02:02 2
对,他一直会觉得说我当然我,我一直以来的观点就是人需要很偷懒才能跟 AI 的协作好。你越想管就跟一个团队一样,你太擅长管了,你就干到死。好像有一本畅销书名字叫这个,就是如果你不懂管人的话,你就干到死。
02:20 1
是的,就是你自己会很累嘛。
02:22 2
对,所以第一步的话我会采取一个完全不干预。就是我 set up 我给到所有的环境跟设置,然后有的时候说清楚目标,有的时候说不说明确目标。只是看它跑的结果再去修正,但是第一步我一般而言就是不参与。然后就看 AI能跑出一个什么样得东西。哪怕是我当中得时候觉得有些地方不对,我都会采取不干预的状态。第一步就纯粹的烧。
03:28 1
还有第二步吗?
03:32 2
第二步呢其实是晓辉没有关注到的,就是很多人以为我只有第一步的情况。第二步其实我是会把人武器放进去。就我会在当时的时候包括我自己脑子里会有一些有些环节我参与会不会更好,有些跟他提这个要求它会不会试得更好。我会把第二步把这些想要做的事情再一次重新做一遍。然后去去看说加入我之后会不会结果会变得好一些。
04:01 1
有了一个对照组是。
04:04 2
对,就是对我而言,我觉得用 AI 很多时候是不不断的去建 benchmark 然后对比 benchmark 的过程。第一步对我而言建了一个 benchmark,第二步呢,我就开始去看我的加入对于这个 benchmark 会不会有变化。然后第二步还有一个很重要的去评估的东西是我加入之后到底对于这个 benchmark 的提升有多少?Benchmark 就是评测标准,对它的评测影响。结果只是更好了 5%,但是呢,我需要投入我自己投入进去一两天,然后我就会觉得这笔账划不过来,那不如我就接受 70 分的结果。对,因为我们会讨论什么 70 分 80 分。然后一般大概就是 80 分是可以应付大部分的事情的。对,然后我们经常会说 80 分以后,每一分可能都超过你 80 分之前的 10倍 100 倍。所以这里面就会有一个评估,就是如果 AI 出的是一个 70 分,是它我只需要花 en 不需要我参与的情况之下。然后我加入之后是 75 分,我会判断这件事情没有必要。然后 80 分,然后我会把它做一个我跟 AI 写作的 benchmark 我的参与的确能让 AI 有一个亮级的提升。
05:58 1
还有第三步吗?
06:41 2
第三步,然后第三步就会看这个任务是不是对我而言是一个非常常规化或者是高价值的任务。如果是常规化的任务会考虑到它的稳定性。因为前面一步两步其实你有狠多测试的过程,它不一定能够稳定的浮现。所以第三步我会去尝试所谓的搭建或者是说去做更多的一些环境的搭建,让它可以复现出来。然后第二个呢是我会去看性价比,就是前面两步其实都是不计成本用最好的模型,完全不在乎 token 的浪费的方式完全推它的边界。然后第三步如果我日常就要用这种方式很难维持的,那我也也会去看说到到底从 token 的节省和合理化方面有没有一些方法。然后也会去对平替模型到底能达到什么样的标准。最后固定成一个我的一个工作流,可以说 scale 或什么之类的。这是我自己的三步,所以你平时觉得我很疯,只是看到了第一步而已。后面还有这一步一步秘密武器。因为这个实验精神我觉得还是挺重要的。
08:31 1
有实验就要有对比嘛。
08:34 2
对。
08:37 1
我觉得这个还是学到了。嗯,谢谢鱼衣。然后我的他今天也问了我一个问题,在他的视频大家可以去看看。好,拜拜。
08:46 2
拜拜。
Click any line to jump · Hover to ask AI
Content Overview
AI进阶协作的有效方法:建立你的评测体系
在人工智能技术飞速发展、模型能力不断跃升的今天,如何与 AI 进行深度且高效的协作,成为了许多职场人和开发者关注的核心命题。在一次出差的交流中,晓辉博士对话了被公认为“用 AI 用得非常疯”的专家——鱼衣,深入剖析了他独创的 AI 协作“三步法”方法论。这套方法论的核心,就在于通过严谨的实验精神,建立起属于自己的评测体系(Benchmark)。 *
第一步:纯粹的不干预实验 (AI First)
面对一个新模型、新任务或是想要尝试的新工作流,鱼衣的第一步往往被旁人误解为“疯狂”或“偷懒”——那就是完全不干预。
在这一阶段,你需要做的是设置好所需的环境与初始参数,有时甚至不需要明确非常死板的目标,然后管住自己想要插手干预的手,让 AI 纯粹地去运行。即使在运行过程中发现某些地方不对劲,也要克制住人工修正的冲动,让 AI 自行跑出最终结果。
> 核心理念:第一步的彻底放手,本质上是在推向 AI 的边界,以此来建立一个客观的基准(Benchmark)。只有知道了 AI 独立能做到什么程度,后续的优化才有据可依。
第二步:加入人工干预进行对照评估
在拥有了第一步建立的 Benchmark 之后,第二步就要把“人工干预”作为秘密武器引入,重新把任务做一遍。这是一场严谨的对照实验,旨在评估人机协作的投入产出比。
在这个阶段,你需要思考:在哪些环节加入人的判断会更好?提出怎样的新要求能让 AI 表现得更出色?当得出人工参与后的结果时,必须进行理性的量化评估。例如:
* 不划算的投入:如果 AI 独立能拿到 70 分,而你亲自投入一两天的时间和精力,结果只提升到了 75 分(仅有 5% 的微弱提升),这笔账就划不过来,此时应该理智地接受 70 分的独立结果。 * 有价值的协作:通常 80 分足以应付绝大多数事情,但从 80 分往上每提高一分,难度都可能呈十倍百倍增加。如果你的加入能让 AI 的输出产生量级上的跨越(例如直接迈向 80 分以上的高分段),这才是高效的人机协作。
第三步:工作流的固化与性价比优化
当前两步的实验帮你摸清了 AI 的边界以及人工协作的价值后,如果该任务属于日常的常规化或高价值任务,就需要进入最后的落地推广阶段。
在前两步的测试中,很多过程可能存在偶然性,不一定能稳定浮现。因此,第三步的首要工作是进行环境搭建,确保整个流程能够稳定地复现与克隆。
同时,在前两步“不计成本用最好模型、完全不在乎 token 浪费”地测试出边界后,日常高频使用必须考虑商业成本。你需要从以下两个维度进行性价比合理化:
- Token 节省:优化 Prompt 或流程,减少不必要的字符和计算浪费。
- 平替模型测试:测试价格更低廉的平替模型,看它们是否能达到相同的评测标准。
结语
正如晓辉博士所说:“有实验就要有对比。”优秀的 AI 协作不是盲目地去指挥 AI,也不是毫无章法地反复调整。像管理团队一样,懂得“偷懒”并建立起一套“不干预建基准 -> 引入对照评估性价比 -> 固化降本稳定输出”的评测体系,才是跨入 AI 进阶协作的有效路径。
Make your daily reading actually fit you.A daily brief built from the sources you follow. Get started free
00:00 / 00:00