Jev 真的
很好玩 🎯

最近 Jev 很火,我也用它做了个小工具:小vi 灵感雷达,一个把 Jev 装进 X 信息流的 Chrome 插件。刷 X 的时候,它帮我判断哪条帖子值得花时间看、哪条能拿来做选题。

玩了一圈,想跟大家分享一下:它到底是做啥的,别人都拿它做了些什么,普通人又可以怎么玩。

夯必看
顶优先读
人上人仔细看
NPC扫一眼
拉跳过

↑ 这是我给 Jev 设计的评分档位 😆

小vi
先看我做的,再看别人做的 👇
先看看我做的小工具 👀

🌟 小 vi 灵感雷达|把刷 X 变成选题积累

欢迎大家二创、共创

小vi 把帖子喂进 Jev 机器,挑出带星标的选题卡片

每天刷到很多 AI 信息,真正难的是判断:这条值得我花时间看吗?能不能拿来实测、做成内容?

我做了一个 Chrome 插件,把 Jev 装进 X 信息流:AI 先给初评,我再用反馈告诉它什么才是“对我有用”。

插件评分卡:值得看 NPC 58 分,适合做选题 人上人 63 分,类型 AI 工具

适合谁:需要跟踪 AI 产品、找实测素材、积累选题的内容创作者和运营同学

①

它能帮我做什么?

  • 边刷边判断:正常浏览 X,可见帖子下方显示“值得看”和“适合做选题”两项评分,以及分类、小标签,如“大模型发布”“Claude”。
  • 用表情快速读懂:从低到高是“拉 → NPC → 人上人 → 顶 → 夯”,配合小 vi 表情;两项评分分别表达阅读价值和选题价值。
  • 把判断变成积累:点星标,原帖及当时的 AI 判断进入本机选题库,之后可以搜索、筛选、整理分类和标签、回到原帖。
②

第一次怎么用?

电脑端 Chrome 插件,手机端无法安装。点击下载安装包(v1.0.17,6.4MB),也可以直接发给「豆包工作」或者 AI 工具帮忙安装。

1

安装插件

解压安装包,Chrome 打开 chrome://extensions,开启“开发者模式”,点“加载已解压的扩展程序”,选择包含 manifest.json 的 x-ai-radar 文件夹。

2

连接自己的 Jev

扩展图标 →“设置”,填自己的 TypeSafe API Key,模型保留默认 jev-latest;选兴趣方向,开启“自动分析可见帖子”,点“保存并测试连接”。每人用自己的 Key 和额度,无需共享密钥。

3

照常刷 X

打开或刷新 X,插件先显示“初评”分数。点“反馈 n / 20”或扩展里的“20 条校准 · 分析记录”,进入选题快选库。

4

完成 20 条反馈

累计 20 条不同内容后,查看偏好摘要并点“确认应用”;之后遇到不准的判断仍可继续纠正。

③

20 条校准:先让 AI 认识你的选题口味

左边挑帖子 → 中间看原文和 AI 判断依据 → 右边给自己的判断。

不必迎合 AI 的分数,也要给“不感兴趣”的内容反馈,才能划清偏好边界。

分别回答两个问题:阅读上,你会跳过、扫一眼、仔细看,还是优先读/必看?选题上,你会跳过、先收藏、做实测,还是想做/马上做?可补选原因和一句说明,点击“保存反馈,下一条”。

  • 素材有两个入口:“精选 20 条”提供 16 条有真实来源的 AI 资料和 4 条广告/商业推广素材,是带出处的中文摘编,并非 X 原帖或标准答案;“我的 X 记录”来自你正常浏览时已分析的帖子,两边的反馈可以合并计数。
  • AI 判断可以展开看:已分析内容展示各维度、权重和分数贡献。精选素材没有预设 AI 分数,可以先独立判断;主动点“让 Jev 判断这条”才会调用自己的 API。
④

用起来,不断校准,保存选题

展开评分过程:各维度的模型判断和分数贡献

Jev 根据帖子文字、兴趣方向等,对相关性、新信息、信息密度、可操作性、受众价值、吸引力、可实测性等维度作判断;插件再按固定权重合成阅读分和选题分。

0–100 分是选题参考,不是事实真实性、爆款成功率,也不是 Jev 的校准概率。

我的选题库页面

日常使用:刷 X → 看初评 → 有价值就收藏 → 判断不准就反馈 → 定期回选题库挑选可实测、可展开的内容。

当前范围:只支持 X/Twitter,尚不支持小红书;读取网页正文和引用文字,不靠截图,暂不分析图片、视频内容或链接内页。平台明确标记的广告跳过自动评分;写评论、回复时隐藏浮层。

所以 Jev 到底是啥?

一个只做选择题的 AI(像个理工男)😁

小vi 在几张选项卡里盖章选中一张,旁边写着 Jev

2026 年 9 月 15 日,TypeSafe 正式推出 Jev,并把它定义为首个 System One Model (《思考,快与慢》里的 System One,主打快速做判断)。

和 ChatGPT 这类大模型不同,Jev 不跟你聊天,也不写小作文。Jev 是“只会做选择题的 AI”,它只负责快速判断:更像哪一个、程度有多高,或者“是”的概率有多大。

大模型负责展开:开放题

“帮我分析这篇文章为什么不吸引人,并重写一个更好的版本。”

Jev 负责收敛:封闭题

“这篇文章的钩子强不强?流失风险高不高?下一步该走哪条路?”

所以它不是来取代大模型的,更像是大模型旁边先帮忙做快速判断的工具:

💡 我们未来自己开发小工具之前,可以思考:如果是判断类、分流的,可以先交给性价比高的 Jev,再用大模型做进一步的分析 🧐

它只会答三种题

小vi 信息图:它只会答三种题,单选、评分、是/否

单选 Choice

从最多 255 个选项里选,需要你来列选项,Jev 判断哪一个最像,并给出每个选项的概率。

  • 老板发来一句“你看着办”:仅同步/需要回复/需要行动/存在风险
  • 客服收到一条用户反馈:产品 Bug/功能建议/退款投诉/普通咨询
  • Agent 要决定下一步:查资料/调用大模型/执行工具/转人工
Playground 实操:判断用户核心诉求,结果是退款

打分 Score

在一个刻度上给分。

  • 钩子强度:很弱/一般/较强/很强 → 高分交给大模型扩写
  • 流失风险:低/中/高/紧急 → 高风险提醒人工跟进
  • Bug 严重程度:不影响使用/轻微/严重/阻断 → 进入不同队列
Playground 实操:判断用户的流失风险

是 / 否 Noul

给出一个“是”的概率。

  • “对方说没事,是真的没事吗?”只能当娱乐提醒,不能替代沟通
  • “这段内容有明显 AI 味吗?”先批量检测,再交给大模型重写
  • “这个 Agent 操作有安全风险吗?”高风险就拦截或转人工
Playground 实操:对方说没事,是真没事吗?只有 9% 的可能真没事

我的灵感雷达用的就是打分:拉 → NPC → 人上人 → 顶 → 夯。截图可以点开放大。

它不只给答案,还告诉你有几成把握

Jev 看完一封邮件,不只会判断“是不是诈骗”,还会给出一个概率,比如:“80% 可能是诈骗。”

但它报出一个 80%,我们就能相信吗?得看实际结果。

举个例子:挑出 100 封被它评为“80% 可能是诈骗”的邮件,再逐封核实。如果大约 80 封真是诈骗,说明这批判断里的“80%”和实际情况比较吻合;如果只有 50 封是,它就把把握说大了。

这就叫“概率校准”:报出来的数字,要和长期实际表现对得上。只看一封邮件,验证不了这件事。

这个数字有什么用?做邮件工具时,你可以据此安排下一步:

  • 把握较高、错了也容易改:先自动加标签或分类。
  • 拿不准:请另一个模型再看一次。
  • 涉及转账、删除等后果较大的操作:交给人确认。

后面的诈骗邮件案例就用了这个思路:先让 Jev 快速筛一遍,判断拿不准的,再交给另一个模型复核。门槛设多高,要看实际测试结果和出错的代价,不能看到“95%”就默认可以自动执行。

TypeSafe 把训练方法叫 RLCD,目标是让这些概率更可信。想了解原理,可以看 CEO 最新演讲。

用到自己的场景前,先拿实际样本测一测:它说有几成把握,到底能不能兑现。

来看一些好玩的案例 👀

别人都拿它做了些什么

标签是这个案例主要用到的题型:单选、打分、是 / 否

用 Jev 判断聊天回复的截图
01

聊天潜台词:帮你判断怎么回复

“你今天是不是又忘了我跟你说过什么?”

Jev:她真的在问你记不记得吗?不是 93%。真实意图:想确认你在不在乎她 72%。危险等级 9 / 10。最佳动作:搜索聊天记录 91%、装死 4%……

最后一步:“危机是否解除?Yes 94%。建议动作:立即停止模型调用,不要画蛇添足。”😂 只能当娱乐,不能替代真正的沟通。

单选是 / 否

02

结合 Computer Use 做浏览器 Agent|7 秒订机票

Browser Use 的 Gregor Zunic 把网页里的可点击元素整理成动态选项,让 Jev 每一步只决定“点哪个、滚动还是结束”;需要输入文字时才调用小语言模型。Google Flights 任务约 7 秒完成。

Jev 像导航员负责决定下一步,Agent 的 Computer Use 像手负责真的去点、去填。

单选

来源:Gregor Zunic 的浏览器演示 | 项目代码

03

自动玩超级马里奥|从动作库里选动作

Faadil Shaik 没让 Jev 直接看游戏画面,而是读取模拟器里的位置、速度、敌人和地形,再从左、右、跳跃等有限动作中选一个。作者随后补充,早期版本成功率大约只有四分之一,所以它更像一个直观的技术 Demo,而不是成熟游戏智能。

单选

来源:Faadil Shaik 的 X 首发帖与 31 秒演示视频

新闻雷达:24.9 秒筛选 384 条新闻
04

新闻雷达|24.9 秒筛选 384 条新闻

这个案例把 Jev 用在公关监测的高并发判断层:系统读取当天早上的 384 条新闻,并同时判断哪些新闻与 15 个品牌相关、值得跟进,再把候选故事交给后续流程寻找记者和传播机会。

Jev 在链路里的角色:不负责撰写完整公关稿,而是并行完成“相关吗、值得追吗、适合哪个品牌”等有限判断。

是 / 否单选

来源:小红书原始演示:Jev 案例—新闻雷达

05

实时虚拟试衣|620ms 选择下一套衣服

用户直接说“换件黑裙子”等自然语言指令;系统把语音转录、当前穿搭状态和个人衣柜候选一起交给 Jev,由 Jev 快速判断下一件应该选择什么,再由图像换装模块更新画面。

商业价值:把虚拟试穿从点选式工具变成可连续对话的购物体验,可延伸到电商导购、品牌衣橱、线下门店镜和个性化搭配。

单选

来源:小红书原始演示:用 Jev 秒换试穿衣服

06

自然语言地图|一句话点亮符合条件的国家

系统把近 200 个国家作为候选项。用户输入“说法语的国家”“内陆国”“参加过二战的国家”等中文问题,Jev 会对每个国家逐一做“是 / 否”判断,给出符合条件的概率(所以不受单选最多 255 个选项的限制),并把结果直接高亮在地图上。

是 / 否

07

选题库筛选|从 600 多个选题中快速找候选

Demo 作者把 600 多个选题放进同一个候选池,再用“与大公司相关”“与 OpenAI 相关”“与中国相关”等自然语言条件快速筛选。Jev 对每个选题逐条做“是 / 否”判断,负责缩小范围和排序,人或大模型再从高概率候选中决定真正值得采用的选题。

是 / 否

来源:小红书原始演示:3 个 Demo 搞懂 Jev

08

提交代码前,先让 AI 帮忙“排雷”

程序员改完代码,可以把改动交给 Jev 快速检查:有没有不小心把密码写进代码、有没有危险的数据库操作、会不会误删测试。它一次检查多个常见风险点,并标出“有多怀疑这里有问题”。

这就像交作业前先让同桌帮忙检查错别字,但同桌不能替你交卷,最后是否提交,仍然由人决定。

是 / 否

来源:Paolo Rosson 的 PR 审查案例

Hassan 的欺诈检测测试说明
09

从一堆邮件里找出诈骗邮件

有人测试了 100 封邮件:一半正常、一半诈骗。Jev 在 1.42 秒内分完全部邮件,并给每个判断附上置信度;置信度低于 95% 的 31 封,再交给大模型 Kimi K3 仔细看。整套流程判对 96 封,总成本约 0.07 美元,其中 Jev 只花了约 0.003 美元。

单选

来源:Hassan 的欺诈检测混合管道

10

开会时,帮你判断“大家聊到哪一步了”

开会最常见的问题是:大家还在发散,没人收束;问题聊清楚了,却没人记录;或者表面同意了,其实还有分歧。这个案例让 Jev 每隔一段发言就判断一次:现在是在头脑风暴,还是已经在做决定?问题解决了吗?大家真的达成一致了吗?

它不是会议裁判,更像一个不插话的会议观察员。

单选是 / 否

来源:かねこつよし的会议状态传感器

11

社媒信息流评分|自动过滤低价值内容和“标题党”

浏览 X 时,插件实时判断每条帖子:这是有信息量的内容,还是故意引战、骗点击、广告?再用不同图案直观显示等级,低质量内容直接隐藏,不用人一条条手动屏蔽。

同理,之前看到有人开发过刷小红书的信息流屏蔽器,可以屏蔽搜索结果里不相关的部分,避免分散注意力。

🙌 这个功能,我也做了一个同款小插件,就是开头的灵感雷达。

打分

来源:Nagajyothi 的 X 信息流过滤插件

12

快速判断某个产品更新、事故报告会不会影响客户

Box 的演示里,Jev 会读一份事故报告,然后判断两件事:这件事会不会影响客户?严重程度高不高?判断完后,系统把文件放进“需要升级处理 / 继续观察 / 等待审查”等不同文件夹,同时打上对应标签。

豆包工作或飞书自动化可以负责移动文件、打标签、建待办。特别适合文件很多、分类规则明确、但人工整理很耗时的场景。

是 / 否打分

来源:Aaron Levie 的 Box 企业工作流演示

Jev 只负责判断,不负责执行,更不会替你承担后果。真的要点网页、填表单、发消息、动文件,需要豆包工作这类工具配合;而涉及钱、合同、客户承诺和个人隐私的动作,一定要停下来让人确认。

小vi 奔跑着把一个火花分发到三个方向
它为什么突然有这么多声音?

Launch Video|发布帖近 4000 万浏览的宣传视频

它的 Launch Video 快速在 X 上走红,是营销公司 Doomers 精心策划的一次发布,叙事故事和传播方式值得了解。

据 Doomers 复盘,发布帖浏览量约 3950 万,在他们追踪的 699 个产品发布案例中排名第四,甚至超过了 Anthropic 的 Claude Fable 5.1 产品发布。24 小时内等待名单注册超过 15 万。

它先用创始人的 OpenAI 履历做背书,再宣布聊天模型不适合真正自动化,最后用速度、价格和产品形态把 Jev 塑造成新范式。

它的叙事骨架

用创始人 OpenAI 研究员的背景背书

Diogo 先说自己参与创建 ChatGPT 和 RLHF,建立“我有资格指出旧范式问题”的权威。

AI 那么强,为什么还需要人的参与?

把 RLHF(用人类偏好来训练 AI)与迎合偏好、过度自信、不可靠绑定起来:会聊天,不等于能自动执行。

定义新名词,上价值

不说 Jev 是“更快的小模型”,而是创造 System One Model 这个新品类,配上新架构、新采样器、RLCD 三件套,把产品升级包装成范式切换。

Demo,展示 Jev 结构化判断的能力

同屏对比中,Jev 快速完成大量结构化判断,语言模型仍在逐字生成。观众不需要理解 benchmark,也能感受到“等待”的差异。

把技术差异压成三个传播点

输出概率决策而非文字、快近 200 倍、便宜 400 多倍(官网首页数据为 193.6 倍、444.6 倍)。宏大技术史负责制造想象力,简单数字负责被记住和转述。

主打:高效率、构建生产力

“如果你喜欢等待,请勿使用 Jev”,把开发者痛点变成笑话;“Ask your developer”改写自“Ask your doctor”。“prod, not god”“too cheap to meter”都是可直接截图、引用和二创的句子。

操盘公司|Doomers 把这一次产品发布设计成一场疯狂的传播

Doomers 案例复盘页数据

内容有争议性:让人停下来、截图和争论。Jev 本身很难用一句功能描述让大众兴奋,但它极适合被做成观点冲突:聊天 vs. 自动化、文字 vs. 决策、串行 vs. 并行、God vs. Prod。

分发策略:对不同类型博主的选择,让正确的人在同一小时看到;把画面送到最可能参与争论的人群中。

产品入口:增加 Waiting List、OpenRouter 等平台使用,把热度变成注册和使用。

Doomers 案例复盘

点开可以放大看

Doomers 做对了什么?

不从公司介绍开场

第一句话先抛出“ChatGPT 与 RLHF 的共同创造者”这张可信度牌,再问“为什么超人类聊天模型还没有带来 AGI”。

把缺点变成记忆点

整个行业都在卷“更会思考、更会写”,TypeSafe 反过来说:我们的模型不会聊天,也不会写一个字。

用长视频争夺观看时长

视频接近 3 分钟。Doomers 称,超过 2 分钟的 launch video,其中位表现是 30 秒以下视频的两倍。

把黄金首小时做成定向分发

发布后将公告 seed 给 80–100 个工程师、创始人、builder 和创作者账号,之后的全球扩散才主要依靠自然传播。

强数字 + 背书 + 生态完成第二轮扩散

“快近 200 倍、便宜 400 多倍、输出免费、响应 70–500ms”,加上 OpenAI/Meta 履历和 4000 万美元融资,再借 Vercel、Cloudflare、LangChain 和社区 Demo 扩散。

把流量沉淀成产品采用

同时承接 waitlist、公司与创始人账号关注,并借 Vercel AI Gateway 等入口降低试用门槛。

不会写代码,能用 Jev 吗?

先注册、领取 5 刀,想一些场景玩起来

普通人不需要先理解模型原理

🔒

数据安全提醒:TypeSafe 是外部第三方服务,贴进去的内容会发送到它的服务器。测试时请只用公开内容(公开帖子、新闻)或自己编的示例;不要上传公司内部聊天记录、客户反馈、用户数据、内部文档或未公开的业务信息。

1

注册并加入 waiting list

打开 TypeSafe 官网,进入 API Console 注册并申请体验。通常约一天会收到审核结果,实际时间以官方为准。

2

领取 5 美元额度

通过审核后,账号会获得 5 美元体验额度(以控制台实际显示为准)。输入约 0.042 美元/百万 token、输出免费,足够测试大量轻量判断。

3

从一个小判断开始

贴一段公开内容,提前写好几个答案选项,比如“需要回复/仅同步/有风险”。觉得结果靠谱,再生成 API Key,接进自己的脚本、表格或 Agent 工作流。

按门槛从低到高,大概有三种玩法

TypeSafe Playground 截图,标注了输入背景、提出选项和是否问题

① 完全不写代码

控制台里有个 Playground,贴一段文字、写好问题和选项,点运行就能看到每个选项的概率。可以先在这里试试看。

在 Claude Code 里询问 typesafe-ai/skills 插件的截图

② 让 AI 帮你写

用 Claude Code、Codex 这类编程 Agent,把需求用大白话讲清楚,它来写代码、调接口。TypeSafe 官方还出了插件(typesafe-ai/skills),装上之后 Agent 更懂怎么调 Jev。

灵感雷达插件弹窗:今天,又有新灵感

③ 做成顺手的小工具

浏览器插件、小网页,把判断嵌进你每天刷信息、看反馈的地方。

我是怎么做出灵感雷达的(提示词复盘)

整个过程分四步,每一步都是直接跟 AI 说人话。

① 先想清楚要判断什么 不用写代码,跟豆包聊就行

我每天在 X 上刷很多 AI 相关的帖子,想找能拿来做选题的内容。
帮我把“这条帖子值不值得看、适不适合做选题”拆成几个可以打分的维度,
每个维度写清楚什么情况算高分、什么情况算低分。
评分档位用:夯、顶、人上人、NPC、拉。

聊完我定下了两道题:值得花时间看吗?适合做选题吗?再加上新信息、信息密度、可操作性、受众价值、选题吸引力、可实测性、讨论价值这几个维度。

② 让 Agent 搭一个网页

帮我做一个网页,叫“小vi 灵感雷达”。
左边是待判断的帖子列表;中间展示帖子内容和 Jev 的判断结果,
两道题各给一个档位(夯/顶/人上人/NPC/拉),可以展开看每个维度的分数;
右边让我自己也选一次档位,可以写一句理由。
用 typesafe-sdk 调用 Jev,API Key 从环境变量读取,不要写进代码里。
只有我点“让 Jev 判断这条”时才发请求。

③ 接上 X

再做一个 Chrome 插件:我正常刷 X 时,把我看过的帖子正文收集下来,
回到网页后出现在“我的 X 记录”里。只收集公开帖子的文字,不收集图片和私信。

④ 用反馈校准它

我已经给 20 条帖子打了档位。帮我统计 Jev 和我一致的比例,
列出分歧最大的几条。再挑最多 6 条有代表性的反馈作为参考样本,
以后判断新帖子时一起发给 Jev,让它更接近我的口味。

小经验:Agent 写出来的第一版往往能跑但不好用,别怕反复跟它说“这里不对,改成……”。不断碰撞想法 💡

玩好 Jev 的关键:出好题

用了一段时间发现,Jev 判得准不准,很大程度取决于题出得好不好。官方文档里也反复强调这几点:

❌ 容易翻车的写法问题在哪✅ 改一改
重要 / 不重要标准太模糊,“重要”对谁都不一样今天必须处理(涉及投诉、线上事故)/ 本周处理 / 仅存档
Bug / 体验问题 / 功能建议边界重叠,“按钮不好点”算哪个?每个选项写一句定义:Bug=功能不按预期工作;体验问题=能用但难用;建议=想要新功能
正面 / 负面没有兜底,中性内容只能硬选正面 / 负面 / 中性 / 无法判断
相关且值得跟进吗?一道题问了两件事拆成两道是/否题:相关吗?值得跟进吗?
打 1–5 分每一档没定义,模型只能猜每档配一句话,比如我的:夯=必看,顶=优先读,人上人=仔细看,NPC=扫一眼,拉=跳过
  • 选项名和描述都会发给 Jev,所以描述要写出“它和别的选项有什么不同”。
  • 一定留一个“其他 / 以上都不是”,不然它只能硬选。
  • 两个选项容易混,就写清楚“包括什么、不包括什么”,再给个例子。

可以直接套这个模板:

问题:这条用户反馈应该交给哪个团队?
选项:
- 退换货:尺码不对、商品损坏、想换货(不包括:物流延迟)
- 物流:没收到、配送慢、包裹丢失
- 账单:扣费、发票、支付失败
- 其他:以上都不符合

为什么一定要 Jev,让豆包“只回答 A/B/C”不也行吗?

我一开始也这么想。量小的时候确实可以,而且大模型还能顺便告诉你理由。但真用到每天几百几千条,差别就出来了:

让大模型只回答 A/B/CJev
速度逐字生成,量大了要排队70–500ms,一次还能问好几道题(官方数据)
成本按输入和输出计费,全量跑很贵输出免费,输入约 0.042 美元/百万 token
把握度它说“我很确定”不一定可信每个选项都有概率,而且是校准过的
稳定性同一条内容问两次,答案可能不一样相似的输入给出相似的结果(官方说法)
给理由能,还能展开分析不能,只给判断

“把握度”这一点最容易被忽略。经过 RLHF 训练的聊天模型,概率往往会变得没那么准,OpenAI 在 GPT-4 技术报告里就放过一张对比图。模型说得再笃定,你也很难拿它来设自动执行的门槛。

所以我的用法是:量小、需要理由,用豆包;量大、要快、要按把握度自动分流,用 Jev。两个还能搭着用:Jev 先筛一遍,拿不准的再交给大模型,就像前面那个诈骗邮件的案例。

冷静看

它不是万能的

局限和反方观点

写到这里有点像安利文了,也说说我看到的另一面:

  • 那些“快 200 倍、便宜 400 倍”的数字,主要是官方自己测的。TechCrunch 报道的第三方测试里,有一项邮件分类,Gemini 准确率更高,只是贵 10–20 倍。
  • 官方自己也承认:不擅长需要多步推理的问题,也没在专业领域专门训练过。
  • 题出得不好,它就判不准。它的上限,很大程度是出题的人决定的。
  • 公司刚成立,还在排队放号,价格和稳定性都说不准。重要的流程别只押在一家身上。

比如,用它来筛简历?

技术上完全能做:几秒筛完几百份。但我觉得这恰恰是最不该直接交给它的事:

  • 偏见会被放大。过去招聘里的偏好(学校、性别、年龄、工作空档)可能被当成“规律”。亚马逊 2018 年就因为 AI 招聘工具歧视女性求职者,把整个项目停掉了。
  • 整体准,不代表对每个人都公平。它说“80% 不合适”,可能对某类人群很准,对另一类人群偏差很大。
  • 被刷掉的人不知道为什么。Jev 只给判断不给理由,候选人没法申诉,HR 也说不清。
  • 法律上也有要求。《个人信息保护法》第二十四条要求自动化决策透明、结果公平公正;对个人权益有重大影响的决定,个人有权要求说明,也有权拒绝仅通过自动化决策作出的决定。

更稳妥的做法:只让它做“硬条件核对”,只辅助、不淘汰;被判“不合适”的简历,一定要有人再看一遍。

更高一层:这对我们意味着什么?

玩完 Jev,我最大的几个感受:

判断这件事,变得几乎不要钱了

以前让 AI 把每条评论、每封邮件、每条帖子都看一遍,太贵也太慢;现在可以“全量判断”。很多过去不划算的产品,可能会重新变得可行。

AI 会越来越“看不见”

它不一定是一个聊天框,而是藏在产品里的一个个小判断,官方管它叫“智能 if 语句”。

模型开始分工

快的负责判断和分流,强的负责思考和生成,人负责定规则和兜底。以后搭 Agent,可能更像在组一支小队伍。

“会出题”会变成一种新能力

定义好选项和标准,本质上是把自己的经验和判断标准写清楚。这件事不需要会写代码,但很需要懂业务。

← → 翻页 · K 播放 / 暂停 · Esc 退出