雷火·竞技-280美元一单!1000名工程师教Claude写好代码

发布日期:2026-07-21 01:39:57 来源:雷火竞技 阅读量:28

  首页财产ai正文 280美元一单!1000名工程师教Claude写好代码 Anthropic费钱请约1000名外部工程师打磨Claude Code,以280美元一个使命的价格采办资深步伐员的判定,Snorkel等公司提供数据,几巨头争取真实工程数据练习模子 2026-06-08 15:45 ·微信公家号:新智元 ASI启迪录 ASI启迪录 AI投资人解读· Anthropic为打磨Claude Code,花280美元一个使命请约1000名外部工程师反馈。Snorkel从斯坦福AI Lab走出,靠弱监视思绪发迹,如今为前沿模子练习提供数据,2025年5月完成D轮融资,估值13亿美元。多家公司经由过程差别方式获取真实工程数据练习AI编程模子。 · 行业竞争激烈,各公司获取数据方式差别,效果有待不雅察数据质量及工程师反馈的靠得住性存疑。 总结:数据对于AI编程模子成长至关主要,Anthropic等公司踊跃结构。虽竞争激烈且存于危害,但把握真实工程数据及人类判定的公司有望于该范畴盘踞上风,投资时需综合评估各公司计谋与危害。内容由AI天生,仅供参考

【新智元导读】Anthropic自家工程师早已经基本不写代码了,却280美元一个使命,费钱请约1000名外部工程师,手把手教Claude Code写出好代码。喂养前沿模子的,终于还有是人。

近来,一篇报导把Claude Code的「前进秘籍」摆于了台面上。

Business Insider称,Anthropic有一个专门晋升Claude Code的项目,正于经由过程约1000名软件工程师的反馈来打磨它。

这个项目于数据公司Snorkel AI内部,代号为「Marlin」。

早于本年1月,Claude Code卖力人Boris Cherny就爆料本身已经经两个多月没手写过一行代码,一天就让Claude提交22个拉取哀求(Pull Request),前一天则提交了27个,全是模子写的。

也有报导称,Anthropic内部代码也年夜部门由AI天生。

有趣之处,正于这儿。

一边,Anthropic自家焦点工程师已经经把年夜量编码事情交给模子;另外一边,它于费钱请约1000名外部工程师,手把手教Claude Code甚么才叫「好代码」。

一小时280美元,买的究竟是甚么

按Business Insider的说法,Marlin项目请的外部工程师都有软件工程配景。他们的活儿,听上去很像一次真正的代码评审。

流程年夜致是如许。先从一份包罗数千个堆栈的清单里,选一个GitHub的代码堆栈。然后建一个PR,也就是开发者提交接码修改的那一步。再写一段提醒词,把使命讲清晰。

模子会天生两套代码,而这些外部工程师接下来要做的,是A/B测试:比力两套输出,选出更好的那一套。

每一个使命人为280美元,约莫花一小时。有些还有要及Snorkel的审核层往返好几轮。

评判的尺度,是评估出产级代码的准确性、安全性、靠得住性及可维护性。

举两个真正的例子。

于一个使命里,外部工程师让模子重构体系处置惩罚履行元数据(execution metadata)的方式,方针是让代码更清楚、更好维护,但不转变功效。

另外一个使命中,外部工程师给MLflow这个开源呆板进修平台做安全修复,针对于它加载模子时下载Python包可能呈现的号令注入缝隙。质料的要求十分明确:既要盖住号令注入,又不克不及误伤正当的pip(Python保证理器)选项。

这些使命的要求,已经经凌驾了数据标注的领域,更像是要让一个资深工程师,把脑子里那套「如许写更好」的判定原样拷给模子。

显然,Anthropic采办的并不是代码,而是资深步伐员脑筋中阿谁怎样把代码写患上更安全、更洁净的判定。

为何非患上是工程师

Anthropic为何要云云年夜费周章?由于Claude Code早就不是一个写代码的谈天框了。

Anthropic官方把它界说为项目级的AI智能体。它能读完备个代码库,跨文件做计划,直接履行修改,跑测试,再按照掉败的成果本身迭代。

Anthropic官网对于Claude Code的界说:一套能读代码库、跨文件改动、跑测试、交付已经提交接码的智能体。

这象征着它会真的动手改文件、跑使命,接触整个代码工程。

Anthropic本身也清晰这件事的份量,是以于工程博客里重复讲Claude Code的权限、沙箱及核准疲惫(approval fatigue)问题。

默许环境下,高危害文件修改或者号令履行需要用户核准;为削减重复授权带来的核准疲惫,Anthropic还有引入了sandboxing,让Claude Code于预设文件体系及收集界限内更安全地运行。

当一个AI能跑号令、能动线上代码,犯错的价钱就彻底纷歧样了。练习方针也随着变:从「写对于」进级到「写患上安全、靠得住、可维护」。

这些工具,平凡的代码语料喂不出来。它已往藏于资深工程师的代码审查里,是人传人的经验。此刻,Anthropic想经由过程招募人类编程专家,把它酿成可以采办的数据。

Snorkel,被低估的「数据军器商」

整件工作的真正主角是Snorkel。

这家公司2019年从斯坦福AI Lab走出来,押注的标的目的只有一个:真正决议呆板进修成败的是数据,而不是模子或者者算力。

Snorkel的两位主要开创人是Alex Ratner及他于斯坦福的导师Chris Ré,他们说Snorkel的焦点学术源头。

2015年,Snorkel还有只是Ratner读博时的一个「下战书项目」:与其花年夜代价雇人一条条标数据,不如用步伐及法则做「弱监视」(weak supervision),让模子不靠人工逐条标注也能学。

靠着这套思绪,Snorkel攒下60多篇论文,开源东西也被Google、Intel用了起来,直到2019年才正式拆分成公司。

Ratner的导师Chris Ré也是个狠脚色。

他是斯坦福传授、麦克阿瑟天才奖患上主、持续创业者,介入的项目曾经被苹果收购,还有开办了估值一度达50亿美元的SambaNova。

最成心思的还有是这家公司的回身。

Snorkel昔时要破的,恰是「人工标注又慢、又贵、又不稳」这个老浩劫,那时AI开发约80%的时间都耗于手工标注数据上,是以Snorkel最初的胡想,就是只管即便把人从标注里解放出来。

可到了前沿模子时代,最稀缺、最值钱的又回到了人身上,只是换成为了博士、大夫、状师、资深工程师等专家的咀嚼及判定。这家靠「罕用人」发迹的公司,如今*钱的买卖反却是构造一支昂贵的专家雄师去练习前沿AI,Marlin只是此中一单。

它的事情流,恰好也呼应了Marlin项目的需求。

Snorkel官网如许描写这套事情流:先界说使命、评分尺度及验证器,框定「甚么算好」,再跑专家评审流水线,作者、多名评审、终极裁决者层层把关,全程留痕。

Snorkel官网示意:评审打分呈现不合后经裁决解决,并写入评分尺度变动记载,每一处改动均可追溯到谁、什么时候、依据甚么。

它还有会把评估情况及数据一并搭好,让统一批使命能于差别模子版本上重复跑,患上出可复现、可比力的分数。而要让分数洁净可比,评分的人就不克不及受版本滋扰。这些外部工程师不知道本身评的是哪一个版本,缘故原由就于这儿。

报价也很能申明问题。

Snorkel一个公然的法令标的目的合同岗,每一个高质量使命10到100美元;而Marlin的软件工程使命是280美元一个、约一小时,折成时薪差未几是偕行的两倍半(Scale AI、Mercor给工程师开到每一小时110美元)。*专家周入还有能跨越3000美元。

Snorkel招募的这些外部工程师的反馈,是真的贵。

客户名单里有Google、Mistral、Anthropic。2025年5月,Snorkel完成D轮融资,估值13亿美元。

Anthropic营收卖力人Kate Jensen暗示,要把Claude的潜力彻底开释出来,患上靠引入范畴专家及人类反馈的新评估要领,Anthropic会连续及Snorkel如许的公司互助。

Snorkel、Scale、Mercor这些公司,已往被当做「标注平台」。如今它们成为了前沿模子公司暗地里的隐形供给链。

给最智慧的AI喂料的,就是如许一支散播全世界、看不见的专家雄师。

几个巨头,抢的是统一种数据

不只是Anthropic于买真实工程能力。这场竞赛,几个重磅玩家都于介入,只是打法差别。

Cursor走的是产物数据这条路。

它官方写明:用户开启隐私模式后,代码毫不会被它或者第三方用在练习;只有封闭隐私模式,它才可能用代码库数据、提醒词、编纂举动、代码片断,来改良AI功效、练习模子。

Cursor的Tab模子天天产出跨越10亿个编纂字符,哀求量比第一版涨了约100倍。更进一步的Composer,经由过程强化进修(RL)练习,让模子于年夜量代码使命情况中进修挪用编纂、搜刮等东西,处置惩罚更长周期的工程使命。

到最新的Composer 2.5,爽性主攻需要数百步操作的长周期使命。

马斯克采用的是本钱绑定/收购期权的方式。

本年2月,xAI并入SpaceX。4月尾,SpaceX拿下了年内以600亿美元收购Cursor母公司Anysphere的权力,或者者先付100亿美元做深度互助。马斯克看中的恰是Cursor手里那份全世界最活跃的真实开发者举动数据。

5月25日,马斯克于X上公布,新一代基础模子Grok V9-Medium练习完成,参数1.5T,是当宿世产模子的3倍。他特意点出,这还有是没加Cursor数据补训以前的成就,加完「编程能力会强许多」,模子估计6月中旬发布。

如许一来,V9会是*个体系性地「吃过」真实开发者举动数据的Grok。

OpenAI厥后的Codex也走上了这条路。2025年发布的Codex由codex-1驱动,OpenAI称其是于真实编码使命上经由过程强化进修练习的,方针是写出切近人类气势派头、切合PR习气的代码,还有能重复跑测试直到经由过程;每一个使命跑于预装了你代码库的断绝沙箱里。

如今Codex已经进级为OpenAI的agentic coding平台,由其前沿编码模子驱动;据Axios报导,每一周用户已经跨越500万。

他们争取的,实在是统一种工具:历程数据,只是路径各不不异。

Anthropic先有模子,缺真实开发明场的反馈,就费钱请约1000名工程师,把软件工程历程拆成可进修的数据;

Cursor先有产物及真实用户举动,也有自研的Tab、Composer等编程模子。但比拟OpenAI、Anthropic,它更缺的是通用基础模子底座及年夜范围练习算力;

马斯克缺的也是数据,爽性试图用几百亿美元去买一个连续孕育发生开发者举动数据的产物进口;

OpenAI模子、产物两端都不缺,在是本身搭沙箱,让模子于真实编码使命里经由过程强化进修一遍遍试错、测试、批改、迭代。

几家打法差别,殊途同归,都于用愈来愈靠近真实工程现场的数据,来练习本身的AI编程模子。

真实的护城河是人的咀嚼及判定

有一篇叫SWE-chat的论文,*次年夜范围收罗了真正的智能体编码会话:6000段、跨越6.3万条用户prompt、35.5万次东西挪用。

它患上出一个扎心的数字:智能体产出的代码,只有44%终极进入了用户的提交里。有一半多的运气被人删了、改了、推翻了。

SWE-chat实测:vibe coding已经占41%的会话,但智能体写的代码只有44%终极进入提交;用户于44%的交互轮次里经由过程改正、报错或者中止来反推模子输出。

这申明,HumanEval那类老的基准测试(benchmark)已经经刷到饱及,光看跑分意义不年夜了。真实的疆场,是真实开发历程里那些重复、试错、推翻重来的数据。

模子越强,越要费钱去买人类还有没被替换的那部门工具:工程直觉。

Anthropic花280美元一个使命,请来约1000名工程师做A/B投票:这套看上去粗笨的活儿,买的恰是这一点。

谁能把工程现场酿成模子能消化的数据,谁就握住了进入AI编程下一程的入场券。

参考资料:

https://www.businessinsider.com/anthropic-improve-claude-code-snorkel-data-training-contractors-2026-6%20

https://snorkel.ai/blog/anthropic-claude-aws-revolutionizing-pharma-data-analytics-with-snorkel-ai/

【本文由投资界互助伙伴微信公家号:新智元授权发布,本平台仅提供信息存储办事。】【免责声明】:本文不组成任何投资建议。市场有危害,投资需审慎。若有任何疑难,请接洽(editor@zero2ipo.com.cn)投资界处置惩罚。

-雷火·竞技