查看: 6138| 回复: 21
跳转到指定楼层
上一主题 下一主题
收起左侧

[AI Infra] 初创公司招聘founding engineer(OS 底层/binary/GPU方向)

   
👏 7
✅ 3
全局:

注册一亩三分地论坛,查看更多干货!

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x
我是发考题的版主,老人了,在地里很多年,大家应该不少人认识我。这个帖子不匿名——一来匿不住,二来招 founding engineer 这种事,我觉得也不该匿名。
先聊一下我的观察。这两年在版面上,明显感觉做 infra、做底层的同学有点茫然:AI 把应用层的代码越写越好,连带着很多人怀疑,自己搞了十几年的 OS、编译器、runtime、性能调优,是不是也快被吃掉了。我的判断正好相反,而且我用自己的钱和职业生涯押了这个判断:AI 越能写代码,runtime 的 ground truth 越值钱。 AI coding 本质上是个开环系统——模型能生成代码,但它看不见执行:不知道内存实际怎么用的,不知道为什么 crash,不知道两次运行为什么结果不一样。生成的代码量越大,验证和诊断的缺口就越大。谁来给这个开环系统提供 feedback loop?只能是对执行层有真正理解的系统——和造这些系统的人。这就是为什么我认为在我们公司可以保证底层的这些能力不会被 AI 淘汰,反而会成为 AI 时代最稀缺的东西之一。
背景: 我前两年辞掉了UMass的tenure(之前在 UMass 做教授,做了小二十年 systems research,SOSP/PLDI/OOPSLA 这些会,手里 11 个专利), 中间在 ByteDance 和 XPeng 带过训练基础设施, 现在全职做自己的公司 Teyon。一句话:GPU 集群的 flight recorder——确定性录制回放引擎,<1% 开销、零代码改动,训练任务挂了原地恢复,并且能自动查出根因。往大了说,我们做的就是给 AI 基础设施(包括 AI coding)提供那个缺失的 runtime feedback loop。Pre-seed 阶段,第一批钱已经进来,demo 能跑,秋天产品落地。
找什么人: founding engineer,一到两个。硬性要求只有一条——对 OS 底层/binary层面有真感情、真功夫,以下方向熟悉其一即可:linker/loader 和 ELF、ptrace/eBPF、syscall interception、memory allocator、CUDA runtime/driver 层、compiler backend、动态插桩。加分项:玩过 record & replay、做过 GPU 训练/推理框架、debug 过别人 debug 不出来的东西。
待遇:founding-level 的股份 + 现金,具体面聊,不在论坛喊数字。能承诺的是:你写的每一行都在核心引擎上,没有 legacy,没有汇报层级,直接和两个做了一辈子 systems 的人一起干。
感兴趣的,可以直接给我投简历:tongping@teyon.ai。如果匹配,我们会reply back。 我 LinkedIn(最近发的东西能让你快速了解我们在做什么):https://www.linkedin.com/in/tongping/。

评分

参与人数 4大米 +25 收起 理由
yytellmey + 2 给你点个赞!
junguanghe + 2 给你点个赞!
instant_dev + 20 很有用的信息!
ZhaoAzhaoFriend + 1 谢谢分享!

查看全部评分


上一篇:开发了一款语音vibecoding工具,操作简单,可连接手机躺平式办公
下一篇:🔥 整理一下最近接的AI咨询
全局:
哇,楼主从教职走出来呀,不容易哦
回复

使用道具 举报

推荐
 楼主| tongpingliu 2026-7-28 23:08:01 来自APP | 只看该作者
全局:
匿名用户 发表于 2026-07-28 08:01:03
原来是个招人贴 住楼主公司越做越好
但是如果AI进化速度过快 那结论可能就不同了
在我看来,只要代码还是人提的需求,那么人和AI之间的semantic gap就会一直存在。 也就是说,AI总是不可能完全明白人的意思,或者人有时也不明白自己的需求。现在的趋势是越大的项目AI出错的概率越大,这个是没有办法改变的。
回复

使用道具 举报

推荐
 楼主| tongpingliu 2026-7-29 22:26:31 | 只看该作者
全局:
Mark6 发表于 2026-7-28 23:46
请问楼主你们最后的盈利模式是什么?reliability确实很重要,尤其cluster大,10%的提高都是xx million doll ...

这个是个很好的问题,也是VC天天问的问题:

1. 盈利模式:对标 observability 赛道。 CPU 时代企业每年花几百万美金买 Datadog/Dynatrace 监控软件,GPU 时代这条预算线才刚形成,而且单价更高——因为宕机的分母是 GPU-hour。我们卖企业版软件订阅,买单人是管 GPU 预算的 infra VP。定价逻辑很朴素:每月给客户一份报告,列出每次故障实际省下的 GPU-hour(按客户自己的历史 baseline、事先约定的费率算),我们收的是节省额的一个零头。你说的"10% 就是 xx million"正是这个空间——我们不需要拿走 10%,一小部分就是很健康的合同额。
. Waral dи,
2.  先澄清一个前提:我没说过我们是开源 library。 核心引擎(record-replay、恢复、根因分析)是闭源的企业软件——这也是我们专利和护城河所在。未来可能会把 SDK/接入层这类外围开源出来降低试用门槛,但那是 adoption 手段的选项之一,不是商业模式本体——所以"开源赚不赚钱"这个问题对我们不成立。退一步说,就算走开源路线,Spark→Databricks、Terraform→HashiCorp 也早证明了那条路能走通,只是我们不需要靠它。

3. 我们从头到尾不"管理"任何人的 cluster——这是对部署模式的误解。 产品是部署在客户自己环境里的软件层(库 + daemon + 控制面,on-prem/VPC),数据不出客户边界,和 Datadog agent、self-hosted Sentry 是同一种存在方式。第三方做 reliability/监控软件这个生意本身,已经被验证三十年了,从来不需要接管客户的基础设施。

另外说一句,这三个问题恰好就是我们 founding engineer 每天要一起想的问题——对这类"技术 + 生意"双重难题有兴趣的,欢迎直接来聊。
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-FAYVC  2026-7-28 23:01:03
原来是个招人贴 住楼主公司越做越好
但是如果AI进化速度过快 那结论可能就不同了
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-FAYVC  2026-7-28 23:09:15
tongpingliu 发表于 2026-7-28 10:08
在我看来,只要代码还是人提的需求,那么人和AI之间的semantic gap就会一直存在。 也就是说,AI总是不可能 ...
.
所以这个是个人观点
目前没有办法证实的 不过这个东西预测也没意义 能预测未来的话 早就财富自由了
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-TTATK  2026-7-28 23:29:40
同意👍,我个人体验,AI很擅长忽悠水货
回复

使用道具 举报

全局:
赞,对一帮扯淡卖 token的销售,我还是更相信学术,谢谢分享您的看法。

工作还是算了,我这种写业务代码的还是别凑热闹了
回复

使用道具 举报

全局:
赞👍
请问工作地点是
回复

使用道具 举报

🔗
 楼主| tongpingliu 2026-7-29 00:08:25 | 只看该作者
全局:

今年下半年remote,后面是湾区(具体位置待定啊)。
回复

使用道具 举报

地里匿名用户
🔗
匿名用户-YNWDZ  2026-7-29 00:46:12 来自APP
可以remote吗?
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 注册账号
隐私提醒:
  • ☑ 禁止发布广告,拉群,贴个人联系方式:找人请去🔗同学同事飞友,拉群请去🔗拉群结伴,广告请去🔗跳蚤市场,和 🔗租房广告|找室友
  • ☑ 论坛内容在发帖 30 分钟内可以编辑,过后则不能删帖。为防止被骚扰甚至人肉,不要公开留微信等联系方式,如有需求请以论坛私信方式发送。
  • ☑ 干货版块可免费使用 🔗超级匿名:面经(美国面经、中国面经、数科面经、PM面经),抖包袱(美国、中国)和录取汇报、定位选校版
  • ☑ 查阅全站 🔗各种匿名方法

本版积分规则

>
快速回复 返回顶部 返回列表