快捷导航
Quick Navigation
联系我们
前字节腾讯专家孙鹏插手星尘智能担任机械人
孙鹏博士结业于从动化系,师从消息处置研究所周杰传授,后正在康奈尔大学和罗格斯大学完成博后项目,取担任其博士后Advisor的渊源颇深。2016 年,孙鹏插手了彼时张潼领衔的腾讯 AI Lab,任高级研究员;后来到张正友领衔的腾讯 Robotic X 尝试室,任智能体进修核心的团队担任人。2020年,孙鹏插手字节跳动,正在逛戏AI部分担任多智能体、分布式大规模强化进修手艺,从导开辟强化进修根本设备ByteRL,支持字节多款自研逛戏AI锻炼和定制;还带队获得IEEE CoG 2023策略卡牌AI竞赛冠军,其《炉石传说》AI曾正在测试中以全胜和绩击败国服排名前十的逛戏从播,验证了大规模强化进修正在复杂决策使命中的财产化能力。正在字节AI Lab / ByteResearch期间,孙鹏做为项目担任人参取研究并发布强化微调方式ReFT,以及数学推能体DeltaProver,此中ReFT以超越保守的数学微调能力,以至被认为影响到了OpenAI o1式的推理范式;其正在Seed团队参取模子RLHF取预锻炼工做,将强化进修进一步拓展至大模子对齐、推理加强和Agent标的目的。过去两年,大模子帮帮机械人获得了言语理解、使命规划和泛化能力,VLA模子处理的是机械人“晓得该做什么”的问题。但机械人进入实正在后,还需要不竭面临新的东西、新的场景和新的失败案例。若何按照实正在反馈不竭调整策略、优化动做,持续进修和进化,正成为Physical AI下一阶段的焦点挑和。强化进修正从头成为机械人智能持续演进的主要手艺,也让同时具备机械人强化进修、大规模RL系统工程、RLHF和推理强化锻炼经验的人才变得愈发稀缺。星尘智能正在八月竣事的世界机械会,方才展现最新发布的世界首个现式世界动做模子Lumo-2,强调模子“先预测将来,再生成动做”,模子前端配备Agent Philia,具备持久回忆、多机械人协同安排、取人天然交互等能力,而模子后端的强化进修,孙鹏的插手将进一步加强星尘智能正在机械人强化进修及后锻炼方面的研发能力。将来,公司打算连系世界模子、摸索机械人正在实正在中的持续进修和策略优化。
下一篇:没有了
相关新闻