铭鸿体育资讯网

大厂算法的周四 一周又快过去了,只是todolist堆积成山,周五要评测的模型效

大厂算法的周四
一周又快过去了,只是todolist堆积成山,周五要评测的模型效果还没调好,不那么轻松。今天用上ds v4.1了,速度真的很快,干活效率又要提升几倍,最近其它模型体感太慢了,确实是骂多变笨了,v4.1算是及时救场
上午离线跑评,评估agent不太稳定,虽然确实发现了新模型的几类问题,但有一些波动还是归因于后续链路效果问题。先针对性补上一部分样本,今天大概只能迭代一两轮就要输出结果
12:00 朋友睡过头,今天饭局推到明天

下午简单梳理周报材料,周会同步模型训练和新agent能力接入进度,结果导向会有评测佐证
这周反复修了几轮样本,发现下次还是不能偷懒,一些脏数据的污染很容易把模型跑崩[笑哭]
会后顺带把下游新能力给接入适配了,上到测试环境自评。回端的能力要接入记忆模块,拖到周四终于准备启动,结果居然是启动最早的一个,周围同事的工期都排的满满当当。准备先工程化接入,如何使用后续再说
晚上跑了几轮gsb,临时纠正一些比较明显的badcase续训几轮,希望明天送评有比较好的结果

研究GPT‑6 Astra带来的Agent范式上的变化:
1. 过去 Agent 靠外部代码写循环逻辑,模型只负责单步思考;现在模型内部自带完整 Agent 闭环,规划、执行、校验、复盘都在模型推理里完成
2. 以前工具调用属于额外插件,长任务容易记不住目标、陷入死循环;Astra 拿到任务目标就可以自己拆分子任务、选工具、处理出错,支持并行调用工具
3. 反思校验不再靠提示词强制要求,是模型原生能力,遇到问题会自动回溯修正
4. 评测标准变了,不再只看单轮回答好不好,重点看整体任务能不能做完、需要人介入多少次
5. 底层用 MoE 稀疏架构,自带电脑操作能力和任务记忆,避免长任务失忆

今天还和同事讨论,当下的工作模式,依旧停留在监督AI干活的阶段。会不会正是因为当前搭建的系统规模不够大、布局也不够宏观,才只能埋头抠一个个细碎的细节?

大厂 互联网大厂 大模型 人工智能 AI AI进化生活howto ai 理性讨论 程序员