GPT-5内部测试泄露:推理能力接近博士生,但发布时间仍成谜
一份据称来自OpenAI内部的测试报告近日在业内流传,报告中详细描述了GPT-5的能力边界和当前开发进展。虽然OpenAI官方并未确认这份报告的真实性,但其中披露的信息与多方了解的情况基本吻合。
报告中最引人注目的是GPT-5的推理能力。在多个专业领域的测试中,GPT-5的表现接近博士生的水平。特别是在数学证明、物理问题求解、法律案例分析等需要深度推理的任务上,GPT-5相比GPT-4有质的飞跃。一位参与测试的研究人员在匿名论坛上称,GPT-5解出了一道困扰数学界多年的组合数学难题,虽然证明还需要人工验证,但思路是正确的。
不过,报告也指出了GPT-5目前存在的问题。模型在创意写作和开放式对话中的表现并没有预期中那么大的提升,某些情况下甚至会出现"过度思考"的问题,给出过于复杂化的回答。另外,模型的幻觉率虽然有所降低,但在处理前沿科学知识时仍然不够可靠。
发布时间方面,报告暗示GPT-5不太可能在2026年内正式发布。主要原因是安全评估工作比预期更复杂。OpenAI的安全团队对GPT-5的潜在风险进行了多轮评估,发现模型在某些极端情况下可能产生有害输出。解决这些问题需要额外的时间。
业内对这份报告的反应不一。一些研究者对GPT-5的能力提升表示兴奋,认为这预示着AGI(通用人工智能)的到来可能比预期更早。但也有声音警告说,过度追求模型能力而忽视安全问题可能会带来不可预测的后果。前OpenAI安全研究员、现Anthropic创始人Dario Amodei在社交媒体上发文称,"能力越强,责任越大",呼吁行业在追求性能的同时不要放松对安全的投入。
OpenAI CEO Sam Altman在最近的公开活动中被问及GPT-5时,只是神秘地笑了笑说"好东西值得等待"。这种既不承认也不否认的态度更加剧了外界的猜测。无论如何,GPT-5的发布将是AI行业发展的一个重要节点。