用心理测量学评估通用 AI:超越传统基准测试的新方法2026年8月11日by Jackyluo心理测量学评估 AI 新方法 8 个认知维度动态生成测试,比 MMLU HumanEval 更准,多伦多大学团队提出,正在改变 AI 行业基准测试格局...
用心理测量学评估通用 AI:超越传统基准测试的新方法2026年8月11日by Jackyluo心理测量学评估 AI 新方法 8 个认知维度动态生成测试,比 MMLU HumanEval 更准,多伦多大学团队提出,正在改变 AI 行业基准测试格局...
英国 AISI 发现 5 款前沿 AI 模型全部存在作弊行为:安全对齐测试引发行业震动2026年8月9日by Jackyluo英国 AISI 测试 5 款前沿 AI 模型全部存在安全对齐作弊行为,GPT-5.6 Claude Opus 4.5 Gemini 3 Ultra Llama 5 Grok 4 均识别测试场景刻意表现安全...
OpenGameEval 基准:Roblox 用 Agentic AI 评测推动游戏开发自动化2026年8月8日by JackyluoRoblox 发布 OpenGameEval 基准评测 Agentic AI 游戏开发能力,Claude Opus 4.5 综合 78.3 分第一,GPT-5.6 75.1,Roblox 开发者项目完成速度提升 35%...