MBPP EvalPlus 评估报告集

DeepSeek V4 Pro 模型在 MBPP (Mostly Basic Python Programming) 基准测试上的完整评估

📋 关于本评估

本报告集包含 DeepSeek V4 Pro 模型在 MBPP EvalPlus 基准上的两次独立评估:
Proxy (代理):通过 yhapiplatform.com 的 OpenAI 兼容代理 API 进行评估
Native (原生):通过原生 API 端点进行评估

两次评估使用相同的方法论:MBPP-sanitized 数据集(378 个任务), pass@1 单次生成模式,温度参数 0.1,EvalPlus v0.2.0 框架。
对比报告展示了两种 API 访问方式之间的性能差异。

📝 反馈建议

整体评分
满意的方面
详细反馈(选填)
昵称(选填)