Magic 宣称其预训练配方比主流开源权重基座模型的计算效率高出一个数量级:用约 1/50 的 FLOPs 就匹配了 DeepSeek V4 Pro Base,相当于 GPT-3 预训练算力的一半、在 GB200 上约 50 万美元;继续把规模放大 10 倍(约 400 万美元)之后,在困惑度评测上有意义地超过所有公开可得的开源基座模型。团队用 bits-per-byte 这一对分词器差异做归一化的指标,在私有代码库、近期低引用论文与私有数学题的思维链上评估泛化,并做去重过滤;为避免模型「学会自家解析器」,评测集使用了与预训练管线不同的解析与 OCR 流程,还与合作方 Fireworks 交叉验证 baseline logprobs。团队认为预训练、智能体强化学习与长上下文三者足以构建超人编码智能体并自动化 AI 研发。