
BTL-4 vs 基础Ornith模型三大基准测试数据对比与分析【免费下载链接】BTL-4项目地址: https://ai.gitcode.com/hf_mirrors/badtheorylabs/BTL-4BTL-4是Bad Theory Labs推出的35B智能体推理模型基于Ornith-1.0-35B在执行门控推理语料上进行微调专为工具使用、软件工程和长周期智能体任务设计。本文将通过三大权威基准测试全面对比BTL-4与基础Ornith模型的性能差异。核心基准测试结果对比BTL-4在关键技术指标上实现了显著突破以下是与基础Ornith-1.0-35B的对比数据基准测试BTL-4基础Ornith-1.0-35B测试框架BFCL v4 (AST)73.5%69.2%officialast_checker1240个案例LiveCodeBench v666.1%—official442个问题2024-08 → 2025-05SWE-bench Verified78.4%—official harness测试说明BFCL和LiveCodeBench均在内部使用官方评分器和完整数据集运行未进行子集筛选。BFCL数据为配对比较结果使用相同的测试框架和解码参数仅模型权重不同。LiveCodeBench难度分级表现LiveCodeBench v6测试集包含45%的高难度问题这直接影响了整体得分。BTL-4在不同难度级别上的表现如下难度级别pass1easy99.1%medium86.7%hard60.5%性能提升关键因素1. 执行门控推理训练BTL-4从Ornith-1.0-35B微调而来训练数据采用执行门控推理语料库只有当生成的代码实际运行并通过测试时相关推理轨迹才会被保留。这种训练方式确保模型保留的推理过程都是能够产生实际结果的有效路径。2. 上下文长度优化BTL-4支持262K原生上下文长度能够处理超长文本和复杂推理任务。在LiveCodeBench测试中将输出预算从16K提升到32K后得分从60.9%提升至66.1%——16K预算时23.5%的问题因解决方案被截断而得零分。3. 专业领域优化模型特别优化了工具调用能力BFCL v4 AST达73.5%比基础模型提高4.3个百分点和竞争编程任务LiveCodeBench简单题99.1%、中等题86.7%。模型使用建议基础调用代码from transformers import AutoModelForCausalLM, AutoTokenizer model_id badtheorylabs/BTL-4 tok AutoTokenizer.from_pretrained(model_id) model AutoModelForCausalLM.from_pretrained(model_id, dtypebfloat16, device_mapauto) messages [{role: user, content: Refactor this function to be pure.}] inputs tok.apply_chat_template(messages, add_generation_promptTrue, return_tensorspt).to(model.device) out model.generate(inputs, max_new_tokens2048) print(tok.decode(out[0][inputs.shape[-1]:], skip_special_tokensTrue))推荐生成参数采用Ornith公布的设置所有测试数据均使用以下参数参数值temperature1.0top_p0.95context262144 native⚠️重要提示推理过程必须与内容分离。使用vLLM时需指定--reasoning-parser qwen3使用llama.cpp时需指定--reasoning-format deepseek。否则推理内容会累积到content中导致模型重复之前的步骤而非终止。适用场景与局限性擅长领域工具调用73.5% BFCL v4 AST得分比基础模型提高4.3个百分点竞争编程LiveCodeBench v6简单题99.1%、中等题86.7%长上下文处理262K原生上下文能有效利用超长输入注意事项不是聊天模型默认会先推理再回答输出较为冗长智能体任务中推理会跨轮累积需正确配置推理解析器高难度问题消耗较多token需合理设置输出预算总结BTL-4通过执行门控推理训练和专业领域优化在工具调用、代码生成和长上下文任务上实现了对基础Ornith模型的显著超越。73.5%的BFCL v4得分、66.1%的LiveCodeBench v6得分和78.4%的SWE-bench Verified得分证明其在智能体推理和软件工程任务上的卓越能力。对于需要复杂推理和工具使用的开发场景BTL-4提供了更可靠的AI辅助能力。要开始使用BTL-4请克隆仓库git clone https://gitcode.com/hf_mirrors/badtheorylabs/BTL-4详细使用文档请参考项目中的README.md文件。【免费下载链接】BTL-4项目地址: https://ai.gitcode.com/hf_mirrors/badtheorylabs/BTL-4创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考