Advertisement

LLM4Decompile: Decompiling Binary Code with Large Language Models

阅读量:

本篇文章属于LLM系列论述,旨在对《LLM4Decompile: Decompiling Binary Code with Large Language Models __ 》这一文献进行语言转换处理。

LLM4Decompile:用大型语言模型分解二进制代码

  • 摘要
    • 1 引言
    • 2 相关研究
    • 3 LLM4Decompile
    • 4 实验分析
    • 5 混淆性探讨
    • 6 总结
    • 局限性分析

摘要内容提炼

反编译的核心目标是将二进制格式的代码转化为高级语言形式的源代码,然而诸如Ghidra等传统工具在实际应用中常常生成难以理解与运行的输出。受到大型语言模型(LLM)技术不断发展的启发,我们开发了LLM4Decompile,这是首个且规模最大的开源LLM系列(参数范围从1.3B到33B),专门用于实现二进制代码的反编译任务。我们在LLM训练流程方面进行了多项优化,并引入了LLM4Decompile-End模型,该模型可以直接处理二进制文件并完成反编译操作。实验结果显示,在HumanEval和ExeBeach这两个基准测试中,所构建的模型在性能上超越了GPT-4o和Ghidra超过100%。此外,我们还对常规细化方法进行了改进,并将其应用于LLM4Decompile Ref模型的微调过程中,使这些模型能够有效优化Ghidr

全部评论 (0)

还没有任何评论哟~