EconPapers    
Economics at your fingertips  
 

BIM-Specific Language-Model Pipelines for IFC Code Generation and Building Component Question Answering: A Full-Corpus Comparison of Zero-Shot, RAG, and Supervised Fine-Tuning

Marcus Reed and Julia Zhang

Global Journal of Science & Innovation, 2026, vol. 3, issue 1, 45-64

Abstract: Natural-language access to Building Information Modeling (BIM) requires two complementary capabilities: generating structurally correct Industry Foundation Classes (IFC) code and answering questions about building entities, properties, constraints, materials, and interoperability workflows. This study compares zero-shot generation, retrieval-augmented generation (RAG), and supervised fine-tuning on the 42,680-record IFC-BIM High-Quality Alpaca corpus. A deterministic family-stratified 80/10/10 split assigned every record to training, validation, or testing. The corpus comprised 28,513 unique 36-statement IfcWall DATA fragments and 14,167 question-answer records distributed across 14 observed families. All three approaches used the same task-specific output constraints, so the comparison isolates the source of adaptation rather than changes in grammar. On 2,852 held-out code instructions, zero-shot generation achieved 0.18% pass@1 and 54.97% mean field accuracy. Top-1 RAG reached 68.62% pass@1 and 95.51% field accuracy, while the fine-tuned generator reached 100% on both measures. RAG errors were limited to the non-literal LoadBearing and IsExternal Boolean fields; majority voting over five retrieved neighbors increased pass@1 to 86.01%. On 1,417 held-out component questions, RAG produced the highest token F1 (85.19%), ROUGE-L (83.52%), and formal-constraint expression accuracy (52.38%). Fine-tuning produced the highest structured field accuracy (93.77%), exact match (60.83%), and IFC-term precision (89.13%). The findings show that supervised adaptation is decisive for regular closed-schema code generation, whereas retrieval remains valuable for detailed explanations and rare symbolic expressions. A practical BIM assistant should combine supervised routing, evidence retrieval, schema-constrained decoding, and executable validation rather than applying one adaptation mechanism to every task.

Keywords: Building information modeling; Industry Foundation Classes; large language models; retrieval-augmented generation; supervised fine-tuning; code generation; question answering; IFC validation (search for similar items in EconPapers)
Date: 2026
References: Add references at CitEc
Citations:

Downloads: (external link)
https://pinnaclepubs.com/index.php/GJSI/article/view/975/935 (application/pdf)

Related works:
This item may be available elsewhere in EconPapers: Search for items with the same title.

Export reference: BibTeX RIS (EndNote, ProCite, RefMan) HTML/Text

Persistent link: https://EconPapers.repec.org/RePEc:dba:gjsiaa:v:3:y:2026:i:1:p:45-64

Access Statistics for this article

More articles in Global Journal of Science & Innovation from Pinnacle Academic Press
Bibliographic data for series maintained by Joseph Clark ().

 
Page updated 2026-07-29
Handle: RePEc:dba:gjsiaa:v:3:y:2026:i:1:p:45-64