<?xml version='1.0' encoding='utf-8'?>
<?xml-stylesheet type="text/xsl" href="/v2/static/oai2.xsl"?>
<OAI-PMH xmlns="http://www.openarchives.org/OAI/2.0/" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation="http://www.openarchives.org/OAI/2.0/ http://www.openarchives.org/OAI/2.0/OAI-PMH.xsd">
  <responseDate>2026-10-11T21:29:03Z</responseDate>
  <request identifier="oai:figshare.com:article/33716782" metadataPrefix="oai_dc" verb="GetRecord">https://api.figshare.com/v2/oai</request>
  <GetRecord>
    <record>
      <header>
        <identifier>oai:figshare.com:article/33716782</identifier>
        <datestamp>2026-09-14T01:05:32Z</datestamp>
        <setSpec>category_28864</setSpec>
        <setSpec>item_type_3</setSpec>
        <setSpec>month_year_09_2026</setSpec>
      </header>
      <metadata>
        <oai_dc:dc xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"  xmlns:oai_dc="http://www.openarchives.org/OAI/2.0/oai_dc/" xmlns:dc="http://purl.org/dc/elements/1.1/" xsi:schemaLocation="http://www.openarchives.org/OAI/2.0/oai_dc/ http://www.openarchives.org/OAI/2.0/oai_dc.xsd">
          <dc:title>ERBD and SBD: Bill Image Risk Datasets for Explainable Risk Detection</dc:title>
          <dc:creator>Chenghao Peng (10095112)</dc:creator>
          <dc:subject>Artificial intelligence not elsewhere classified</dc:subject>
          <dc:subject>Bill image risk detection; Document understanding; Multimodal data; Visual-semantic reasoning; Graph reasoning; Risk detection; Evidence localization; OCR; Business documents; Explainable artificial intelligence</dc:subject>
          <dc:description>&lt;p dir="ltr"&gt;&lt;b&gt;ERBD (Expense Reimbursement Bill Risk Dataset) and SBD (Settlement Bill Risk Dataset) are two multimodal business-document datasets developed for bill image risk detection and explainable evidence localization. ERBD contains 12,480 samples from reimbursement scenarios, including invoices, receipts, reimbursement forms, and expense lists. SBD contains 9,620 samples from settlement scenarios, including invoices, settlement statements, payment vouchers, and reconciliation statements.&lt;/b&gt;&lt;/p&gt;&lt;p dir="ltr"&gt;&lt;b&gt;Both datasets contain five document-level categories: normal, amount inconsistency, entity inconsistency, identifier/QR-code inconsistency, and seal-support inconsistency. ERBD contains 5,720 normal samples, 2,360 amount-inconsistency samples, 1,720 entity-inconsistency samples, 1,420 identifier/QR-code inconsistency samples, and 1,260 seal-support inconsistency samples. SBD contains 4,140, 1,850, 1,600, 1,050, and 980 samples in the corresponding categories.&lt;/b&gt;&lt;/p&gt;&lt;p dir="ltr"&gt;&lt;b&gt;The datasets are divided into training, validation, and test subsets. ERBD contains 8,736 training samples, 1,248 validation samples, and 2,496 test samples. SBD contains 6,734 training samples, 962 validation samples, and 1,924 test samples. Samples are grouped by source document, enterprise entity, and template family before partitioning, and derived samples remain in the same group as their source documents.&lt;/b&gt;&lt;/p&gt;&lt;p dir="ltr"&gt;&lt;b&gt;The data support multimodal document analysis using visual appearance, OCR text semantics, two-dimensional layout information, element roles, and structured relations among bill elements. The annotations include document-level risk labels, evidence regions, and relation-level evidence. Element relations cover spatial adjacency, semantic dependency, and business consistency. These annotations support both document-level risk classification and explainable risk-evidence localization.&lt;/b&gt;&lt;/p&gt;&lt;p dir="ltr"&gt;&lt;b&gt;Approximately 80% of the samples originate from real business bills, while approximately 20% are controlled samples derived from source documents through targeted relation modifications. Sensitive information was anonymized for authorized research use.&lt;/b&gt;&lt;/p&gt;&lt;p dir="ltr"&gt;&lt;b&gt;The datasets were used to evaluate VSEA-RiskNet, a visual-semantic element association and consistency reasoning framework for explainable bill image risk detection. Evaluation metrics include Accuracy, Macro-F1, Risk-F1, AUC, and Evidence-F1.&lt;/b&gt;&lt;/p&gt;</dc:description>
          <dc:date>2026-09-14T01:05:32Z</dc:date>
          <dc:type>Dataset</dc:type>
          <dc:type>Dataset</dc:type>
          <dc:identifier>10.6084/m9.figshare.33716782.v1</dc:identifier>
          <dc:relation>https://figshare.com/articles/dataset/ERBD_and_SBD_Bill_Image_Risk_Datasets_for_Explainable_Risk_Detection/33716782</dc:relation>
          <dc:rights>CC BY 4.0</dc:rights>
        </oai_dc:dc>
      </metadata>
    </record>
  </GetRecord>
</OAI-PMH>
