Skip to main content
QUICK REVIEW

[论文解读] The Universal NFT Vector Database: A Scaleable Vector Database for NFT Similarity Matching

Samrat Smrutiranjan Sahoo, Nitin Paul|arXiv (Cornell University)|Mar 23, 2023
Conservation Techniques and Studies被引用 5
一句话总结

本文提出了一种基于云的、与硬件无关的向量数据库,通过使用RegNetY-080将NFT表示为2016维嵌入向量,实现对NFT的可扩展相似性匹配。通过Alchemy和Pinecone索引ERC-721合约中的NFT媒体,该系统实现了通过图形用户界面进行高效相似性搜索与可视化,显著提升了NFT唯一性检测能力,并突破了链上限制,增强了数据可访问性。

ABSTRACT

Non-Fungible Tokens (NFTs) are a type of digital asset that represents a proof of ownership over a particular digital item such as art, music, or real estate. Due to the non-fungible nature of NFTs, duplicate tokens should not possess the same value. However, with the surge of new blockchains and a massive influx of NFTs being created, a wealth of NFT data is being generated without a method of tracking similarity. This enables people to create almost identical NFTs by changing one pixel or one byte of data. Despite the similarity among NFTs, each NFT is assigned a completely different token ID. To address the NFT duplication issue, we developed a modular, easily-extendable, hardware-agnostic, cloud-centered NFT processing system that represents NFTs as vectors. We established a database containing a vector representation of the NFTs in accordance with the Ethereum Request for Comment 721 (ERC-721) token standards to initiate the process of aggregating NFT data from various blockchains. Finally, we developed an NFT visualization dashboard application with a user-friendly graphical user interface (GUI) to provide non-technical users access to the aggregated NFT data. The Universal NFT Vector Database is an off-chain framework for NFT data aggregation based on similarity, which provides an organized way to query and analyze NFT data that was previously unavailable through on-chain solutions.

研究动机与目标

  • 解决尽管声称具有密码学唯一性,但缺乏可靠机制来检测NFT重复的问题。
  • 开发一种模块化、与硬件无关、以云为中心的系统,用于跨区块链聚合和标准化NFT数据。
  • 利用从图像媒体生成的向量嵌入,实现对NFT的可扩展相似性匹配。
  • 为研究人员和非技术用户提供一个用户友好的Web界面,用于查询和可视化NFT相似性数据。
  • 为NFT唯一性保障奠定基础,并支持未来数字资产认证领域的创新。

提出的方法

  • 使用Graph Protocol提取ERC-721合约数据,实现去中心化查询。
  • 通过Alchemy的NFT基础设施收集单个NFT的元数据和媒体URL。
  • 使用RegNetY-080模型生成2016维图像嵌入,实现向量表示。
  • 将NFT向量存储在Pinecone(一种托管向量数据库)中,以实现高效的相似性搜索。
  • 使用AWS SQS和Celery工作进程实现任务队列系统,支持水平扩展并卸载处理负载。
  • 在Google Cloud Run和Firebase上使用无服务器函数部署公开的搜索与可视化API,并在可视化中使用t-SNE进行2D降维。

实验结果

研究问题

  • RQ1如何系统性地将NFT表示为向量,以实现在大规模NFT集合中可扩展的相似性匹配?
  • RQ2何种架构能够实现对跨多个区块链的NFT元数据和媒体的高效、水平可扩展处理?
  • RQ3链下向量数据库在检测NFT重复和确保唯一性方面,如何优于链上解决方案?
  • RQ4模块化、云原生系统在多于NFT的未来数字资产用例中,其可扩展性能够达到何种程度?
  • RQ5非技术用户如何通过直观的可视化和搜索界面有效与复杂的NFT相似性数据进行交互?

主要发现

  • 系统成功使用RegNetY-080嵌入向量从ERC-721合约中摄取并向量化NFT,实现了高精度的相似性匹配。
  • 使用Pinecone作为托管向量数据库,消除了对底层基础设施管理的需求,提升了系统的可维护性和可扩展性。
  • 采用AWS SQS与Celery工作进程的任务队列架构支持水平扩展并实现了高效的负载分发,防止了API过载。
  • 搜索API通过查询图像向量与数据库中索引的NFT向量之间的余弦距离,实现了实时相似性搜索。
  • 可视化API通过t-SNE将高维向量有效降维至2D,实现了对NFT相似性聚类的直观探索。
  • Web应用程序的图形用户界面为非技术用户提供了对NFT相似性数据、指标和搜索功能的直接访问,显著提升了可用性与研究可及性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。