[論文レビュー] AptaFind: A lightweight local interface for automated aptamer curation from scientific literature
AptaFindは局所モデルと決定論的正規表現を組み合わせ、文献からアプタマー データを三層のオンデバイスパイプラインでキュレーションする。全層で約84%のカバレッジ、約953 targets/hourの処理速度。
Aptamer researchers face a literature landscape scattered across publications, supplements, and databases, with each search consuming hours that could be spent at the bench. AptaFind transforms this navigation problem through a three-tier intelligence architecture that recognizes research mining is a spectrum, not a binary success or failure. The system delivers direct sequence extraction when possible, curated research leads when extraction fails, and exhaustive literature discovery for additional confidence. By combining local language models for semantic understanding with deterministic algorithms for reliability, AptaFind operates without cloud dependencies or subscription barriers. Validation across 300 University of Texas Aptamer Database targets demonstrates 84 % with some literature found, 84 % with curated research leads, and 79 % with a direct sequence extraction, at a laptop-compute rate of over 900 targets an hour. The platform proves that even when direct sequence extraction fails, automation can still deliver the actionable intelligence researchers need by rapidly narrowing the search to high quality references.
研究の動機と目的
- 散在するアプタマー文献の問題を解決し、手動キュレーションの労力を削減する。
- 信頼性のための決定論的パーシングを組み合わせたローカルでクラウドフリーなパイプラインを開発する。
- 直接配列、キュレーション済リード、網羅的文献の三層出力を提供し、精度とカバレージのバランスを取る。
- UTデータベースのターゲットを用いてアプローチを検証し、層間の性能を定量化する。
- プライバシーと再現性を重視したオープンソースソフトウェアを提供する。
提案手法
- 直接配列抽出(Tier 1)、キュレーション済リード(Tier 2)、網羅的文献発見(Tier 3)の三層インテリジェンスアーキテクチャを統合する。
- デバイス上で処理可能な局所1BパラメータのLlama3.2モデルを用いて意味理解を行う。
- LMガイダンスと決定論的な正規表現パイプライン(Minimum Agentic Flow, MAF)を組み合わせて検証、重複排除、フォーマットを実施する。
- 正規表現を用いて核酸配列(20–100 nt)と結合データ(Kd, Ki)を単位を保持したまま抽出し、LMの文脈と整合させてデータを統合する。
- ローカルPDF、PubMed/PMC、bioRxivからの多源探索を実施し、必要に応じて補足取得とブラウザ自動化を行う。
- 配列を生物学的制約(長さ20–100 nt、GC 20–80%、5’→3’の方向性)で検証し、ソース間で100%同一性の重複を排除する。

実験結果
リサーチクエスチョン
- RQ1AptaFindの三層出力は、多様な文献ソースからアプタマー情報をどれだけ効果的に捕捉できるか?
- RQ2典型的なハードウェアでの各層の回復率と処理速度はどのくらいか?
- RQ3Minimum Agentic Flowの原理は、LM中心や正規表現中心のアプローチより信頼性を向上させるか?
- RQ4有料コンテンツ、画像ベースの配列抽出、複雑な表に関する制限は何か?
- RQ5このアプローチはアプタマー以外の文献マイニング領域にも一般化できるか?
主な発見
- Tier 3(文献発見)は、100ターゲットサンプルで84.0% ± 3.5%のカバレッジを達成。
- Tier 2(研究リード)は、100ターゲットサンプルで84.0% ± 3.5%のカバレッジを達成。
- Tier 1(直接抽出)は、100ターゲットサンプルで79.3% ± 0.6%のカバレッジを達成。
- 処理速度はMac Studio(M2 Max)で約954 ± 43 targets/hour。
- MAFアプローチは、意味理解と決定論的データ処理を分離することで信頼性を向上させることを検証。
- 手法はクラウド依存を伴わず局所性を維持し、約1000ターゲット照会/時の処理と迅速な文献スクリーニングを実現する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。