APPENDIX_LOG // 2025
非構造化データからのナレッジグラフ構築
研究ログ
論考 — 方法論
結論 — 研究成果
JAISTでの研究では、大規模な非構造化データから構造化知識を自動抽出する手法に取り組んだ。Pythonによる解析パイプラインを用いて生のテキストデータを形式的なオントロジークラスへ対応付け、複雑なドメインモデルに対する高精度な推論を可能にした。
APPENDIX_LOG // 2025
研究ログ
論考 — 方法論
結論 — 研究成果
JAISTでの研究では、大規模な非構造化データから構造化知識を自動抽出する手法に取り組んだ。Pythonによる解析パイプラインを用いて生のテキストデータを形式的なオントロジークラスへ対応付け、複雑なドメインモデルに対する高精度な推論を可能にした。
技術上の所見とフィールドノート
Kagayaki HPCクラスタでPBSジョブの運用規模を拡大するには、ジョブスクリプト生成を厳密な階層構造で管理する必要がある。そこで、ノードプールの空き状況に応じて必要資源を動的に注入するBASHベースのファクトリーパターンを実装した。これにより待機時間を22%短縮し、大規模な一括投入で起こりやすいキュー停止状態を防止した。
JAISTでの研究では、大規模な非構造化データから構造化知識を自動抽出する手法に取り組んだ。Pythonによる解析パイプラインを用いて生のテキストデータを形式的なオントロジークラスへ対応付け、複雑なドメインモデルに対する高精度な推論を可能にした。
オブジェクト保管とアクセス制御ロジックを分離する階層型権限モデルを実装した。Neon PostgreSQLを中央状態管理機構として用い、受信したACCESS_REQUEST信号をGuest、Admin、Rootの各利用者階層と照合する。検証済みの要求に対してGCSバケット層で必要時のみ権限を付与することで、テラバイト規模の研究データを保存時暗号化したまま、確認済み監査者への認可を1秒未満で処理できるようにした。
複数段階のフォールバック構成を採用した語彙検索・辞書解決エンジンを開発した。語を厳密なオントロジーエンティティとして扱い、異種データ源をまたいで表記、品詞、出典情報を共通形式へ正規化する。 検索パイプラインはO(1)のRedis L1キャッシュとPostgreSQL L2インデックスを優先し、未解決の場合のみ外部APIを順次参照することで遅延を抑える。クライアント側のゲーム入力はPrefix Tree(Trie)のバックトラッキングにより即時検証する。
APPENDIX_LOG // 2025
研究ログ
論考 — 方法論
結論 — 研究成果
JAISTでの研究では、大規模な非構造化データから構造化知識を自動抽出する手法に取り組んだ。Pythonによる解析パイプラインを用いて生のテキストデータを形式的なオントロジークラスへ対応付け、複雑なドメインモデルに対する高精度な推論を可能にした。