2025-04-09 arXiv論文リスト(cs.AI)
About
arXivに掲載されたcs.AIの論文を検索し、一部をリスト化したものです。
※AIによってAbstractを日本語に翻訳しており、内容に誤りがある可能性があります。
リスト件数: 73件
リストから抽出されたキーワード: Multimodal Learning, Causal Inference, Adaptive Learning
Zeus: Zero-shot LLM Instruction for Union Segmentation in Multimodal Medical Imaging
http://arxiv.org/abs/2504.07336v1
Siyuan Dai, Kai Ye, Guodong Liu, Haoteng Tang, Liang Zhan
医療画像のセグメンテーションは、UNetベースおよびトランスフォーマーベースの基盤バックボーンの継続的な進化によって目覚ましい成功を収めています。しかし、現実の臨床診断はしばしばドメイン知識、特にテキスト情報の統合を必要とします。視覚およびテキストのモダリティを示すマルチモーダル学習を行うことが解決策として提案されていますが、ペアの視覚と言語のデータセットを収集することは高コストで時間がかかり、大きな課題となっています。多くのクロスモーダルタスクにおける大規模言語モデル(LLM)の優れた能力に触発され、私たちはこれらの問題に対処するために新しいビジョン-LLM連合フレームワークを提案しました。具体的には、対応する医療画像に基づくゼロショット指示生成のために凍結されたLLMを導入し、放射線スキャンおよび報告生成プロセスを模倣します。実世界の診断プロセスにより近づくために、マルチモーダル放射線画像(例えば、T1強調またはT2強調MRIおよびCT)からより正確なテキスト指示を生成します。LLMのセマンティック理解能力と豊富な知識に基づいています。このプロセスは、異なるモダリティから特別な特徴を抽出し、最終的な臨床診断のために情報を再結合することを強調しています。生成されたテキスト指示を用いることで、私たちが提案する連合セグメンテーションフレームワークは、事前に収集された視覚と言語データセットなしでマルチモーダルセグメンテーションを処理することができます。提案した方法を評価するために、影響力のあるベースラインを用いて包括的な実験を行い、統計的結果および視覚的ケーススタディは私たちの新しい方法の優位性を示しています。
2025-04-09T23:33:35
Objaverse++: Curated 3D Object Dataset with Quality Annotations
http://arxiv.org/abs/2504.07334v1
Chendi Lin, Heshan Liu, Qunshu Lin, Zachary Bright, Shitao Tang, Yihui He, Minghao Liu, Ling Zhu, Cindy Le
Carnegie Mellon University, Zhejiang University, Exascale Labs, Simon Fraser University, Columbia University
この論文では、Objaverse++を紹介します。これは、専門家によって詳細な属性注釈が施されたObjaverseのキュレーションされたサブセットです。最近の3Dコンテンツ生成の進展は、インターネットから収集された80万以上の3Dオブジェクトを含むObjaverseのような大規模データセットによって推進されました。Objaverseは利用可能な中で最大の3Dアセットコレクションを代表していますが、低品質のモデルが多数を占めているため、その有用性は制限されています。この制限に対処するために、私たちは1万の3Dオブジェクトに対して美的品質スコア、テクスチャの色分類、複数オブジェクトの構成フラグ、透明性の特性などを含む詳細な属性で手動で注釈を付けました。次に、残りのObjaverseデータセットのタグを注釈することができるニューラルネットワークを訓練しました。生成結果に関する実験とユーザー調査を通じて、私たちの品質重視のサブセットで事前訓練されたモデルが、Objaverseのより大規模なデータセットで訓練されたモデルよりも、画像から3D生成タスクで優れたパフォーマンスを達成することを示しました。さらに、私たちのタグでフィルタリングされた複数の訓練データサブセットを比較することにより、データの質が高いほど訓練損失が速く収束することが示されました。これらの発見は、慎重なキュレーションと豊富な注釈が生のデータセットサイズを補う可能性があり、3D生成モデルの開発により効率的な道を提供できることを示唆しています。私たちは、様々な下流の3Dコンピュータビジョンタスクに対するさらなる研究を促進するために、約50万のキュレーションされた3Dモデルの強化データセットをリリースします。近い将来、私たちは全Objaverseデータセットをカバーするように注釈を拡張することを目指しています。
2025-04-09T23:29:08
Identifying regions of interest in whole slide images of renal cell carcinoma
http://arxiv.org/abs/2504.07313v1
Mohammed Lamine Benomar, Nesma Settouti, Eric Debreuve, Xavier Descombes, Damien Ambrosetti
組織病理画像は膨大な情報を含んでおり、診断を非常に時間のかかる面倒な作業にする可能性があります。本研究では、腎細胞癌(RCC)の全スライド画像(WSI)における興味のある領域(ROI)を検出する完全自動化システムを開発し、分析時間を短縮し、病理医がより正確な判断を下すのを助けることを目的としました。提案されたアプローチは、主に回転した局所バイナリパターン(DRLBP)と呼ばれる効率的なテクスチャ記述子に基づいており、顕微鏡の高倍率での膨大なテクスチャの変動を明らかにし活用します。これにより、DRLBPは構造情報を保持し、近隣の局所的な値を利用してより識別力を高めます。関連するROIの分類のために、WSIパッチの特徴抽出は、色チャネルごとに行い、ヒストグラムを形成しました。次に、最も頻繁に発生するパターンを特徴選択ステップとして使用し、非情報的な特徴を除外しました。12の全スライド画像から得られた1800の腎癌パッチのセットに対して、異なる分類器の性能を比較し評価しました。さらに、画像データセットが小さいため、深層特徴とファインチューニング法を用いた画像パッチ分類のための転移学習に基づく深層学習アプローチを調査することが可能です。高い認識精度が得られ、分類器は効率的で、最良の精度はサポートベクターマシン(SVM)を用いて99.17%に達しました。さらに、転移学習モデルは比較可能な性能で良好に機能し、ResNet-50を使用した場合の最高精度は98.50%に達しました。提案されたアプローチの結果は、非常に効率的な画像分類を示し、ROIの特定における有効性を示しました。本研究は、全スライドの組織病理画像における腎癌の診断に関連する興味のある領域を検出する自動システムを提示します。
2025-04-09T22:28:26
PAYADOR: A Minimalist Approach to Grounding Language Models on Structured Data for Interactive Storytelling and Role-playing Games
http://arxiv.org/abs/2504.07304v1
Santiago Góngora, Luis Chiruzzo, Gonzalo Méndez, Pablo Gervás
Universidad de la República, Universidad Complutense de Madrid
インタラクティブストーリーテリング(IS)システムがプレイヤーの入力を受け取るたびに、世界更新問題に直面しています。この問題への従来のアプローチは、その入力を既知のプログラムされたアクションにマッピングすることであり、これがプレイヤーの自由意志を大きく制約する可能性があります。期待される体験がロールプレイングゲーム(RPG)のように即興に強く焦点を当てている場合、この問題は非常に重要です。本論文では、行動そのものを表すのではなく、行動の結果を予測することに焦点を当てた異なるアプローチであるPAYADORを紹介します。このアプローチを実装するために、大規模言語モデルをフィクショナルワールドの最小限の表現に基づかせ、期待できる結果を得ました。この貢献はオープンソース化されており、RPGの共創性を解放するための他の関連研究に適応して利用できるようになっています。
2025-04-09T21:59:31
Modeling Response Consistency in Multi-Agent LLM Systems: A Comparative Analysis of Shared and Separate Context Approaches
http://arxiv.org/abs/2504.07303v1
Tooraj Helmi
University of Southern California
大規模言語モデル(LLM)は、協調的な問題解決やインタラクティブな推論を強化するために、マルチエージェントシステム(MAS)でますます利用されています。最近の進展により、LLMは複数のトピックにわたる複雑な相互作用を理解できる自律エージェントとして機能することが可能になりました。しかし、MASにLLMを導入することは、特にエージェントがメモリの制限下で動作し、ノイズの多い入力を扱わなければならない場合に、コンテキスト管理、レスポンスの一貫性、スケーラビリティに関する課題を引き起こします。これまでの研究では、LLM駆動のMASにおけるコンテキスト共有とレスポンスの待機時間の最適化が探求されてきましたが、これらの努力はしばしば完全に中央集権的または分散型の構成に焦点を当て、それぞれに異なるトレードオフが存在します。本論文では、LLMベースのMASにおけるレスポンスの一貫性とレスポンスタイムに対する共有コンテキスト構成と別々のコンテキスト構成の影響を分析するための確率的フレームワークを開発します。コンテキストの制限、ノイズ、エージェント間の依存関係がシステム性能に与える影響を評価する指標として、レスポンス一貫性指数(RCI)を導入します。我々のアプローチは、メモリの制約とノイズ管理の相互作用に焦点を当てることで既存の研究とは異なり、相互依存するトピックを持つ環境におけるスケーラビリティとレスポンスタイムの最適化に関する洞察を提供します。この分析を通じて、異なる構成がLLM駆動のマルチエージェントシステムの効率にどのように影響するかについての包括的な理解を提供し、より堅牢なアーキテクチャの設計を導くことを目指します。
2025-04-09T21:54:21
A Multi-Phase Analysis of Blood Culture Stewardship: Machine Learning Prediction, Expert Recommendation Assessment, and LLM Automation
http://arxiv.org/abs/2504.07278v1
Fatemeh Amrollahi, Nicholas Marshall, Fateme Nateghi Haredasht, Kameron C Black, Aydin Zahedivash, Manoj V Maddali, Stephen P. Ma, Amy Chang, MD Phar Stanley C Deresinski, Mary Kane Goldstein, Steven M. Asch, Niaz Banaei, Jonathan H Chen
血液培養は明確な理由なしに過剰に発注されることが多く、医療資源に負担をかけ、全球的な不足が悪化させる不適切な抗生物質使用の圧力に寄与しています。135,483件の救急部(ED)血液培養注文の研究では、構造化された電子健康記録(EHR)データと大規模言語モデル(LLM)を使用したプロバイダーノートを利用して、菌血症のリスクを予測するための機械学習(ML)モデルを開発しました。構造化モデルのAUCは、ノート埋め込みを用いることで0.76から0.79に改善され、診断コードを追加することで0.81に達しました。人間のレビュアーによって適用される専門家推奨フレームワークおよびLLMベースのパイプラインと比較して、私たちのMLアプローチは感度を損なうことなくより高い特異性を提供しました。推奨フレームワークは感度86%、特異性57%を達成しましたが、LLMは高い感度(96%)を維持しましたが、ネガティブを過剰に分類し、特異性は減少(16%)しました。これらの結果は、構造化データと非構造化データを統合したMLモデルが合意推奨を上回り、既存のケア基準を超えて診断の管理を強化できることを示しています。
2025-04-09T21:12:29
Evaluating Parameter-Based Training Performance of Neural Networks and Variational Quantum Circuits
http://arxiv.org/abs/2504.07273v1
Michael Kölle, Alexander Feist, Jonas Stein, Sebastian Wölckert, Claudia Linnhoff-Popien
近年、ニューラルネットワーク(NN)は機械学習において重要な進展をもたらしました。しかし、タスクがより複雑になるにつれて、NNはしばしば大量のトレーニング可能なパラメータを必要とし、これが計算およびエネルギーの要求を増加させます。変分量子回路(VQC)は有望な代替手段を提供します。これらは量子力学を利用して複雑な関係を捉える一方で、通常はより少ないパラメータを必要とします。本研究では、シンプルな教師あり学習および強化学習のタスクにおいて、NNとVQCを評価し、異なるパラメータサイズのモデルを検証します。VQCをシミュレートし、トレーニングプロセスの選択した部分を実際の量子ハードウェア上で実行して、実際のトレーニング時間を近似します。結果は、VQCがNNに対してパフォーマンスで匹敵しながらも、著しく少ないパラメータを使用できることを示していますが、トレーニング時間は長くなります。量子技術とアルゴリズムの進歩、そしてVQCアーキテクチャの改善に伴い、VQCは特定の機械学習タスクに対して有利になる可能性があると考えます。
2025-04-09T21:00:41
Better Decisions through the Right Causal World Model
http://arxiv.org/abs/2504.07257v1
Elisabeth Dillies, Quentin Delfosse, Jannis Blüml, Raban Emunds, Florian Peter Busch, Kristian Kersting
Sorbonne University, Technical University Darmstadt
強化学習(RL)エージェントは、様々な環境で驚異的なパフォーマンスを示しており、感覚入力から直接効果的な方針を発見することができます。しかし、これらのエージェントはしばしば訓練データのスピリオスな相関関係を利用するため、新しい環境やわずかに変更された環境に一般化できない脆弱な行動を引き起こします。この問題に対処するために、私たちは因果オブジェクト中心モデル抽出ツール(COMET)を導入します。COMETは、正確に解釈可能な因果世界モデル(CWM)を学習するために設計された新しいアルゴリズムです。COMETはまず、観察からオブジェクト中心の状態記述を抽出し、描写されたオブジェクトの特性に関連する環境の内部状態を特定します。次に、シンボリック回帰を用いてオブジェクト中心の遷移をモデル化し、オブジェクトのダイナミクスを支配する因果関係を導き出します。COMETはさらに、大規模言語モデル(LLM)を取り入れて意味的推論を行い、因果変数に注釈を付けて解釈可能性を高めます。これらの機能を活用することで、COMETは環境の真の因果構造に合致するCWMを構築し、エージェントがタスクに関連する特徴に集中できるようにします。抽出されたCWMはショートカットの危険を軽減し、動的シナリオ全体でより良い計画や意思決定が可能なRLシステムの開発を許可します。私たちの結果は、PongやFreewayなどのAtari環境で検証され、COMETの正確さと堅牢性を示し、オブジェクト中心の推論と因果推論のギャップを埋める可能性を強調しています。
2025-04-09T20:29:13
A new training approach for text classification in Mental Health: LatentGLoss
http://arxiv.org/abs/2504.07245v1
Korhan Sevinç
TOBB University of Economics and Technology
この研究では、伝統的な機械学習アルゴリズム、深層学習アーキテクチャ、およびトランスフォーマーベースのモデルを活用したメンタルヘルスの分類に対する多段階アプローチを提案します。新たにキュレーションされたデータセットがさまざまな手法の性能評価に使用され、従来の分類器から神経ネットワークへと進展しました。アーキテクチャの範囲を広げるために、LSTMやGRUといった再帰型ニューラルネットワーク(RNN)も評価され、データにおけるシーケンシャルパターンのモデル化における効果が探求されました。その後、BERTのようなトランスフォーマーモデルがファインチューニングされ、この領域における文脈埋め込みの影響を評価しました。これらのベースライン評価を超えて、この研究の核心的な貢献は、教師モデルと生徒モデルから構成される二重モデルアーキテクチャを含む新しいトレーニング戦略にあります。標準的な蒸留技術とは異なり、この方法はソフトラベルの転送に依存せず、損失関数を変更することによって教師モデルの出力と潜在表現の両方を通じて情報の流れを促進します。実験結果は、各モデリングステージの効果を強調し、提案された損失関数と教師-生徒の相互作用がメンタルヘルス予測タスクにおけるモデルの学習能力を大幅に向上させることを示しています。
2025-04-09T19:34:31
SemEval-2025 Task 5: LLMs4Subjects -- LLM-based Automated Subject Tagging for a National Technical Library's Open-Access Catalog
http://arxiv.org/abs/2504.07199v1
Jennifer D'Souza, Sameer Sadruddin, Holger Israel, Mathias Begoin, Diana Slawig
TIB Leibniz Information Centre for Science and Technology, Hannover
私たちはSemEval-2025タスク5: LLMs4Subjectsを発表します。このタスクは、英語およびドイツ語の科学技術記録の自動主題タグ付けに関する共同作業で、GND分類法を使用しています。参加者は、トップkの主題を推奨するLLMベースのシステムを開発し、定量的な指標(適合率、再現率、F1スコア)および主題専門家による定性的評価を通じて評価されました。結果は、LLMアンサンブル、合成データ生成、および多言語処理の効果を強調し、デジタルライブラリの分類にLLMsを適用するための洞察を提供します。
2025-04-09T18:26:46
Face-LLaVA: Facial Expression and Attribute Understanding through Instruction Tuning
http://arxiv.org/abs/2504.07198v1
Ashutosh Chaubey, Xulang Guan, Mohammad Soleymani
University of Southern California, Institute for Creative Technologies
人間の顔は社会的コミュニケーションにおいて中心的な役割を果たしており、人間中心のアプリケーションに対して高性能なコンピュータビジョンツールの使用が必要です。我々は、顔に焦点を当てた文脈学習のためのマルチモーダル大規模言語モデルであるFace-LLaVAを提案します。このモデルは、表情や属性の認識を含む機能を持ち、推論に使用できる自然言語の記述を生成することも可能です。既存の視覚データベースを活用して、まずFaceInstruct-1Mを開発しました。これは顔処理のための指示調整用の顔に特化したデータベースです。そして、顔の幾何学とローカル視覚特徴を統合したFace-Region Guided Cross-Attentionによって動かされる新しい顔特化型視覚エンコーダーを開発しました。我々は提案された方法を九つの異なるデータセットと五つの異なる顔処理タスクで評価しました。これには、表情認識、アクションユニット検出、顔属性検出、年齢推定、ディープフェイク検出が含まれます。Face-LLaVAは、既存のオープンソースのMLLMと比較して優れた結果を達成し、商業ソリューションと比較しても競争力のあるパフォーマンスを示しました。我々のモデルの出力は、全てのタスクにおいてゼロショット設定下でGPTによってより高い推論評価を受けています。データセットとモデルは、将来の社会的AIおよび基盤となる視覚と言語の研究の進展を支援するために、https://face-llava.github.io で公開されます。
2025-04-09T18:26:07
HypoEval: Hypothesis-Guided Evaluation for Natural Language Generation
http://arxiv.org/abs/2504.07174v1
Mingxuan Li, Hanchen Li, Chenhao Tan
University of Chicago
大規模言語モデル(LLM)は、自然言語生成の評価を自動化するための大きな可能性を示しています。これまでのLLMを評価者として活用するフレームワークは2つの点で不十分です。まず、ゼロショット設定で人間の入力を参照せずに使用するため、整合性が低くなります。次に、ラベル付きデータでLLMをファインチューニングする必要があり、これには相当な数のサンプルが必要です。さらに、従来の手法は自動評価の背後にある理由をあまり示しません。本論文では、ヒュポエバル(HypoEval)という仮説ガイドの評価フレームワークを提案します。このフレームワークは、最初に少数の人間評価のコーパスを使用して、人間の判断に対するより詳細なルブリックを生成し、次にチェックリストのようなアプローチを取り入れ、分解した各次元に対するLLMの割り当てたスコアを組み合わせて全体スコアを取得します。わずか30件の人間評価で、ヒュポエバルは人間のランキング(スピアマン相関)および人間のスコア(ピアソン相関)との整合性で最先端の性能を達成し、平均してG-Evalを11.86%上回り、少なくとも3倍の人間評価を受けたファインチューニングされたLlama-3.1-8B-Instructを11.95%上回りました。さらに、ヒュポエバルの堅牢性を評価するために体系的な研究を行い、信頼性が高く解釈可能な自動評価フレームワークとしての効果を強調します。
2025-04-09T18:00:01
Trustworthy AI Must Account for Intersectionality
http://arxiv.org/abs/2504.07170v1
Jesse C. Cresswell
信頼できるAIは、公平性、プライバシー、堅牢性、説明可能性、不確実性の定量化を含む、人間の価値に沿ったAIシステムの調和を目指す多くの理想的な側面を含んでいます。しかし、ある側面を強化するための努力は、他の側面に悪影響を及ぼす意図しないトレードオフを引き起こすことが多く、すべての側面を同時に改善することが困難になります。本論文では、これらの五つの側面に対する注目すべきアプローチをレビューし、相互作用のネガティブな影響を詳細に考察します。例えば、モデルのトレーニングに微分プライバシーを適用すると、データ内のバイアスが強まることがあり、公平性が損なわれます。これらの発見を踏まえ、私たちは、それぞれの軸で信頼性を個別に扱うことが不十分であるという立場を取ります。代わりに、信頼できるAIに関する研究は、側面間の交差性を考慮し、関連するすべての軸にわたって包括的な視点を採用する必要があります。私たちの視点を示すために、研究者が統合された信頼性に向けてどのように取り組むことができるかについての指針、金融業界における交差性の適用に関するケーススタディ、私たちの立場に対する代替的な見解を提供します。
2025-04-09T18:00:00
Sculpting Subspaces: Constrained Full Fine-Tuning in LLMs for Continual Learning
http://arxiv.org/abs/2504.07097v1
Nikhil Shivakumar Nayak, Krishnateja Killamsetty, Ligong Han, Abhishek Bhandwaldar, Prateek Chanda, Kai Xu, Hao Wang, Aldo Pareja, Oleg Silkin, Mustafa Eyceoz, Akash Srivastava
Red Hat, IBM Research, IIT Bombay, MIT-IBM Watson AI Lab
大規模言語モデル(LLM)における継続的学習は、カタストロフィックフォゲッティングに悩まされており、新しいタスクに適応することで以前に学習したタスクのパフォーマンスが大幅に低下することがあります。既存の手法は、通常、低ランクでパラメータ効率の良い更新に依存しており、モデルの表現力を制限し、タスクごとに追加のパラメータを導入するため、スケーラビリティの問題を引き起こします。これらの制限に対処するために、適応的特異値分解(SVD)を活用した新しい継続的フルファインチューニングアプローチを提案します。私たちの手法は、動的にタスク特有の低ランクパラメータ部分空間を特定し、更新が以前のタスクに関連する重要な方向に直交するように制約を設けることで、追加のパラメータのオーバーヘッドや以前のタスクの勾配を保存することなく、干渉を効果的に最小化します。私たちは、エンコーダーデコーダー(T5-Large)およびデコーダー専用(LLaMA-2 7B)モデルの両方を使用して、分類、生成、推論を含む多様なタスクにわたる標準的な継続的学習ベンチマークで私たちのアプローチを広範囲に評価します。経験的に、私たちの手法は最先端の結果を達成し、最近のベースラインであるO-LoRAよりも最大7%高い平均精度を示し、さらに継続的学習プロセス全体を通じてモデルの一般的な言語能力、指示に従う精度、そして安全性を維持しながら、忘却をほぼ無視できるレベルにまで低下させます。私たちの適応的SVDフレームワークは、モデルの可塑性と知識の保持のバランスを効果的に取っており、大規模な言語モデルにおける継続的学習シナリオに対する実用的かつ理論的に裏付けられた計算的にスケーラブルな解決策を提供します。
2025-04-09T17:59:42
Are We Done with Object-Centric Learning?
http://arxiv.org/abs/2504.07092v1
Alexander Rubinstein, Ameya Prabhu, Matthias Bethge, Seong Joon Oh
University of Tübingen, Tübingen AI Center
オブジェクト中心学習(OCL)は、シーンの他のオブジェクトや背景の手がかりから孤立したオブジェクトのみをエンコードする表現を学習することを目指しています。このアプローチは、分布外(OOD)一般化、サンプル効率的な構成、構造化環境のモデル化など、さまざまな目的を支えています。これまでの研究のほとんどは、オブジェクトを表現空間の離散的なスロットに分離する無監督メカニズムの開発に焦点を当てており、無監督オブジェクト発見を用いて評価されています。しかし、最近のサンプル効率的なセグメンテーションモデルにより、ピクセル空間でオブジェクトを分離し、それらを独立にエンコードすることが可能になりました。これにより、OODオブジェクト発見のベンチマークで顕著なゼロショットパフォーマンスを達成し、基盤モデルに拡張可能で、シームレスに可変数のスロットに対応できます。したがって、オブジェクト中心の表現を得るというOCL手法の目標は、ほぼ達成されました。この進展にもかかわらず、重要な問いが残っています。それは、シーン内のオブジェクトを分離する能力が、OOD一般化などの広範なOCLの目的にどのように寄与するのかということです。この問いに対して、OCLの観点から誤った背景手がかりによって引き起こされるOOD一般化の課題を調査します。我々は、$\textbf{Applied Masksを用いたオブジェクト中心分類(OCCAM)}$という新しいトレーニングフリーのプローブを提案し、個々のオブジェクトのセグメンテーションベースのエンコーディングがスロットベースのOCL手法を大幅に上回ることを示します。しかし、実世界の応用には課題が残っています。我々は、OCLコミュニティがスケーラブルなオブジェクト中心の表現を使用できるようにツールボックスを提供し、実践的な応用や人間の認知におけるオブジェクト知覚の理解などの基本的な問題に焦点を当てます。私たちのコードは$\href{https://github.com/AlexanderRubinstein/OCCAM}{こちら}$で入手可能です。
2025-04-09T17:59:05
AssistanceZero: Scalably Solving Assistance Games
http://arxiv.org/abs/2504.07091v1
Cassidy Laidlaw, Eli Bronstein, Timothy Guo, Dylan Feng, Lukas Berglund, Justin Svegliato, Stuart Russell, Anca Dragan
アシスタンスゲームは、人間のフィードバックからの強化学習(RLHF)に代わる有望な手段として、AIアシスタントの訓練に利用されています。アシスタンスゲームは、アシスタントとユーザーの相互作用を、アシスタントが共通の目標を観察できない二人プレイヤーのゲームとして明示的にモデル化することで、RLHFの主要な欠点、例えば欺瞞的行動に対するインセンティブなどを解決します。しかし、その潜在能力にもかかわらず、アシスタンスゲームは単純な設定でしか探求されていません。これをより複雑な環境にスケールさせることは困難であり、これは不確実性の下での解決策のない意思決定問題を解決する必要があり、かつ人間ユーザーの行動を正確にモデル化する必要があります。私たちは、アシスタンスゲームを解決するための初のスケーラブルなアプローチを提示し、$10^{400}$以上の可能な目標を持つ新しい挑戦的なMinecraftを基にしたアシスタンスゲームに適用しました。私たちのアプローチ、AssistanceZeroは、アルファゼロを拡張し、人間の行動と報酬を予測するニューラルネットワークを導入し、不確実性の下で計画を立てることを可能にします。私たちは、AssistanceZeroがMinecraftベースのアシスタンスゲームにおいてモデルフリーのRLアルゴリズムや模倣学習よりも優れていることを示します。人間の研究において、私たちのAssistanceZeroで訓練されたアシスタントは、参加者がMinecraftでの建築タスクを完了するために取るアクションの数を大幅に減少させます。私たちの結果は、アシスタンスゲームが複雑な環境において効果的なAIアシスタントを訓練するための魅力的なフレームワークであることを示唆しています。私たちのコードとモデルはhttps://github.com/cassidylaidlaw/minecraft-building-assistance-gameで入手できます。
2025-04-09T17:59:03
KG-LLM-Bench: A Scalable Benchmark for Evaluating LLM Reasoning on Textualized Knowledge Graphs
http://arxiv.org/abs/2504.07087v1
Elan Markowitz, Krupa Galiya, Greg Ver Steeg, Aram Galstyan
University of Southern California, University of California, Riverside, Independent Researcher
知識グラフは、最新の事実に基づく知識を大規模言語モデル(LLM)に組み込むための人気のある手法として登場しました。これは通常、知識グラフをLLMがコンテキスト内で処理できるテキストに変換することで達成されます。知識グラフをエンコードするための複数の方法が提案されているものの、このテキスト化プロセスがLLMのパフォーマンスに与える影響は十分に探求されていません。我々はKG-LLM-Benchを紹介します。これは、五つの知識グラフ理解タスクを網羅した包括的かつ拡張可能なベンチマークであり、異なるエンコード戦略がさまざまなベースモデルのパフォーマンスにどのように影響を与えるかを評価します。七つの言語モデルと五つのテキスト化戦略を用いた広範な実験は、KG推論タスクにおけるLLMのパフォーマンス最適化に関する洞察を提供します。
2025-04-09T17:58:47
Self-Steering Language Models
http://arxiv.org/abs/2504.07081v1
Gabriel Grand, Joshua B. Tenenbaum, Vikash K. Mansinghka, Alexander K. Lew, Jacob Andreas
テスト時の推論は言語モデルが複雑なタスクに取り組むことを可能にしますが、自然言語での検索や計画は遅く、高コストでエラーが発生しやすい場合があります。しかし、LMが問題を解決するために必要な正確な推論ステップを模倣するのに苦労する場合でも、抽象的な構造の記述においてはしばしば優れています。すなわち、解決策の検証方法とそれらを検索する方法に関してです。本論文では、プランナーモデルがタスク特有の推論プログラムを生成し、それがフォロワーモデルの集団によって実行される「自己操縦」LMのための手法であるDisCIPLを紹介します。私たちのアプローチは、LMがLM推論を導く再帰的検索手続きを記述する能力を備え、新しい検証可能で効率的な推論の形態を可能にします。小規模なフォロワーモデル(例:Llama-3.2-1B)を用いた場合、DisCIPLはGPT-4oやo1を含むより大きなモデルに対して、挑戦的な制約付き生成タスクで性能を一致させ(時にはそれを上回り)、計画と実行を分離することで、従来の最良のNサンプリングを上回る高並列化モンテカルロ推論戦略のデザインスペースを開き、微調整を必要とせず、既存のLMによって自動的に実装可能なものとなります。
2025-04-09T17:54:22
DeduCE: Deductive Consistency as a Framework to Evaluate LLM Reasoning
http://arxiv.org/abs/2504.07080v1
Atharva Pandey, Kshitij Dubey, Rahul Sharma, Amit Sharma
オリンピックレベルの推論問題において優れたパフォーマンスを示すフロンティア大規模言語モデル(LM)は、標準的なベンチマークを超えた新しい問題に直面すると、高校数学で苦労することがあります。最終的な正確性を超えて、言語モデルからの思考の連鎖出力を分析するために、演繹的一貫性メトリックを提案します。正式には、演繹的推論は二つのサブタスクを含みます:入力の前提セットを理解することと、それに基づいて結論を推測することです。提案されたメトリックは、これらのサブタスクにおけるLMのパフォーマンスを調査し、新しい問題におけるLMの推論エラーを説明することを目指しています。すなわち、LMは増加するコンテキスト長でどの程度入力前提を理解でき、複数の推論ホップを通じて結論をどの程度抽出できるのかを調べます。既存のベンチマークが記憶されている可能性があるため、ベンチマーク問題の新しく、変化を加えたバージョンに対するLMの演繹的一貫性を評価するためのパイプラインを開発します。新しい小学校の数学問題(GSM-8k)において、LMは増加する入力前提数に対してかなり堅牢であることが分かりましたが、推論ホップが増加すると正確性が著しく低下します。興味深いことに、元のベンチマークではすべてのモデルがほぼ100%の精度を達成するため、これらのエラーは隠されています。合成データセットを使用して解決ステップの数を増やすと、入力前提を理解することと比べて複数のホップにわたる予測が依然として主要なエラーの原因であることがわかります。言語スタイルの変化や初期エラーの自然な伝播などの他の要因は、これらの傾向を説明するものではありません。私たちの分析は、LMの推論をキャラクター化する新しい観点を提供します。すなわち、入力前提と推論ホップのウィンドウ上での計算として、問題領域を横断した統一評価を提供することが可能です。
2025-04-09T17:53:55
SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skills
http://arxiv.org/abs/2504.07079v1
Boyuan Zheng, Michael Y. Fatemi, Xiaolong Jin, Zora Zhiruo Wang, Apurva Gandhi, Yueqi Song, Yu Gu, Jayanth Srinivasa, Gaowen Liu, Graham Neubig, Yu Su
複雑な環境で生き残り、 thrivingするために、人間は環境探査、経験の階層的抽象化を通じて再利用可能なスキルにまとめ、協力して常に成長するスキルレパートリーを構築する高度な自己改善メカニズムを進化させてきました。最近の進展にもかかわらず、自律的なウェブエージェントは、手続き的知識の抽象化、スキルの洗練、スキルの構成に関して重要な自己改善能力が欠けており苦労しています。この研究では、SkillWeaverを紹介します。これは、エージェントが再利用可能なスキルをAPIとして自律的に合成することで自己改善を可能にするスキル中心のフレームワークです。新しいウェブサイトが与えられると、エージェントは自律的にスキルを発見し、練習のためにそれらを実行し、実践体験を堅牢なAPIに凝縮します。反復的な探査により、軽量でプラグアンドプレイ可能なAPIのライブラリーが常に拡張され、エージェントの能力が大幅に向上します。WebArenaや現実のウェブサイトでの実験は、SkillWeaverの有効性を実証しており、相対的な成功率の改善がそれぞれ31.8%と39.8%に達しています。さらに、強力なエージェントによって合成されたAPIは、転移可能なスキルを通じて弱いエージェントを大いに強化し、WebArenaで最大54.3%の改善をもたらします。これらの結果は、多様なウェブサイトのインタラクションをAPIに磨き上げることの効果を示しており、さまざまなウェブエージェント間でシームレスに共有できることができます。
2025-04-09T17:51:50
HalluciNot: Hallucination Detection Through Context and Common Knowledge Verification
http://arxiv.org/abs/2504.07069v1
Bibek Paudel, Alexander Lyzhov, Preetam Joshi, Puneet Anand
AIMon Labs
本論文では、企業環境における大規模言語モデル(LLM)の出力における幻覚を検出するための包括的なシステムを紹介します。私たちは、企業アプリケーションに特有の幻覚に関連するLLMの応答を、文脈ベース、一般知識、企業特有、および無害な発言に分類する新しい分類法を提示します。私たちの幻覚検出モデルHDM-2は、文脈と一般に知られている事実(一般知識)に照らしてLLMの応答を検証します。これにより、幻覚スコアと単語レベルの注釈を提供し、問題のあるコンテンツの正確な特定を可能にします。文脈ベースおよび一般知識の幻覚に関して評価するために、新しいデータセットHDMBenchを導入します。実験結果は、HDM-2がRagTruth、TruthfulQA、およびHDMBenchデータセットにおいて既存のアプローチを上回ることを示しています。この研究では、計算効率、ドメインの専門化、細かいエラーの特定を含む企業導入の特定の課題に対処します。私たちの評価データセット、モデルの重み、および推論コードは公開されています。
2025-04-09T17:39:41
$Π$-NeSy: A Possibilistic Neuro-Symbolic Approach
http://arxiv.org/abs/2504.07055v1
Ismaïl Baaj, Pierre Marquis
この記事では、ニューラルネットワークによって行われる低レベルの知覚タスクと、可能性ベースのルールシステムによって行われる高レベルの推論タスクを組み合わせた神経符号的アプローチを紹介します。目標は、各入力インスタンスが目的の(メタ)概念に属する可能性の度合いを導出できるようにすることです。この(メタ)概念は、中間概念に可能性ベースのルールシステムによって接続されています。入力インスタンスに対する各中間概念の確率は、ニューラルネットワークを使用して推論されます。低レベルの知覚タスクと高レベルの推論タスクの間の接続は、ニューラルネットワークの出力(ソフトマックス活性化を通じてモデル化される)の確率分布を可能性分布に変換することにあります。中間概念の使用は説明目的において重要です。ルールベースのシステムを使用することで、入力インスタンスを(メタ)概念の要素として分類することが、中間概念が認識された事実によって正当化されます。技術的な側面から、私たちの貢献は、可能性ベースのルールシステムに関連する行列関係と方程式系の定義のための効率的な方法の設計で構成されます。対応する行列と方程式は、可能性ベースのルールシステムから推論を行い、そのようなシステムにおけるルールパラメータの値を訓練データサンプルに従って学習するために使用される重要なデータ構造です。さらに、一貫性のないファジー関係の方程式系の扱いに関する最近の結果を活用して、複数の訓練データサンプルに従ってルールパラメータを学習するためのアプローチが提示されています。MNISTの加算問題やMNISTの数独パズル問題に対する実験は、最先端の神経符号的手法と比較して、私たちのアプローチの有効性を強調しています。
2025-04-09T17:16:23
RayFronts: Open-Set Semantic Ray Frontiers for Online Scene Understanding and Exploration
http://arxiv.org/abs/2504.06994v1
Omar Alama, Avigyan Bhattacharya, Haoyang He, Seungchan Kim, Yuheng Qiu, Wenshan Wang, Cherie Ho, Nikhil Keetha, Sebastian Scherer
Carnegie Mellon University
オープンセットセマンティックマッピングは、オープンワールドロボットにとって重要です。現在のマッピングアプローチは、深度範囲に制限されるか、あるいは制約のある設定でしか範囲外のエンティティをマッピングできず、全体として範囲内と範囲外の観測を統合することに失敗しています。さらに、これらの方法は、詳細なセマンティクスと効率性のトレードオフを行っています。私たちはRayFrontsを紹介します。これは、密なセマンティックマッピングと範囲外効率的なセマンティックマッピングの両方を可能にする統一された表現です。RayFrontsは、タスクに依存しないオープンセットセマンティクスを範囲内ボクセルとマップ境界にエンコードされた範囲外の光線の両方に符号化し、ロボットが検索ボリュームを大幅に削減し、感覚範囲内外の状況で情報に基づいた意思決定を行えるようにしています。また、Orin AGX上で8.84Hzで動作します。範囲内のセマンティクスをベンチマークした結果、RayFrontsの詳細な画像エンコーディングは、ゼロショットの3Dセマンティックセグメンテーションパフォーマンスを1.34倍向上させ、スループットを16.5倍改善します。従来、オンラインマッピングのパフォーマンスは他のシステムコンポーネントと絡み合っており、評価が複雑になっています。私たちは、オンラインの範囲外検索と探索の有用性を捉える、プランナーに依存しない評価フレームワークを提案し、RayFrontsが最も近いオンラインベースラインよりも2.2倍効率的に検索ボリュームを削減することを示します。
2025-04-09T16:06:58
Enhancing Metabolic Syndrome Prediction with Hybrid Data Balancing and Counterfactuals
http://arxiv.org/abs/2504.06987v1
Sanyam Paresh Shah, Abdullah Mamun, Shovito Barua Soumma, Hassan Ghasemzadeh
Arizona State University, College of Health Solutions, School of Computing and Augmented Intelligence, IEEE EMBC 2025 Conference
メタボリックシンドローム(MetS)は、心血管疾患や2型糖尿病のリスクを有意に増加させる相互関連するリスク因子のクラスターです。世界的な普及にもかかわらず、クラスの不均衡、データの不足、既存の研究における方法論の不整合といった問題により、MetSの正確な予測は依然として困難です。この論文では、先進的なデータバランシング技術と対話的分析を活用し、MetS予測のための機械学習(ML)モデルを体系的に評価し最適化することでこれらの課題に取り組みます。XGBoost、ランダムフォレスト、TabNetなど、複数のMLモデルが訓練され、ランダムオーバーサンプリング(ROS)、SMOTE、ADASYN、CTGANなどのさまざまなデータバランシング技術の下で比較されました。さらに、SMOTE、ADASYN、CTGANを統合した新しいハイブリッドフレームワークMetaBoostを導入し、重み付き平均と反復重み調整を通じて合成データ生成を最適化し、モデルのパフォーマンスを向上させました(個別のバランシング技術に対して1.14%の精度向上を達成)。高リスクから低リスクのカテゴリーに個人を変更するのに必要な特徴レベルの変化を定量化するために、包括的な対話的分析が実施されました。結果は、血糖(50.3%)とトリグリセリド(46.7%)が最も頻繁に修正された特徴であり、MetSリスク削減における臨床的重要性を強調しています。さらに、確率的分析では、高血糖(85.5%の可能性)とトリグリセリド(74.9%の事後確率)が最も強力な予測因子であることが示されています。この研究は、MetS予測の方法論的な厳密さを進展させるだけでなく、臨床医と研究者に行動可能な洞察を提供し、メタボリックシンドロームの公衆衛生上の負担を軽減するためのMLの可能性を浮き彫りにします。
2025-04-09T15:51:10
RNN-Transducer-based Losses for Speech Recognition on Noisy Targets
http://arxiv.org/abs/2504.06963v1
Vladimir Bataev
騒音の多いトランスクリプトで音声認識システムを訓練することは、データセットが膨大であり、すべてのインスタンスの正確なトランスクリプションを保証することが難しい工業パイプラインにおいて重要な課題です。本研究では、RNN-トランスデューサーモデルにおけるトランスクリプションエラーの影響を軽減するための新しい損失関数を提案します。我々のStar-トランスデューサー損失は、損失ラティスに「スキップフレーム」遷移を取り入れることで削除エラーに対処し、正確なトランスクリプトで訓練されたモデルと比較してシステムの性能の90%以上を回復します。バイパス-トランスデューサー損失は、「スキップトークン」遷移を使用して挿入エラーに取り組み、60%以上の品質を回復します。最後に、ターゲットロバストトランスデューサー損失は、これらのアプローチを統合し、任意のエラーに対して堅牢な性能を提供します。実験結果は、ターゲットロバストトランスデューサー損失が、良好にトランスクリプトされたデータと比較して、ノイズの多いデータに対するRNN-Tの性能を70%以上回復させることを示しています。
2025-04-09T15:18:29
Efficient Self-Supervised Learning for Earth Observation via Dynamic Dataset Curation
http://arxiv.org/abs/2504.06962v1
Thomas Kerdreux, Alexandre Tuel, Quentin Febvre, Alexis Mouche, Bertrand Chapron
Galeio, Ifremer, UMR CNRS LOPS, Paris, Brest
自己教師あり学習(SSL)は、地球観測(EO)用のビジョンファウンデーションモデルの開発を可能にし、多様なリモートセンシングタスク間での強力な転送能力を示しています。これまでの研究はネットワークアーキテクチャやトレーニング戦略に焦点を当ててきましたが、特に事前学習データセットのバランスと多様性を整える役割は十分に探求されていません。EOにおいては、衛星画像に一般的な冗長性やヘビーテール分布によってこの課題が悪化し、偏った表現や非効率なトレーニングを引き起こす可能性があります。本研究では、データセットの多様性とバランスを最大化することでSSLの事前学習を改善することを目的とした動的データセットプルーニング戦略を提案します。我々の方法は、既存の特徴抽出器を必要とせずにトレーニングセットを反復的に洗練させるため、キュレーションされたデータセットが限られているか利用できないドメインに適しています。我々は、海洋観測が支配する難しいデータセットであるSentinel-1波モード(WV)合成開口レーダー(SAR)アーカイブにおいてこのアプローチを示します。10年間にわたる全Sentinel-1 WVアーカイブでモデルを一からトレーニングしました。3つの下流タスクを通じて、動的プルーニングが計算効率と表現品質の両方を改善し、より強力な転送能力を導くことを示しています。また、我々はALS映像を用いた海洋観測と分析のためのファウンデーションモデルシリーズであるNereusファミリーの最初のモデルNereus-SAR-1の重みを、github.com/galeio-research/nereus-sar-models/で公開します。
2025-04-09T15:13:26
Adaptive Computation Pruning for the Forgetting Transformer
http://arxiv.org/abs/2504.06949v1
Zhixuan Lin, Johan Obando-Ceron, Xu Owen He, Aaron Courville
Université de Montréal, Mila, MakerAI
最近提案されたForgeting Transformer(FoX)は、ソフトマックスアテンションに忘却ゲートを組み込み、標準のRoPEベースのTransformerと比較して、一貫してより良い、または同等の性能を示しています。特に、FoXの多くのアテンションヘッドは迅速に忘却する傾向があり、そのため各タイムステップでの出力が主にローカルコンテキストに依存します。この観察に基づき、我々はFoXに対して適応計算プルーニング(ACP)を提案します。これは、忘却ゲートによって強く減衰された入力-出力依存性を含む計算を動的にプルーニングする方法です。これは、プルーニングされたアテンションウェイトが無視できるレベルに保たれることを保証する動的に設定されたプルーニング閾値を用いることで実現されます。我々はFoXを用いた言語モデルの事前学習にACPを適用し、異なるモデルサイズとコンテキスト長にわたってソフトマックスアテンションでのFLOP数を約70%削減できることを一貫して示し、トレーニングスループットが約10%から35%向上することを示しました。さらに、長いコンテキスト長はより大きな計算の節約をもたらします。これらのすべての速度向上は、パフォーマンスの劣化なしに達成されます。また、プルーニングパターンの検討や、異なるアテンションヘッド間のFLOP節約の分布分析など、我々の方法に関する深い洞察を提供するためにいくつかの分析を行っています。我々のコードはhttps://github.com/zhixuan-lin/arctic-foxで入手可能です。
2025-04-09T14:57:55
Review of Case-Based Reasoning for LLM Agents: Theoretical Foundations, Architectural Components, and Cognitive Integration
http://arxiv.org/abs/2504.06943v1
Kostas Hatalis, Despina Christou, Vyshnavi Kondapalli
GoCharlie.ai, Lehigh University
最近、巨大言語モデル(LLM)によって強化されたエージェントは、さまざまなタスクで印象的な能力を示しています。しかし、具体的で構造化された知識、柔軟性、責任ある意思決定を必要とするタスクには限界があります。エージェントは自分の環境を認識し、推論を形成し、目標に向けて計画を立て、行動を実行することができますが、しばしば幻覚や相互作用における文脈記憶の欠如といった問題に直面します。本論文では、過去の経験を参照することによって新しい問題を解決する戦略である事例ベース推論(CBR)をLLMエージェントフレームワークに統合する方法を探ります。この統合により、LLMは明示的な知識を活用できるようになり、その効果が高まります。私たちは、これらの強化されたエージェントの理論的基盤を体系的にレビューし、重要なフレームワーク要素を特定し、事例の検索、適応、学習のためのCBRプロセスの数学モデルを構築します。また、CBR強化エージェントをChain-of-Thought推論や標準のRetrieval-Augmented Generationなどの他の方法と比較評価し、それらの相対的な強みを分析します。さらに、目標駆動型の自律メカニズムを通じて、自己反省、内省、好奇心などCBRの認知的次元を活用することで、LLMエージェントの能力をさらに向上させる方法を探ります。この研究は神経-記号のハイブリッドシステムに関する進行中の研究に寄与しており、CBRを自律的なLLMエージェントの推論スキルと認知的側面を強化するための有効な手法として提示します。
2025-04-09T14:51:02
Beyond Tools: Generative AI as Epistemic Infrastructure in Education
http://arxiv.org/abs/2504.06928v1
Bodong Chen
生成的AIが世界中の教育インフラに急速に統合される中、それは知識の創造、検証、共有の仕方を変革していますが、現在の議論ではそれが教育と学習を仲介する認識インフラとしての含意について十分に取り扱われていません。本論文では、AIシステムが教育における認識インフラとしてどのように機能し、人間の認識的エージェンシーに与える影響を探ります。状況認知の視点を採用し、価値センシティブデザインアプローチに従って、教育環境における2つの代表的なAIシステムの技術的調査を行い、それらが教師の実践に与える影響を、熟練した認識的行動のための可能性、認識的感受性の支援、長期的な習慣形成への影響という3つの次元で分析します。分析の結果、現在のAIシステムは教師の熟練した認識的行動を十分には支援せず、認識的感受性を不十分に促進し、認識的エージェンシーよりも効率を優先する問題のある習慣を育成する可能性があることが明らかになりました。これらの課題に対処するために、本論文では教育におけるインフラの変革を認識し、熟練した行動を刺激しながら認識的規範を維持するAI環境を開発し、教育者をAI設計プロセスに関与させることを推奨します。これは、教育の核心的な価値観に合致し、人間の認識的エージェンシーを維持するAI統合の促進を目指した提言です。
2025-04-09T14:35:30
Are Vision-Language Models Ready for Dietary Assessment? Exploring the Next Frontier in AI-Powered Food Image Recognition
http://arxiv.org/abs/2504.06925v1
Sergio Romero-Tapiador, Ruben Tolosana, Blanca Lacruz-Pleguezuelos, Laura Judith Marcos Zambrano, Guadalupe X. Bazán, Isabel Espinosa-Salinas, Julian Fierrez, Javier Ortega-Garcia, Enrique Carrillo de Santa Pau, Aythami Morales
Universidad Autonoma de Madrid, IMDEA Food
自動食事評価は食品画像に基づいており、正確な食品検出、セグメンテーション、および分類を必要とするため、依然として課題です。ビジョン-ランゲージモデル(VLM)は、視覚的および言語的推論を統合することにより、新しい可能性を提供します。本研究では、ChatGPT、Gemini、Claude、Moondream、DeepSeek、およびLLaVAの6つの最先端VLMを評価し、さまざまなレベルでの食品認識能力を分析します。実験フレームワークとして、10のカテゴリ(例:「タンパク源」)、62のサブカテゴリ(例:「家禽」)、および9つの調理スタイル(例:「グリル」)にわたる9,263の専門家ラベル付き画像を含むユニークな食品画像データベースであるFoodNExTDBを紹介します。FoodNExTDBには、データベース内のすべての画像に手動で注釈を付けた7人の専門家によって生成された合計50,000の栄養ラベルが含まれています。また、アノテーター間の変動性を考慮した新しい評価指標であるエキスパート重み付け再現率(EWR)を提案します。結果は、クローズドソースモデルがオープンソースモデルを上回り、単一の製品を含む画像内の食品製品を認識する際に90%以上のEWRを達成していることを示しています。それにもかかわらず、現在のVLMは、調理スタイルの微妙な違いや視覚的に類似した食品アイテムを区別することが特に難しいため、細分化された食品認識において課題に直面しており、自動食事評価の信頼性を制限しています。FoodNExTDBデータベースは、https://github.com/AI4Food/FoodNExtDB で公開されています。
2025-04-09T14:33:59
Longitudinal Assessment of Lung Lesion Burden in CT
http://arxiv.org/abs/2504.06924v1
Tejas Sudharshan Mathai, Benjamin Hou, Ronald M. Summers
米国において、肺癌は第二の主要な死因です。疑わしい肺結節の早期発見は、患者の治療計画、管理、および治療結果の改善において極めて重要です。肺結節のセグメンテーションと容積分析に関する多くのアプローチが提案されていますが、全肺腫瘍負荷の経時的変化を調べたものはほとんどありません。本研究では、解剖学的先行情報の有無に関わらず、肺病変を自動的にセグメント化し、各患者の総病変負荷を定量化するために2つの3Dモデル(nnUNet)を訓練しました。解剖学的先行情報を使用しない3Dモデルは、先行情報を用いたモデルと比較して有意に優れていました($p < .001$)。臨床的に重要な病変($>$ 1cm)の検出においては、71.3\%の精度、68.4\%の感度、69.8\%のF1スコアを達成しました。セグメンテーションにおいては、ダイススコアが77.1 $\pm$ 20.3、ハウスドルフ距離誤差が11.7 $\pm$ 24.1 mmでした。中央値の病変負荷は6.4 cc(IQR: 2.1, 18.1)で、手動測定と自動測定の中央値の体積差は0.02 cc(IQR: -2.8, 1.2)でした。合意も線形回帰およびブラン・アルトマンプロットで評価されました。提案されたアプローチは、患者の総腫瘍負荷の個別評価を生成し、時間経過に伴う変化の追跡を容易にすることができます。
2025-04-09T14:30:43
Leveraging Anatomical Priors for Automated Pancreas Segmentation on Abdominal CT
http://arxiv.org/abs/2504.06921v1
Anisa V. Prasad, Tejas Sudharshan Mathai, Pritam Mukherjee, Jianfei Liu, Ronald M. Summers
CTにおける膵臓の正確なセグメンテーションは、膵臓の病理を特定し、画像に基づくバイオマーカーを抽出するために非常に重要です。しかし、これまでの膵臓のセグメンテーションに関する研究は、主にセグメンテーションモデルのアーキテクチャの修正や、前処理・後処理技術の活用に焦点を当ててきました。本記事では、膵臓のセグメンテーション性能を向上させるために解剖学的先行情報の有用性を調査します。公的なPANORAMAデータセットから取得した8つの洗練されたラベルを使用した1つの3Dフル解像度nnU-Netモデルと、公的なTotalSegmentator(TS)ツールから取得したラベルと組み合わせた別のモデルの2つを訓練しました。解剖学的先行情報を追加することで、Diceスコアが6\%増加し($p < .001$)、膵臓セグメンテーションのHausdorff距離が36.5 mm減少しました($p < .001$)。さらに、解剖学的先行情報を使用した場合には常に膵臓が検出されたのに対し、それを使用しなかった場合には8回の検出失敗がありました。解剖学的先行情報の利用は、膵臓のセグメンテーションおよびその後の画像バイオマーカーの導出に対して有望であることを示しています。
2025-04-09T14:29:08
An Analysis of Temporal Dropout in Earth Observation Time Series for Regression Tasks
http://arxiv.org/abs/2504.06915v1
Miro Miranda, Francisco Mena, Andreas Dengel
時系列データにおける欠損インスタンスは、特に回帰タスクにおいてディープラーニングモデルにとって重要な課題をもたらします。地球観測の分野では、衛星の故障や雲の遮蔽が頻繁に欠損タイムステップを引き起こし、予測出力に不確実性をもたらし、予測性能の低下を引き起こします。多くの研究がデータ拡張を通じて欠損タイムステップに対処しモデルの頑健性を向上させていますが、入力レベルで発生する不確実性は一般的に見過ごされています。このギャップに対処するために、モンテカルロ時間ドロップアウト(MC-TD)を提案します。これは、事前定義されたドロップアウト比率を使用して推論中にランダムにタイムステップをドロップすることで、欠損データの影響をシミュレーションし、入力レベルの不確実性を明示的に考慮する手法です。最適なドロップアウト比率を探索するコストを回避するために、モンテカルロコンクリート時間ドロップアウト(MC-ConcTD)を用いてこのアプローチを拡張します。これは、最適なドロップアウト分布を直接学習する手法です。MC-TDとMC-ConcTDの両方は、推論中に適用され、不確実性の定量化のためにモンテカルロサンプリングを利用します。3つのEO時系列データセットに関する実験は、MC-ConcTDが既存のアプローチと比較して予測性能と不確実性のキャリブレーションを向上させることを示しています。また、マニュアル選定に対する適応的なドロップアウト調整の利点を強調し、EOアプリケーションにおける不確実性の定量化をより頑健かつアクセスしやすくしています。
2025-04-09T14:23:04
MedSegFactory: Text-Guided Generation of Medical Image-Mask Pairs
http://arxiv.org/abs/2504.06897v1
Jiawei Mao, Yuhan Wang, Yucheng Tang, Daguang Xu, Kang Wang, Yang Yang, Zongwei Zhou, Yuyin Zhou
UC Santa Cruz, NVIDIA, UC San Francisco, Johns Hopkins University
この論文では、様々な医療合成タスクにおいて高品質な対の医療画像とセグメンテーションマスクを生成する多用途の医療合成フレームワーク「MedSegFactory」を紹介します。本フレームワークは、無限のデータリポジトリとして機能し、既存のセグメンテーションツールを強化するために画像-マスクペアを提供することを目的としています。MedSegFactoryの核心は、二重ストリーム拡散モデルであり、一方のストリームが医療画像を合成し、もう一方が対応するセグメンテーションマスクを生成します。画像-マスクペア間の正確な整合性を確保するために、Joint Cross-Attention (JCA)を導入し、ストリーム間の動的クロスコンディショニングによる協調ノイズ除去パラダイムを可能にしました。この双方向の相互作用により、両方の表現が互いの生成を導くことができ、生成されるペア間の一貫性が向上します。MedSegFactoryは、ターゲットラベル、画像モダリティ、解剖学的領域、病理条件を指定するユーザー定義のプロンプトに基づいて、対となる医療画像とセグメンテーションマスクのオンデマンド生成を可能にし、スケーラブルで高品質なデータ生成を促進します。この新しい医療画像合成のパラダイムは、多様な医療画像ワークフローにシームレスに統合でき、効率と精度の両方を向上させます。広範な実験により、MedSegFactoryが優れた品質と使いやすさのデータを生成し、2Dおよび3Dセグメンテーションタスクにおいて競争力のある、または最先端のパフォーマンスを達成し、データ不足や規制の制約に対処していることが示されています。
2025-04-09T13:56:05
Audio-visual Event Localization on Portrait Mode Short Videos
http://arxiv.org/abs/2504.06884v1
Wuyang Liu, Yi Chai, Yongpeng Yan, Yanzhen Ren
Wuhan University
音声視覚イベントローカリゼーション(AVEL)は、多モーダルシーン理解において重要な役割を果たします。既存のAVELデータセットは主に景観指向の長いビデオとクリーンで単純な音声コンテキストで構成されていますが、スマートフォンの普及により短いビデオがオンラインビデオコンテンツの主な形式となっています。短いビデオはポートレート指向のフレーミングとレイヤー化された音声構成(例:重なった音響効果、ナレーション、音楽)によって特徴づけられ、従来の手法では解決されていない独自の課題をもたらします。このため、ポートレートモードの短いビデオ専用に設計された最初のAVELデータセットであるAVE-PMを紹介します。これは、フレームレベルの注釈を含む86の細分化されたカテゴリにまたがる25,335のクリップで構成されています。データセットの作成を超えて、我々の経験的分析では、最先端のAVEL手法がクロスモード評価中に平均18.66%のパフォーマンス低下を経験することが示されています。さらなる分析により、異なるビデオ形式の2つの重要な課題が明らかになりました。1) ポートレート指向のフレーミングから生じる空間バイアスが異なるドメインの先入観をもたらし、2) 雑音の多い音声構成が音声モダリティの信頼性を損ないます。これらの問題に対処するために、我々はポートレートモードビデオにおけるAVELのための最適な前処理レシピとバックグラウンド音楽の影響を調査します。実験の結果、これらの手法は特化した前処理と専門的なモデル設計によって利益を得ることができ、パフォーマンスが向上することが示されました。この研究は、モバイル中心のビデオコンテンツの時代におけるAVEL研究を進展させるための基礎的なベンチマークと実用的な洞察を提供します。データセットとコードは公開される予定です。
2025-04-09T13:38:40
Compound and Parallel Modes of Tropical Convolutional Neural Networks
http://arxiv.org/abs/2504.06881v1
Mingbo Li, Liying Liu, Ye Luo
Xiamen University
畳み込みニューラルネットワークはますます深く複雑になり、計算コストが高くなっています。熱帯畳み込みニューラルネットワーク(TCNN)は掛け算を削減しますが、標準のCNNと比べると性能が劣ります。これに対処するために、我々は2つの新しいバリアント、つまり複合TCNN(cTCNN)と並列TCNN(pTCNN)を提案します。これらは熱帯最小プラスおよび最大プラスカーネルの組み合わせを使用して、従来の畳み込みカーネルを置き換えます。これにより掛け算が削減され、効率と性能のバランスが取れます。さまざまなデータセットでの実験では、cTCNNとpTCNNの性能が他のCNN手法と同等またはそれを超えることが示されています。従来のCNNとこれらを組み合わせて深いアーキテクチャで使用することも性能を向上させます。我々はさらに、パラメータと掛け算を最小限の精度損失で削減する簡素化されたTCNNアーキテクチャを探求しており、効率的かつ効果的なモデルを目指しています。
2025-04-09T13:36:11
Persona Dynamics: Unveiling the Impact of Personality Traits on Agents in Text-Based Games
http://arxiv.org/abs/2504.06868v1
Seungwon Lim, Seungbeen Lee, Dongjun Min, Youngjae Yu
Yonsei University
人工エージェントは、複雑な相互作用や意思決定タスクにおいてますます重要になっていますが、彼らの行動を望ましい人間の価値観と一致させることは依然として解決すべき課題です。本研究では、人間のような性格特性がエージェントの行動およびテキストベースのインタラクティブ環境におけるパフォーマンスにどのように影響するかを調査します。私たちは、PANDA(Personality Adapted Neural Decision Agents)という新しい手法を提案し、人間の性格特性をエージェントに投影してその行動を導きます。テキストベースのゲームエージェントに個性を持たせるために、(i) エージェントの行動がどのような性格タイプを示すかを特定する性格分類器を訓練し、(ii) 性格プロファイルを直接エージェントのポリシー学習プロセスに統合します。25のテキストベースのゲームを通じて16の異なる性格タイプを持つエージェントを展開し、その軌跡を分析することで、エージェントの行動決定が特定の性格プロファイルに導かれる可能性を示します。さらに、オープンネスのレベルが高い性格タイプのように、特定の性格タイプはパフォーマンスに顕著な利点を示します。これらの発見は、インタラクティブな環境において、より整合性のある効果的で人間中心の意思決定を促進するための性格適応型エージェントの可能性を強調しています。
2025-04-09T13:17:00
GraspClutter6D: A Large-scale Real-world Dataset for Robust Perception and Grasping in Cluttered Scenes
http://arxiv.org/abs/2504.06866v1
Seunghyeok Back, Joosoon Lee, Kangmin Kim, Heeseon Rho, Geonhyup Lee, Raeyoung Kang, Sangbeom Lee, Sangjun Noh, Youngjin Lee, Taeyeop Lee, Kyoobin Lee
Korea Institute of Machinery & Materials (KIMM), Gwangju Institute of Science and Technology (GIST), Korea Advanced Institute of Science and Technology (KAIST)
混雑した環境における堅牢な把持は、ロボティクスにおける未解決の課題として残っています。ベンチマークデータセットは深層学習手法を大いに進展させてきましたが、主に軽度の遮蔽がある単純なシーンに焦点を当てており、多様性が不十分であるため、実際のシナリオへの適用が制限されています。私たちは、GraspClutter6Dを発表します。これは、以下の特徴を持つ大規模な実世界の把持データセットです。(1) 高密度に配置された1,000の非常に混雑したシーン(場面あたり14.1の物体、62.6%の遮蔽)、(2) 75の環境設定(ビン、棚、テーブル)における200の物体全体を網羅したもので、4台のRGB-Dカメラを使用して複数の視点からキャプチャされています。そして(3) 52KのRGB-D画像に対して736Kの6D物体ポーズと9.3Bの実行可能なロボット把持を含む豊富な注釈があります。我々は、最新のセグメンテーション、物体ポーズ推定、および把持検出手法をベンチマークし、混雑した環境における課題についての重要な洞察を提供します。さらに、このデータセットのトレーニングリソースとしての有効性を検証し、GraspClutter6Dでトレーニングされた把持ネットワークが既存のデータセットでトレーニングされたものよりも、シミュレーションおよび実世界の実験の両方で大幅に優れていることを示します。このデータセット、ツールキット、および注釈ツールは、私たちのプロジェクトウェブサイト(https://sites.google.com/view/graspclutter6d)で一般に公開されています。
2025-04-09T13:15:46
EIDT-V: Exploiting Intersections in Diffusion Trajectories for Model-Agnostic, Zero-Shot, Training-Free Text-to-Video Generation
http://arxiv.org/abs/2504.06861v1
Diljeet Jagpal, Xi Chen, Vinay P. Namboodiri
University of Bath, Fudan University
ゼロショットでトレーニング不要の画像ベースのテキストからビデオ生成は、既存の画像ベースの拡散モデルを使用してビデオを生成することを目指す新興分野です。この分野の現在の手法は、画像生成モデルに特定のアーキテクチャの変更を必要とし、その適応性やスケーラビリティを制限しています。それに対して、私たちはモデルに依存しないアプローチを提供します。拡散軌道の交差を利用して、潜在値のみで作業します。ただし、軌道の交差だけでは、局所的なフレームごとの一貫性や多様性を得ることができませんでした。そこで、代わりにグリッドベースのアプローチを使用します。文脈内でトレーニングされたLLMを使用して、一貫性のあるフレームごとのプロンプトを生成し、別のLLMでフレーム間の違いを特定します。これに基づいて、各グリッドセルのプロンプト切り替えのタイミングを制御するCLIPベースの注意マスクを取得します。早期の切り替えは高い変動をもたらし、遅い切り替えはより多くの一貫性をもたらします。したがって、私たちのアプローチは、フレームの一貫性と変動の間の適切な制御を確保できます。私たちのアプローチは、最先端の性能を発揮し、多様な画像生成モデルでの作業においてより柔軟性があります。定量的な指標やユーザー調査を用いた経験的分析は、私たちのモデルの優れた時間的一貫性、視覚的忠実性、ユーザー満足度を確認しており、トレーニング不要の画像ベースのテキストからビデオ生成を実現する新しい方法を提供します。
2025-04-09T13:11:09
Integrating Cognitive Processing Signals into Language Models: A Review of Advances, Applications and Future Directions
http://arxiv.org/abs/2504.06843v1
Angela Lopez-Cardona, Sebastian Idesis, Ioannis Arapakis
Telefónica Scientific Research, Universitat Politècnica de Catalunya
最近、認知神経科学の自然言語処理(NLP)への統合が大きな注目を集めています。本記事では、特に視線追跡(ET)信号を活用して言語モデル(LM)やマルチモーダル大規模言語モデル(MLLM)を強化する最近の進展について、批判的かつタイムリーな概観を提供します。ユーザー中心の認知信号を取り入れることにより、これらのアプローチはデータ不足や大規模モデルのトレーニングに伴う環境コストといった重要な課題に対処します。認知信号は、効率的なデータ拡張、迅速な収束、より良い人間との整合性を実現します。本レビューでは、視覚的質問応答(VQA)などのタスクにおけるETデータの可能性とMLLMにおける幻覚を軽減する方法に重点を置き、新たな課題や研究のトレンドについても論じます。
2025-04-09T13:01:48
Adaptive Locally Linear Embedding
http://arxiv.org/abs/2504.06829v1
Ali Goli, Mahdieh Alizadeh, Hadi Sadoghi Yazdi
多様体学習手法、特に局所線形埋め込み(LLE)は、高次元データの次元削減中にローカルな近隣構造を保持するように設計されています。従来のLLEはユークリッド距離を利用して近隣を定義しますが、これは複雑なデータ内の内因的な幾何学的関係を捉えるのに苦労することがあります。この制限に対処するために、適応局所線形埋め込み(ALLE)という新しいアプローチが導入され、動的でデータ駆動型の距離計測を取り入れて、トポロジーの保存を強化します。この方法は固定距離ではなく、トポロジカルな近隣包含に焦点を当てることで近接性の概念を再定義します。データのローカルな構造に基づいてメトリックを適応させることにより、特に複雑な幾何学と高次元構造を持つデータセットに対して、優れた近隣の保存を実現します。実験結果は、ALLEが入力空間と特徴空間の間の近隣の整合性を大幅に改善し、より正確でトポロジーに忠実な埋め込みをもたらすことを示しています。このアプローチは、距離メトリックを基盤となるデータに合わせることで多様体学習を進展させ、高次元データセットにおける複雑な関係を捉えるための堅牢な解決策を提供します。
2025-04-09T12:40:13
Learning in Spiking Neural Networks with a Calcium-based Hebbian Rule for Spike-timing-dependent Plasticity
http://arxiv.org/abs/2504.06796v1
Willian Soares Girão, Nicoletta Risi, Elisabetta Chicca
University of Groningen, Zernike Institute for Advanced Materials, Groningen Cognitive Systems and Materials Center, Bio-Inspired Circuits and Systems Lab
生物学的神経ネットワークが局所的な可塑性メカニズムを通じてどのように形成されるかを理解することは、エネルギー効率の良い自己適応型情報処理システムにつながり、エッジコンピューティングシステムにおける現在の障壁のいくつかを軽減することが期待されます。生物はスパイクを利用して、スパイクのタイミングと平均発火率の両方をシナプスの強度を調整するためにシームレスに活用しますが、ほとんどのモデルはそのうちの一方に焦点を当てています。本研究では、カルシウムトレースを用いてニューロンの活動を追跡することに基づいたシナプスの修正をモデル化するヘッブ的局所学習則を提案します。この則が神経科学的研究から得られたスパイクタイミングおよびスパイクレートプロトコルの結果をどのように再現するかを示します。さらに、MNISTの数字認識におけるスパイキングニューラルネットワークのトレーニングにこのモデルを使用し、現実のパターンを学習するために必要なメカニズムの種類を示し説明します。私たちは、このモデルが相関したスパイキング活動に敏感であり、ニューロンの平均発火率や学習則のハイパーパラメーターを変更することなく、ネットワークの学習率を調整できることを示します。私たちの知る限り、これはスパイクのタイミングとレートがスパイキングニューラルネットワークの接続性を形成する役割において互補的であることを示す初めての研究です。
2025-04-09T11:39:59
Zero-Shot Image-Based Large Language Model Approach to Road Pavement Monitoring
http://arxiv.org/abs/2504.06785v1
Shuoshuo Xu, Kai Zhao, James Loney, Zili Li, Andrea Visentin
舗装面の状態を効率的かつ迅速に評価することは、維持管理の優先順位を決定し、交通の安全を確保し、車両の摩耗を最小限に抑えるために不可欠です。従来の手動検査は主観的な問題を抱えており、既存の機械学習ベースの方法は、大規模で高品質のラベル付きデータセットに依存しているため、相応のリソースを必要とし、多様な道路条件への適応性も制限されています。大規模言語モデル(LLM)の革命的な進展は、これらの課題を克服するための重要な可能性を示しています。本研究では、LLMの画像認識と自然言語理解能力を活用して道路条件を効果的に評価する革新的な自動ゼロショット学習アプローチを提案します。舗装面状態指数(PSCI)基準に沿ったプロンプトエンジニアリング戦略を用いて、複数のLLMベースの評価モデルを開発しました。これらのモデルの精度と信頼性は、公式のPSCI結果と比較して評価され、最適化されたモデルが最終的に選定されました。広範なテストにより、最適化されたモデルは、Google Street Viewの道路画像を使用して様々なレベルの専門家による評価と比較されました。結果は、LLMベースのアプローチが効果的に道路条件を評価できることを示し、包括的で構造化されたプロンプトエンジニアリング戦略を採用した最適化モデルは、高い精度と一貫性を達成し、専門家による評価をも上回ることが分かりました。さらに、最適化モデルをGoogle Street Viewの画像に成功裏に適用することは、今後の都市規模の展開の可能性も示しています。これらの発見は、道路損傷評価の自動化におけるLLMの変革的な可能性を強調し、信頼性のある評価を達成するための詳細なプロンプトエンジニアリングの重要な役割を浮き彫りにしています。
2025-04-09T11:19:17
AI, Help Me Think$\unicode{x2014}$but for Myself: Assisting People in Complex Decision-Making by Providing Different Kinds of Cognitive Support
http://arxiv.org/abs/2504.06771v1
Leon Reicherts, Zelun Tony Zhang, Elisabeth von Oswald, Yuanting Liu, Yvonne Rogers, Mariam Hassib
Microsoft Research, University College London, fortiss GmbH, Research Institute of the Free State of Bavaria, LMU Munich, Politecnico di Milano
どのようにして、人間の意思決定を効果的にサポートし、ユーザーの推論プロセスを補完し強化するAIツールを設計できますか?一般的な推奨中心のアプローチは、不適切な依存やユーザーの意思決定プロセスとの統合の欠如といった課題に直面しています。そこで、AIの出力がユーザー自身の意思決定の根拠に基づいて構築される代替のインタラクションモデルを探ります。このアプローチを「ExtendAI」と呼び、推奨ベースのAIと比較します。私たちの混合手法のユーザー調査の参加者は、投資意思決定タスクの一環として両方のAIと対話しました。結果、ExtendAIは意思決定プロセスや人々自身の考えによりうまく統合され、わずかに良い結果をもたらすことがわかりました。一方で、RecommendAIは、より新しい洞察を提供し、認知的努力を少なくすることができました。これらの発見やその他の知見の含意と、私たちの研究が明らかにしたAI支援の意思決定に関する3つの緊張について議論します。
2025-04-09T10:48:17
PLM-eXplain: Divide and Conquer the Protein Embedding Space
http://arxiv.org/abs/2504.07156v1
Jan van Eck, Dea Gogishvili, Wilson Silva, Sanne Abeln
タンパク質言語モデル(PLM)は、さまざまな予測タスクに対して強力な配列表現を生成する能力により、計算生物学を革命的に変えました。しかし、そのブラックボックス的な性質は、生物学的な解釈や実行可能な洞察への変換を制限しています。私たちは、PLMの埋め込みを2つの成分に分解することでこのギャップを埋める説明可能なアダプターレイヤー - PLM-eXplain(PLM-X)を提案します。ひとつは、確立された生化学的特徴に基づいた解釈可能なサブスペースであり、もうひとつはモデルの予測力を保持する残差サブスペースです。私たちのアダプターは、ESM2からの埋め込みを使用し、二次構造や親水性といった確立された特性を組み込みながら、高い性能を維持しています。私たちは、細胞外小胞の関連予測、膜貫通ヘリックスの同定、集積傾向の予測という3つのタンパク質レベルの分類タスクにおけるアプローチの有効性を実証します。PLM-Xは、精度を犠牲にすることなくモデルの意思決定の生物学的解釈を可能にし、さまざまな下流のアプリケーションにわたるPLMの解釈可能性を向上させる汎用的な解決策を提供します。この研究は、強力な深層学習モデルと実行可能な生物学的洞察の間に橋をかけることで、計算生物学における重要なニーズに応えています。
2025-04-09T10:46:24
FamilyTool: A Multi-hop Personalized Tool Use Benchmark
http://arxiv.org/abs/2504.06766v1
Yuxin Wang, Yiran Guo, Yining Zheng, Zhangyue Yin, Shuo Chen, Jie Yang, Jiajun Chen, Xuanjing Huang, Xipeng Qiu
Fudan University
ツール学習と大規模言語モデル(LLM)の統合は、外部ツールを活用することで複雑なタスクの処理能力を拡大しています。しかし、既存のツール学習のベンチマークは、特に動的環境において多段階の推論と誘導的知識の適応を必要とする、重要な現実の個別シナリオに十分に対応していません。このギャップを埋めるために、私たちは家族ベースの知識グラフ(KG)に基づいた新しいベンチマーク「FamilyTool」を紹介します。これは、個別化された多段階のツール使用シナリオをシミュレーションします。FamilyToolは、親族のつながりや嗜好を推論するような1から3つの関係ホップにまたがるクエリでLLMに挑戦し、モデルが再訓練なしで未知のユーザーの嗜好や関係に適応しなければならない誘導的KG設定を組み込んでいます。これは、一般化を損なう以前のアプローチの一般的な制限です。さらに、KGEToolを提案します。これは、これらの設定におけるLLMのツール利用可能性を体系的に評価するためのシンプルなKG拡張評価パイプラインです。実験では、最先端のLLMにおける顕著なパフォーマンスギャップが明らかになり、ホップの複雑さが増すにつれて精度が急激に低下し、誘導的シナリオでは深刻な一般化の欠陥が露呈されました。これらの発見は、個別化された進化する現実の文脈を扱う上での現在のLLMの限界を強調し、ツール学習フレームワークの進展が緊急に必要であることを示しています。FamilyToolは、複雑で動的な環境におけるLLMエージェントの推論、適応性、およびスケーラビリティを評価し、向上させる重要なリソースとして機能します。コードとデータセットはGitHubで入手可能です。
2025-04-09T10:42:36
Detect All-Type Deepfake Audio: Wavelet Prompt Tuning for Enhanced Auditory Perception
http://arxiv.org/abs/2504.06753v1
Yuankun Xie, Ruibo Fu, Zhiyong Wang, Xiaopeng Wang, Songjun Cao, Long Ma, Haonan Cheng, Long Ye
Communication University of China, Chinese Academy of Sciences, University of Chinese Academy of Sciences, Tencent
音声生成技術の急速な進展は、スピーチ、音、歌声、音楽における悪意のあるディープフェイク音声のリスクを増大させており、マルチメディアのセキュリティと信頼を脅かしています。既存の対策(CM)は単一タイプの音声ディープフェイク検出(ADD)においては優れた性能を発揮しますが、異なるタイプのシナリオにおいてはその性能が低下します。本論文では、すべてのタイプのADDタスクの研究に捧げられています。私たちは、スピーチ、音、歌声、音楽におけるクロスタイプのディープフェイク検出を組み込んだ、現在のCMを評価するための包括的なオールタイプADDベンチマークを初めて確立しました。その後、ADDのための特化したプロンプトトークンを学習することでSSLフロントエンドを最適化するプロンプトチューニング自己教師あり学習(PT-SSL)トレーニングパラダイムを紹介します。これはファインチューニング(FT)と比較して、458倍少ない学習可能パラメータで済みます。異なる音声タイプの聴覚的知覚を考慮し、追加のトレーニングパラメータを必要とせずに周波数領域からタイプ不変な聴覚ディープフェイク情報をキャプチャするために、ウェーブレットプロンプトチューニング(WPT)-SSL手法を提案します。これにより、オールタイプADDタスクにおいてFTを上回る性能が向上します。普遍的なCMを実現するために、すべてのタイプのディープフェイク音声を共同トレーニングに利用します。実験結果は、WPT-XLSR-AASISTが最良の性能を発揮し、すべての評価セットでの平均EERが3.58%であったことを示しています。コードはオンラインで入手可能です。
2025-04-09T10:18:45
EDIT: Enhancing Vision Transformers by Mitigating Attention Sink through an Encoder-Decoder Architecture
http://arxiv.org/abs/2504.06738v1
Wenfeng Feng, Guoying Sun
この論文では、Vision Transformerモデルに見られるアテンションシンク現象を軽減するために設計された新しいアーキテクチャ、EDIT(エンコーダーデコーダー画像トランスフォーマー)を提案します。アテンションシンクは、[CLS]トークンに過剰にアテンションが割り当てられると発生し、モデルが画像パッチを効果的に処理する能力を歪めます。これに対処するために、エンコーダーが画像パッチを処理するために自己注意を利用し、デコーダーが[CLS]トークンに焦点を当てるためにクロス注意を使うレイヤー調整されたエンコーダーデコーダーアーキテクチャを紹介します。従来のエンコーダーデコーダーフレームワークとは異なり、デコーダーは高レベルのエンコーダー表現にのみ依存するのではなく、EDITではデコーダーが低レベルの特徴から情報を抽出し、層ごとに表現を徐々に洗練させることができます。EDITは、連続的なアテンションマップを通じて自然に解釈可能であり、キーフィーチャーに対する層別の焦点を示しています。ImageNet-1kおよびImageNet-21kでの実験や転送学習タスクにおいて、EDITはDeiT3モデルに対して一貫したパフォーマンスの改善を達成しました。これらの結果は、アテンションシンクに対処し、視覚的特徴抽出を改善するEDITの設計の効果を強調しています。
2025-04-09T09:51:41
Learning global control of underactuated systems with Model-Based Reinforcement Learning
http://arxiv.org/abs/2504.06721v1
Niccolò Turcato, Marco Calì, Alberto Dalla Libera, Giulio Giacomuzzo, Ruggero Carli, Diego Romeres
University of Padova, Mitsubishi Electric Research Laboratories
この短い論文は、ICRA 2025で開催される「リアルAIGymとのAIオリンピック」競技の第3回大会に向けた私たちの提案する解決策を説明しています。私たちは、カートポール、ボール&プレート、古田振り子システムを含むさまざまな低次元ロボットタスクにおいて、その卓越したデータ効率が認められているモデルベース強化学習アルゴリズムであるモンテカルロ確率推論による制御学習(MC-PILCO)を採用しました。MC-PILCOは、相互作用データを使用してシステムダイナミクスモデルを最適化し、直接的なシステムデータの最適化ではなく、シミュレーションを通じてポリシーを洗練させることを可能にします。このアプローチは物理システムにおいて非常に効果的であり、モデルフリー(MF)の代替手段よりも優れたデータ効率を提供します。特に、MC-PILCOはこれまでの競技で1回目と2回目の両方で勝利しており、シミュレーション環境と実世界環境の両方におけるその堅牢性を示しています。アルゴリズムの簡単なレビューに加えて、ペンデューボットとアクロボットシステムのタスクにおけるMC-PILCO実装の最も重要な側面についても議論します。
2025-04-09T09:20:37
Masked Scene Modeling: Narrowing the Gap Between Supervised and Self-Supervised Learning in 3D Scene Understanding
http://arxiv.org/abs/2504.06719v1
Pedro Hermosilla, Christian Stippel, Leon Sick
TU Wien, Ulm University
自己教師あり学習は、ラベル付きで訓練されたモデルと同様に機能する多用途なオフ・ザ・シェルフの特徴を提供できるため、大規模な非注釈データセットで訓練されたモデルを通じて2Dコンピュータビジョンを変革しました。しかし、3Dシーン理解において、自己教師ありの手法は通常、タスク特化型のファインチューニングのための重み初期化ステップとしてのみ使用されており、一般的な特徴抽出のための有用性が制限されています。本論文では、この欠点に対処し、3Dシーン理解のための自己教師あり特徴の質を評価するために特別に設計された堅牢な評価プロトコルを提案します。私たちのプロトコルは、階層モデルの多解像度特徴サンプリングを使用して、モデルのセマンティック能力を捉える豊かなポイントレベルの表現を作成し、したがって線形プロービングおよび最近傍法での評価に適したものです。さらに、私たちは、オフ・ザ・シェルフの特徴のみを使用した線形プロービングのセットアップにおいて、自己教師ありモデルとして初めて監督されたモデルと同様に機能するモデルを紹介します。特に、私たちのモデルは、マスクされたシーンモデリングの目的に基づく新しい自己教師ありアプローチで、3Dでネイティブに訓練されており、マスクされたパッチの深い特徴をボトムアップの方法で再構築し、階層的な3Dモデルに特化しています。私たちの実験は、私たちの手法が監督されたモデルに対して競争力のあるパフォーマンスを達成するだけでなく、既存の自己教師ありアプローチを大幅に上回ることを示しています。モデルとトレーニングコードは、私たちのGitHubリポジトリ(https://github.com/phermosilla/msm)で見つけることができます。
2025-04-09T09:19:49
Hyperparameter Optimisation with Practical Interpretability and Explanation Methods in Probabilistic Curriculum Learning
http://arxiv.org/abs/2504.06683v1
Llewyn Salt, Marcus Gallagher
University of Queensland
ハイパーパラメータ最適化(HPO)は、強化学習(RL)において高い性能を達成するために重要です。なぜなら、RLアルゴリズムは本質的にハイパーパラメータの設定に敏感だからです。確率的カリキュラム学習(PCL)は、エージェントの学習プロセスを構造化することでRL性能を改善することを目的としたカリキュラム学習戦略ですが、効果的なハイパーパラメータ調整は依然として難しく、計算的にも負担が大きいです。本論文では、標準的なRLタスク(ポイントメイズナビゲーションやDCモーター制御を含む)におけるPCLアルゴリズムの性能に対するハイパーパラメータの相互作用とその影響を実証的に分析します。Optunaのツリー構造パルゼン推定器(TPE)と統合されたAlgOSフレームワークを使用して、ハイパーパラメータの探索空間を洗練させる戦略を提示し、最適化の効率を向上させます。さらに、ハイパーパラメータの影響を分析するために特別に設計された新しいSHAPベースの解釈可能性アプローチを導入し、個々のハイパーパラメータおよびその相互作用がRL性能にどのように影響するかに関する明確な洞察を提供します。我々の研究は、強化学習におけるハイパーパラメータ最適化の効果と計算の実現可能性を大幅に向上させる実践的なガイドラインと解釈可能性ツールを提供します。
2025-04-09T08:41:27
NLP Security and Ethics, in the Wild
http://arxiv.org/abs/2504.06669v1
Heather Lent, Erick Galinkin, Yiyi Chen, Jens Myrup Pedersen, Leon Derczynski, Johannes Bjerva
Aalborg University, NVIDIA Corporation, IT University of Copenhagen
NLPモデルが増え続けるエンドユーザーによって使用される中で、ますます重要になっている分野がNLPセキュリティ(NLPSec)です。これは、モデルの悪意のある攻撃に対する脆弱性を評価し、それに対する包括的な対策を開発することです。NLPとサイバーセキュリティの交差点での作業は、すべての人にとって安全なNLPを生み出す可能性がありますが、偶発的な見落としは無形の害(例えば、プライバシーの侵害や悪意のあるモデルの拡散)をもたらすことがあります。しかし、この新興分野では、NLPの研究倫理はこれまでサイバーセキュリティに関連する多くの長年の難題に直面していませんでした。そこで、私たちはNLPSecに関する現代の研究を調査し、サイバーセキュリティの倫理基準との関わりを探ります。文献全体を通じての傾向を特定し、害の最小化や責任ある開示といったトピックに関する懸念すべきギャップを見つけます。これらの懸念を和らげるために、私たちはNLP研究者がこの分野をより倫理的に進めるための具体的な推奨事項を提供し、従来のサイバーセキュリティとNLP倫理のギャップを埋めることを「ホワイトハットNLP」と位置付けています。この作業の目標は、NLPセキュリティに関わる人々のために、倫理的研究の意識的な文化を育成することです。
2025-04-09T08:12:34
Bridging the Gap Between Preference Alignment and Machine Unlearning
http://arxiv.org/abs/2504.06659v1
Xiaohua Feng, Yuyuan Li, Huwei Ji, Jiaming Zhang, Li Zhang, Tianyu Du, Chaochao Chen
大規模言語モデル(LLMs)における嗜好整合性(PA)の進展にもかかわらず、強化学習と人間のフィードバック(RLHF)などの主流の手法は、著しい課題に直面しています。これらのアプローチは、高品質なポジティブな嗜好の例から成るデータセットを必要とし、それを得るにはコストがかかり、学習の不安定さから計算集約的であるため、リソースが限られたシナリオでの使用が制限されています。LLMの忘却技術は、負の例の影響を直接取り除くことで、有望な代替手段を提供します。しかし、現在の研究は主に実証的な検証に重点を置いており、体系的な定量分析が欠けています。このギャップを埋めるために、PAとLLMの忘却の関係を探るフレームワークを提案します。具体的には、特定の負の例を忘却することがPAのパフォーマンスに与える影響を定量化するために、二層最適化に基づいた手法を導入します。私たちの分析は、忘却されたときにすべての負の例が整合性の向上に等しく寄与するわけではなく、その効果は例によって大きく異なることを示しています。この洞察に基づき、私たちは重要な質問を提起します:PAのパフォーマンスを最大化するために、負の例を最適に選択して重み付けするにはどうすればよいのか?この質問に答えるために、最適なPAパフォーマンスのために例を効率的に選択し、忘却することができる二層最適化を活用した「Alignのための忘却(U2A)」というフレームワークを提案します。私たちは提案された手法を広範な実験を通じて検証し、その効果を確認しました。
2025-04-09T07:49:08
A Neuro-inspired Interpretation of Unlearning in Large Language Models through Sample-level Unlearning Difficulty
http://arxiv.org/abs/2504.06658v1
Xiaohua Feng, Yuyuan Li, Chengye Wang, Junlin Liu, Li Zhang, Chaochao Chen
プライバシー保護法および規制の影響を受けて、大規模言語モデル(LLM)におけるアンラーニングがますます注目されています。しかし、現在の研究は、サンプルレベルのアンラーニングの難易度に関する解釈可能性をしばしば無視しています。既存の研究は通常、サンプルごとに均一なアンラーニングの難易度を前提としています。この単純化は、アンラーニングアルゴリズムの性能をサンプル選択に起因させ、アルゴリズムの設計に対する理解を損ね、LLMのアンラーニングの進展を誤った方向に導くリスクがあります。したがって、本研究では、LLMのアンラーニングとサンプル特性との関係を調査し、特にアンラーニングの難易度に焦点を当てます。神経科学からインスピレーションを得て、サンプルレベルのアンラーニングの難易度を定量化するためのメモリ除去難易度($\mathrm{MRD}$)メトリックを提案します。$\mathrm{MRD}$を使用して、忘れにくいサンプルと忘れやすいサンプルの特性を分析します。さらに、既存のアンラーニングアルゴリズムを最適化するために、忘れやすいサンプルを優先する$\mathrm{MRD}$ベースの重み付けサンプリング方法を提案し、アンラーニングの効率と効果を向上させます。提案されたメトリックと方法は、公共のベンチマークおよびデータセットを使用して検証され、その有効性が確認されました。
2025-04-09T07:48:10
GRAIN: Multi-Granular and Implicit Information Aggregation Graph Neural Network for Heterophilous Graphs
http://arxiv.org/abs/2504.06649v1
Songwei Zhao, Yuan Jiang, Zijing Zhang, Yang Yu, Hechang Chen
グラフニューラルネットワーク(GNN)は、グラフ表現の学習において重要な成功を収めています。しかし、最近の研究では、GNNが接続されたノードの特徴やラベルが異なるヘテロフィルなグラフタスクにおいて、シンプルなMLPよりも優れていることが少ないことが明らかになりました。これは、同質性の仮定に挑戦するものです。この問題に対処する既存の手法は、情報の粒度の重要性を見落としやすく、遠くのノード間の暗黙の関係を考慮することはほとんどありません。これらの限界を克服するために、私たちはヘテロフィルなグラフ専用に設計された新しいGNNモデル、粒度と暗黙の関係を持つグラフネットワーク(GRAIN)を提案します。GRAINは、さまざまな粒度レベルでのマルチビュー情報を集約し、遠くの非隣接ノードからの暗黙のデータを組み込むことによってノード埋め込みを強化します。このアプローチは、ローカル情報とグローバル情報を効果的に統合し、より滑らかで正確なノード表現を生み出します。また、マルチ粒度と暗黙のデータを効率的に組み合わせる適応型グラフ情報集約器を導入し、異なる同質性およびヘテロフィルなデータセットにわたる13のデータセットでの実験により、ノード表現の質を大幅に向上させます。GRAINは、12の最先端モデルを一貫して上回り、同質性およびヘテロフィルなグラフの両方で優れた結果を示しています。
2025-04-09T07:36:44
AMAD: AutoMasked Attention for Unsupervised Multivariate Time Series Anomaly Detection
http://arxiv.org/abs/2504.06643v2
Tiange Huang, Yongjun Li
Northwestern Polytechnical University
非監視型多変量時系列異常検出(UMTSAD)は、金融、ネットワーク、センサーシステムなど、さまざまな分野で重要な役割を果たしています。近年、一般的な順序タスクにおける深層学習の優れた性能により、多くのモデルが深層UMTSADタスクに特化し、特にトランスフォーマーや自己注意メカニズムに基づくモデルが驚異的な成果を上げています。しかし、これらのモデルの基礎にある系列異常関連の仮定は、集中型またはピーク型の異常パターンなど、特定の事前定義されたパターンやシナリオに限られていることがしばしばあります。これらの制約は、多様な異常状況に一般化する能力を妨げ、特にラベルが不足する場合には重大な課題を引き起こします。これらの問題に対処するために、私たちはAMADを提案します。AMADは、UMTSADシナリオのために\textbf{A}uto\textbf{M}asked Attentionを統合しています。AMADは、AutoMaskメカニズムと注意ミキシングモジュールに基づいた新しい構造を導入し、シンプルでありながら一般化された異常関連表現フレームワークを形成します。このフレームワークは、Max-Minトレーニング戦略とローカル-グローバル対照学習アプローチによってさらに強化されます。AMADは、マルチスケール特徴抽出と自動的相対関連モデリングを組み合わせることで、UMTSADの課題に対する堅牢で適応性のある解決策を提供します。広範な実験結果は、提案されたモデルがさまざまなデータセットにおいてSOTAベンチマークと比較して競争力のある性能を達成することを示しています。
2025-04-09T07:32:59
Wanting to be Understood
http://arxiv.org/abs/2504.06611v2
Chrisantha Fernando, Dylan Banarse, Simon Osindero
この論文では、相互認識の内的動機を探求し、人間は外的報酬がない場合でも理解し、理解されたいという基本的な欲求を持っているという仮説を立てています。知覚交差パラダイムのシミュレーションを通じて、強化学習エージェントにおけるさまざまな内部報酬関数の影響を探ります。理解したいという欲求は、アクティブ推論型の人工的好奇心報酬として実装され、理解されたいという欲求は、模倣、影響力/印象形成、そして他者の反応時間を予測する内的報酬を通じて実装されます。結果は、人工的好奇心だけでは社会的相互作用に対する好みを引き起こさない一方で、相互理解を強調する報酬がエージェントを相互作用を優先させるように駆動することを示しています。この内的動機は、他者の行動に対して唯一のエージェントが外的報酬を受けるタスクにおいて協力を促進できることを示します。
2025-04-09T06:15:24
InteractRank: Personalized Web-Scale Search Pre-Ranking with Cross Interaction Features
http://arxiv.org/abs/2504.06609v1
Sujay Khandagale, Bhawna Juneja, Prabhat Agarwal, Aditya Subramanian, Jaewon Yang, Yuting Wang
現代の検索システムは、パーソナライズされた結果を効率的に提供するために、マルチステージアーキテクチャを使用しています。主要なステージには、取得、プレランキング、フルランキング、ブレンディングが含まれ、数十億のアイテムからトップの選択肢を精査します。プレランキングステージは、何十万ものアイテムを数千に絞り込むためのスコアリングとフィルタリングに重要であり、計算効率のために通常は二塔モデルに依存しますが、複雑な相互作用を捕らえる能力がしばしば不足しています。クエリ-アイテムの相互作用特徴はフルランキングにとって極めて重要ですが、これらをプレランキングモデルに統合することは効率に関する課題を呈します。本稿では、Pinterestで使用されている堅牢なクロスインタラクション特徴を持つ新しい二塔プレランキングモデルであるInteractRankを紹介します。InteractRankは、スコアリング関数に履歴ユーザーエンゲージメントに基づくクエリ-アイテムの相互作用を組み込むことにより、二塔のドットプロダクトと共に、プレランキングのパフォーマンスを大幅に向上させ、遅延と計算コストを最小限に抑えます。PinterestでのリアルワールドA/B実験では、InteractRankはBM25ベースラインに対してオンラインエンゲージメントメトリックを6.5%改善し、バニラ二塔ベースラインに対しては3.7%改善しました。また、リアルタイムのユーザーシーケンスモデリングなどのInteractRankの他のコンポーネントも強調し、オフラインのアブレーションスタディを通じてその貢献を分析します。InteractRankのコードは、https://github.com/pinterest/atg-research/tree/main/InteractRank で入手可能です。
2025-04-09T06:13:58
Automated Business Process Analysis: An LLM-Based Approach to Value Assessment
http://arxiv.org/abs/2504.06600v1
William De Michele, Abel Armas Cervantes, Lea Frermann
ビジネスプロセスは組織の運営において基本的な要素ですが、手動プロセス分析の時間がかかる特性のため、最適化は依然として困難です。本論文では、価値を追加する分析を自動化するために大規模言語モデル(LLM)を活用します。この定性的プロセス分析手法は、プロセス内で価値を提供していないステップを特定することを目的としています。現在まで、この技術は主に手動で行われており、時間がかかり、主観的です。私たちの方法は、原則に基づいたアプローチを提供し、2つのフェーズで機能します。まず、高レベルの活動を詳細なステップに分解して粒度の高い分析を可能にし、次に、リーンの原則に従って各ステップを分類するために価値追加分析を実施します。このアプローチにより、定性的分析に必要な意味論的理解を維持しつつ、無駄の体系的な特定が可能になります。私たちは、50のビジネスプロセスモデルを使用してアプローチを開発し、手動の真実ラベルを収集して公開します。ゼロショットのベースラインとより構造化されたプロンプトを比較する評価では、(a)構造化されたプロンプトによる一貫した利点と、(b)両方のタスクにおける有望なパフォーマンスが明らかになりました。私たちは、定性的プロセス分析における人間の専門知識を補完しながら、手動アプローチに内在する時間と主観性を減らすためのLLMの可能性について議論します。
2025-04-09T05:52:50
Right Prediction, Wrong Reasoning: Uncovering LLM Misalignment in RA Disease Diagnosis
http://arxiv.org/abs/2504.06581v1
Umakanta Maharana, Sarthak Verma, Avarna Agarwal, Prakashini Mruthyunjaya, Dwarikanath Mahapatra, Sakir Ahmed, Murari Mandal
KIIT Bhubaneswar, KIMS Bhubaneswar, Monash University
大規模言語モデル(LLM)は、有望な事前スクリーニングツールを提供し、早期の病気発見を向上させ、恵まれないコミュニティへの医療アクセスを改善します。さまざまな病気の早期診断は、主に初期症状の非特異的な性質、専門医の不足、長期的な臨床評価の必要性のために、依然として医療において重要な課題です。これらの要因は、治療の遅れを招き、患者の結果に悪影響を及ぼす可能性があります。さまざまな病気に対する予測の精度が非常に優れているLLMは、さまざまな医療状態のための臨床事前スクリーニングと意思決定を革新する可能性を秘めています。本研究では、実世界の患者データを使用して、リウマチ性関節炎(RA)に対するLLMの診断能力を調査します。患者データは医療専門家からの診断と共に収集され、RA病予測におけるLLMのパフォーマンスが専門家の診断と比較して評価されました。病気診断において興味深いパターンが見られ、予測と説明の間に予期しない「ミスマッチ」が見つかりました。異なるLLMエージェントを使用して、一連の複数回の分析を実施しました。最も優れたモデルは、約95%の確率でリウマチ性関節炎(RA)を正しく予測します。しかし、医療専門家がモデルによって生成された推論を評価したところ、ほぼ68%が不正確であることが分かりました。この研究は、LLMの高い予測精度とその欠陥のある推論との間に明確なミスマッチが存在することを強調し、臨床設定でLLMの説明に依存することについての重要な疑問を提起します。LLMは、RA病診断の正しい答えにたどり着くために、不正確な推論を提供します。
2025-04-09T05:04:01
Exploring Ordinal Bias in Action Recognition for Instructional Videos
http://arxiv.org/abs/2504.06580v1
Joochan Kim, Minjoon Jung, Byoung-Tak Zhang
Korea Institute of Science and Technology, Seoul National University
アクション認識モデルは、 instructional videos の理解において有望な結果を達成しています。しかし、これらのモデルはしばしば、真のビデオ理解ではなく、支配的でデータセット特有のアクションシーケンスに依存しており、これを我々は ordinal bias と呼びます。この問題に対処するために、我々は2つの効果的なビデオ操作手法を提案します:Action Masking(頻繁に同時に発生するアクションのフレームをマスクする)と、Sequence Shuffling(アクションセグメントの順序をランダム化する)です。包括的な実験を通じて、現在のモデルは非標準アクションシーケンスに直面した際に著しいパフォーマンスの低下を示すことを実証し、ordinar bias への脆弱性を浮き彫りにしました。我々の発見は、評価戦略を再考し、多様な instructional videos において固定されたアクションパターンを超えて一般化できるモデルを開発することの重要性を強調しています。
2025-04-09T05:03:51
Attributes-aware Visual Emotion Representation Learning
http://arxiv.org/abs/2504.06578v1
Rahul Singh Maharjan, Marta Romeo, Angelo Cangelosi
University of Manchester, Heriot-Watt University
視覚的感情分析または認識は、画像がどのように豊かな意味を伝え、人間の知覚において感情を引き起こすかを理解することへの関心の高まりにより、かなりの注目を集めています。しかし、視覚的感情分析は、一般的な視覚的特徴と、それらが引き起こす異なる感情状態との間の複雑な関係、通称「感情ギャップ」により、従来のビジョンタスクと比較して独特の課題を提起します。研究者たちは、全体の画像から一般化された特徴を抽出するというこの課題に取り組むために、深い表現学習手法を用いています。しかし、既存のほとんどの手法は、明るさ、色彩の豊かさ、シーンの理解、顔の表情などの特定の感情的属性の重要性を見過ごしています。本論文では、明るさ(属性1)、色彩の豊かさ(属性2)、シーンコンテキスト(属性3)、顔の表情(属性4)の4つの主要な属性を活用して感情ギャップを埋める深い表現ネットワークA4Netを紹介します。属性認識と視覚的感情分析のすべての側面を融合して共同学習することで、A4Netは画像の感情的内容へのより良い洞察を提供することを目指します。実験結果は、A4Netの効果を示し、多様な視覚的感情データセットにおいて最先端の手法と比較して競争力のある性能を示しています。さらに、A4Netによって生成されたアクティベーションマップの視覚化は、異なる視覚的感情データセットにおける一般化能力を明らかにする洞察を提供します。
2025-04-09T05:00:43
Societal Impacts Research Requires Benchmarks for Creative Composition Tasks
http://arxiv.org/abs/2504.06549v1
Judy Hanwen Shen, Carlos Guestrin
Stanford University
認知タスクを自動化できるファンデーションモデルは、重要な技術的変革を代表していますが、それらの社会的影響はまだ明確ではありません。これらのシステムは興味深い進歩を約束しますが、同時に、フォーミュラ化された均質的かつ潜在的に誤解を招く合成コンテンツで私たちの情報エコシステムが溢れるリスクもあります。そのため、これらのリスクが最も重要な実際のユースケースに基づいたベンチマークの開発が不可欠です。200万件の言語モデルユーザーのプロンプトを用いたテーマ別分析を通じて、私たちはユーザーが日常の創造性を必要とする個人的なタスクで助けを求める傾向がある「創造的な構成タスク」という一般的な使用カテゴリを特定しました。私たちの詳細な分析は、これらのタスクにおける現在のベンチマークと使用パターンとのミスマッチを明らかにします。重要なのは、現在徹底的な評価が不足している同じユースケースが、負の下流の影響を引き起こす可能性があるということです。このポジションペーパーは、創造的な構成タスクに焦点を当てたベンチマークがAI生成コンテンツの社会的害を理解するための必要なステップであることを主張します。私たちは、創造的な能力を持つモデルの進展と影響を効果的に測定する新しいベンチマークの開発に役立つよう、使用パターンの透明性を高めることを呼びかけます。
2025-04-09T03:12:16
Polygon: Symbolic Reasoning for SQL using Conflict-Driven Under-Approximation Search
http://arxiv.org/abs/2504.06542v1
Pinhan Zhao, Yuepeng Wang, Xinyu Wang
University of Michigan, Simon Fraser University
私たちは、SQLのための新しい記号推論エンジンを提案します。このエンジンは、$n$個のクエリ $P_1, \cdots, P_n$ に対して、与えられたプロパティ(SMTで表現)を満たす入力 $I$ を効率的に生成することができます。これは、2つのSQLクエリの同値性を否定したり、一連のクエリの曖昧さを解消したりするなど、さまざまな文脈で有用です。私たちの最初のアイデアは、各 $P_i$ のアンダーアプロキシメーション、すなわち $P_i$ の入力-出力挙動の部分集合について推論することです。このアプローチは、意味論を考慮しつつ軽量であるため、私たちのアプローチにとって良い側面がありますが、このアイデアだけでは不完全です(固定されたアンダーアプロキシメーションでは、興味のある挙動を見逃す可能性があります)。したがって、私たちの第二のアイデアは、表現力豊かなアンダーアプロキシメーションの家族全体にわたって探索を行うことで、私たちのアプローチを完全にします(これにより、興味のあるすべてのプログラム挙動をカバーします)。これらのアイデアをツール「Polygon」として実装し、2つのタスク(すなわち、SQL同値性否定とクエリの曖昧さ解消)にわたって30,000を超えるベンチマークで評価しました。評価結果は、Polygonがすべての既存の技術を大幅に上回ることを示しています。
2025-04-09T02:46:52
OPAL: Encoding Causal Understanding of Physical Systems for Robot Learning
http://arxiv.org/abs/2504.06538v1
Daniel Tcheurekdjian, Joshua Klasmeier, Tom Cooney, Christopher McCann, Tyler Fenstermaker
我々は、言語を伴うオペラント物理エージェント(OPAL)を紹介します。これは、ロボット制御のためにフローのマッチングにトポロジー制約を導入した新しいビジョン・言語・アクションアーキテクチャです。そのために、トポロジー注意をさらに導入します。我々のアプローチは、行動シーケンスを非自明な制約を持つトポロジー構造の表現としてモデル化します。10の複雑な操作タスクにおける実験結果は、OPALがOcto、OpenVLA、そして${\pi}$0を含む従来のアプローチに比べて優れたパフォーマンスを示すことを証明しています。我々のアーキテクチャは、タスク特有のファインチューニングなしでゼロショットパフォーマンスの重要な改善を達成し、さらには推論の計算要件を42%削減します。我々のトポロジーアプローチが提供する理論的な保証は、より一貫した長期的アクションシーケンスを実現します。我々の結果は、基本的な物理法則から導出することによってロボティクスにおける学習問題の探索空間を制約する可能性と、トポロジー注意を使って因果理解をトランスフォーマーアーキテクチャに埋め込む可能性を強調しています。
2025-04-09T02:29:36
Lugha-Llama: Adapting Large Language Models for African Languages
http://arxiv.org/abs/2504.06536v1
Happy Buzaaba, Alexander Wettig, David Ifeoluwa Adelani, Christiane Fellbaum
Princeton University, Mila, McGill University
大規模言語モデル(LLM)は、幅広い自然言語アプリケーションで素晴らしい結果を達成しています。しかし、特にアフリカの言語のようなリソースが少ない言語の認識に苦労しています。これらの言語は大規模なトレーニングコーパスにおいて十分に表現されていないためです。本論文では、LLMをリソースが少ないアフリカの言語に適応させる方法を考察します。我々は、アフリカの言語からのキュレーションされたデータと高品質の英語の教育テキストを組み合わせることで、これらの言語におけるモデルの性能が大幅に改善されることを発見しました。困難なIrokoBenchデータセットでは、我々のモデルは同程度のベースラインの中で常に最高の性能を達成しており、特に知識集約型の選択式問題(AfriMMLU)において顕著です。また、クロスリンガルな質問応答ベンチマークであるAfriQAにおいて、我々のモデルはベースモデルを10%以上上回る性能を示しています。トレーニング中の英語データの役割をよりよく理解するために、2億トークンのサブセットをスワヒリ語に翻訳し、これらのデータの内容が強い性能の主な要因であることを明らかにする分析を行いました。我々は、アフリカの言語に関する将来の研究を促進するために、モデルとデータを公開します。
2025-04-09T02:25:53
Flexible Graph Similarity Computation With A Proactive Optimization Strategy
http://arxiv.org/abs/2504.06533v1
Zhouyang Liu, Ning Liu, Yixin Chen, Jiezhong He, Dongsheng Li
National University of Defense Technology
グラフ編集距離(GED)は、グラフ検索における重要な類似性測定基準であり、編集操作を通じて1つのグラフを別のグラフに変換する際の最小コストを定量化します。また、カスタマイズ可能な操作コストを許可することで柔軟性を提供します。最近の学習ベースのアプローチでは、ベクトル空間における表現間の距離を用いてGEDを近似しています。しかし、これらの手法は、最適なグラフマッピングを決定する際のコストの影響を無視しているため、さまざまな操作コストに対処するのが困難です。さらに、孤立したノード間の距離に依存しており、マッピングの非効率的な再調整を必要とします。これらの問題に対処するために、我々はグラフ編集ネットワーク(GEN)を提案します。これは、柔軟なGED計算のための新しい学習ベースのアプローチです。既存の手法がGEDの柔軟性を捉える上での限界を特定し、マッピングを確立する前に操作コストを組み込むという原則に基づいたシンプルな解決策を導入します。マッチングの効率を改善するために、我々はグラフの視点からガイダンスを積極的に最適化する戦略を提案します。この戦略は、各ノードのアラインメントの難易度としてガイダンスを初期化し、難易度伝播メカニズムを通じてグラフ内外のマッチ間の相互依存性を捉え、より情報に基づいた判断を可能にします。その結果、GENは単一のステップで最適なマッチを選択し、コストの高い再調整の必要性を最小限に抑えます。実際のデータセットや合成データセットでの結果は、GENの効果、時間効率、および適応性を示しており、最先端モデルと比較して最大37.8%の誤差削減と72.7%の推論時間削減を達成し、コスト設定やグラフサイズの変動に対しても堅牢に機能します。
2025-04-09T02:16:46
WaveHiTS: Wavelet-Enhanced Hierarchical Time Series Modeling for Wind Direction Nowcasting in Eastern Inner Mongolia
http://arxiv.org/abs/2504.06532v1
Hailong Shu, Weiwei Song, Yue Wang, Jiping Zhang
風向予測は風力エネルギー生産の最適化において重要な役割を果たしますが、方向データの円環性、多段階予測における誤差の蓄積、複雑な気象相互作用により重大な課題に直面しています。本論文では、これらの課題に対処するために、波動変換と時系列のためのニューラルヒエラルキー補間を統合した新しいモデル、WaveHiTSを提案します。我々のアプローチは、風向をU-V成分に分解し、波動変換を適用して多スケールの周波数パターンをキャッチし、階層構造を利用して複数のスケールでの時間依存性をモデル化することで、誤差の伝播を効果的に緩和します。中国内モンゴルの実世界の気象データを用いた実験では、WaveHiTSが深層学習モデル(RNN、LSTM、GRU)、トランスフォーマーベースのアプローチ(TFT、Informer、iTransformer)、およびハイブリッドモデル(EMD-LSTM)を大幅に上回ることが示されました。提案されたモデルは、深層学習再帰モデルの56{\deg}-64{\deg}に対して、約19.2{\deg}-19.4{\deg}のRMSE値を達成し、最大60分先の全ての予測ステップで一貫した精度を維持しています。さらに、WaveHiTSは0.985-0.987のベクトル相関係数(VCC)と88.5%-90.1%のヒット率を示し、ベースラインモデルを大幅に上回る堅牢性を実証しています。アブレーション研究では、各コンポーネント—波動変換、階層構造、U-V分解—が全体的な性能に意味のある貢献をしていることが確認されています。風向の今後予測におけるこれらの改善は、風力タービンのヨー制御効率の向上や風力エネルギーのグリッド統合に重要な影響を与えます。
2025-04-09T02:15:48
Beyond Moore's Law: Harnessing the Redshift of Generative AI with Effective Hardware-Software Co-Design
http://arxiv.org/abs/2504.06531v1
Amir Yazdanbakhsh
数十年にわたり、ムーアの法則はコンピュータアーキテクチャとシステム設計における堅固な柱として機能し、ハードウェアとソフトウェアの間に明確な抽象概念を促進してきました。この伝統的なムーアの計算パラダイムは、両者の溝を深め、ソフトウェア開発者がハードウェア特有の最適化に深入りすることなく、しばしばほぼ指数的な性能向上を達成することを可能にしてきました。しかし、今日、ムーアの法則は、かつての無情な性能向上が今や徐々に改善されるだけに減少し、避けられない物理的障壁に直面しています。この停滞は、従来のシステム設計哲学の再評価を必要とします。ハードウェアとソフトウェアの間に厳格な抽象を維持する従来のデカップル型システム設計哲学は、ますます時代遅れになっています。かつて明確だったソフトウェアとハードウェアの境界は急速に解消され、コーデザインに置き換わっています。コンピューティングコミュニティは、ハードウェアとソフトウェアのコーデザインへのコミットメントを強化し、システムの抽象を第一級市民として高め、現代のコンピューティングの飽くなき欲求を満たすために設計原則を再構想することが不可欠です。ハードウェア・ソフトウェアのコーデザインは最近の革新ではありません。その歴史的な進化を示すために、私はその開発を比較的明確な「時代」に5つに分類します。この投稿では、学際的チームにおけるアーキテクチャコミュニティの影響力の高まり、特にML研究者との連携を強調し、現在のコーデザインパラダイムが今日のコンピューティング環境で苦戦している理由を探ります。また、「ハードウェア宝くじ」という概念を検討し、次のコンピューティング革新の時代におけるその制約的影響を軽減するための方向性を探ります。
2025-04-09T02:10:58
TSP-OCS: A Time-Series Prediction for Optimal Camera Selection in Multi-Viewpoint Surgical Video Analysis
http://arxiv.org/abs/2504.06527v1
Xinyu Liu, Xiaoguang Lin, Xiang Liu, Yong Yang, Hongqian Wang, Qilong Sun
First Affiliated Hospital of Army Medical University, Chongqing Institute of Green Intelligent Technology, Chinese Academy of Sciences, Chongqing School, University of Chinese Academy of Sciences, Southwest Hospital, Third Military Medical University
オープン手術プロセスの記録は、教育および医療評価の目的において重要ですが、従来の単一カメラ手法は、外科医の頭や体によって引き起こされる遮蔽や固定カメラ角度による制約などの課題に直面することが多く、動画内容の理解度を低下させます。本研究では、複数の視点から手術を記録するカメラシステムを用いることで、これらの制限に対処し、遮蔽を軽減するために、手術手順を6つの異なる角度からキャプチャしました。私たちは、複数の同時に記録されたビデオストリームから最適なショットのシーケンスを選択するために、完全監視型学習に基づく時系列予測手法を提案します。これにより、各瞬間で最適な視点を確保します。私たちの時系列予測モデルは、事前に学習されたモデルを使用して手術ビデオの視覚的および意味的特徴を抽出・融合し、将来のカメラ選択を予測します。これらの特徴は、時系列依存性を捉えるためにTimeBlocksを搭載した時間予測ネットワークで処理されます。線形埋め込み層は次元削減を行い、Softmax分類器は最も高い確率に基づいて最適なカメラビューを選択します。私たちの実験では、同時に6つの異なる角度から録画されたオープン甲状腺摘出手術のビデオを5グループ作成しました。結果は、私たちの手法が伝統的な監視手法と比較して競争力のある精度を達成していることを示しており、特に長期の予測を行う際でもその効果が確認されました。さらに、私たちのアプローチは、私たちのデータセットにおける最先端の時系列予測技術よりも優れた性能を発揮します。この原稿は、外科ビデオ分析技術を進展させる革新的なフレームワークを提示することで、外科教育および患者の安全性を向上させる重要な影響を持つユニークな貢献をします。
2025-04-09T02:07:49
The Power of the Pareto Front: Balancing Uncertain Rewards for Adaptive Experimentation in scanning probe microscopy
http://arxiv.org/abs/2504.06525v1
Yu Liu, Sergei V. Kalinin
自動化実験は科学的発見を革命的に変える可能性を秘めていますが、その効果は、しばしば不確実で確率的な実世界の設定において明確に定義された最適化目標に依存します。本研究では、複数の競合する報酬のバランスを取るために、マルチオブジェクティブベイジアン最適化(MOBO)の適用を示します。最も広く使用されている基盤的なSPMモードの一つである走査プローブ顕微鏡(SPM)イメージングを用いて、MOBOが測定の質、再現性、効率を向上させるためにイメージングパラメータを最適化できることを示します。このアプローチの大きな利点は、最適化を導くだけでなく、異なる目標の間のトレードオフに関する物理的洞察を提供するパレートフロントを計算・分析できることです。さらに、MOBOはドメイン専門知識に基づいて実験的トレードオフを微調整することを可能にし、人間の介入を受け入れた意思決定を行うための自然なフレームワークを提供します。高品質で再現性のある測定を標準化し、人間の入力をAI駆動の最適化に統合することによって、本研究はMOBOを自律的な科学的発見を進展させるための強力なツールとして強調しています。
2025-04-09T01:59:31
Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?
http://arxiv.org/abs/2504.06514v1
Chenrui Fan, Ming Li, Lichao Sun, Tianyi Zhou
University of Maryland, Lehigh University
私たちは、強化学習または教師あり学習によって訓練された推論型LLMの応答の長さが、欠如した前提を伴う不適切な質問(MiP)に対して劇的に増加し、冗長で非効果的な思考に至ることを発見しました。この新たに導入されたシナリオは、一般的な過剰思考の問題を大幅に悪化させるものであり、私たちはこれをMiP-Overthinkingと名付けました。このような失敗は「テスト時間のスケーリング法則」に反するものであり、MiPを含む複数のデータセットで広く観察されています。これは、安価な過剰思考の害と批判的思考の欠如を示しています。驚くべきことに、特に推論のために訓練されていないLLMは、MiPシナリオではるかに優れたパフォーマンスを示し、不適切なクエリを迅速に特定する短い応答を生成します。これは、現在の推論型LLMの訓練レシピの重大な欠陥を示しており、効率的な思考を適切に促進しておらず、思考パターンの乱用を招いています。このような失敗の背後にある理由をさらに調査するために、さまざまなタイプのLLMにおける推論の長さ、過剰思考のパターン、および批判的思考の位置について詳細な分析を行いました。さらに、私たちの拡張アブレーション研究は、過剰思考が推論モデルの応答の蒸留を通じて伝染することを明らかにしています。これらの結果は、過剰思考の理解を深め、その問題を軽減するための新たな洞察を提供します。
2025-04-09T01:25:27
Continuous-Variable Quantum Encoding Techniques: A Comparative Study of Embedding Techniques and Their Impact on Machine Learning Performance
http://arxiv.org/abs/2504.06497v1
Minati Rath, Hema Date
この研究は、連続変数量子計算(CVQC)と古典的機械学習の交差点を探求し、CVQCのデータエンコーディング技術、特に移動エンコーディングや圧縮エンコーディングに加え、離散量子計算からの瞬時量子多項式(IQP)エンコーディングに焦点を当てています。我々はこれらのエンコーディング手法が古典的機械学習モデル、例えばロジスティック回帰、サポートベクターマシン、K近傍法、ランダムフォレストやLightGBMのようなアンサンブル法に与える影響を評価するために広範な実証分析を行いました。私たちの調査結果は、CVQCに基づくエンコーディング手法が特徴の表現力を大幅に向上させ、特に高次元で複雑なデータセットにおいて、分類精度とF1スコアの改善をもたらすことを示しています。しかし、これらの改善はエンコーディングの複雑さや機械学習モデルのアーキテクチャに依存する異なる計算コストを伴います。さらに、量子の表現力と古典的な学習可能性の間のトレードオフを検討し、これらの量子エンコーディングを現実のアプリケーションに組み込むことの実用的な可行性に関する貴重な洞察を提供します。この研究は、量子-古典ハイブリッド学習に関する研究の増加に寄与し、量子データ表現の進展と古典的機械学習ワークフローへの統合におけるCVQCの役割を強調しています。
2025-04-09T00:00:45
2025-02-27 arXiv論文リスト(cs.AI)
About
arXivに掲載されたcs.AIの論文を検索し、一部をリスト化したものです。
※AIによってAbstractを日本語に翻訳しており、内容に誤りがある可能性があります。
リスト件数: 121件
リストから抽出されたキーワード: Multi-Agent Systems, Reinforcement Learning, Federated Learning
Scalable Coordinated Learning for H2M/R Applications over Optical Access Networks (Invited)
http://arxiv.org/abs/2502.20598v1
Sourav Mondal, Elaine Wong
The University of Melbourne
次世代ファイバー無線アクセスネットワークに関する主要な研究の一つは、インダストリー5.0を促進する人と機械/ロボット(H2M/R)間の協調通信です。本論文では、広範な地理的距離を超えたスケーラブルなH2M/R通信について論じており、約72%のトレーニング時間がグローバル・ローカル協調学習を通じて節約されることで、新しい機械やロボットの迅速なオンボーディングが可能になります。
2025-02-27T23:56:51
LLMs Have Rhythm: Fingerprinting Large Language Models Using Inter-Token Times and Network Traffic Analysis
http://arxiv.org/abs/2502.20589v1
Saeif Alhazbi, Ahmed Mohamed Hussain, Gabriele Oligeri, Panos Papadimitratos
Hamad Bin Khalifa University, KTH Royal Institute of Technology
大規模言語モデル(LLM)がさまざまな分野や業界の多くの技術エコシステムにますます統合されるにつれて、どのモデルが展開されているのか、または対話されているのかを特定することは、システムのセキュリティと信頼性にとって重要です。現在の検証方法は通常、生成された出力を分析してソースモデルを特定することに依存しています。しかし、これらの技術は敵対的攻撃に対して脆弱であり、事後処理的に機能し、検証可能なフィンガープリントを注入するためにモデルの重みへのアクセスが必要になる場合があります。本論文では、リアルタイムで機能し、暗号化されたネットワークトラフィック条件下でも効果的な新しい受動的かつ非侵襲的なフィンガープリンティング技術を提案します。我々の方法は、以前に生成されたトークンに基づいて1トークンずつテキストを生成する言語モデルの自動回帰的生成の本質を利用し、ネットワークを介して出力がストリーミングされた場合でも持続するリズムや心拍のようなユニークな時間的パターンを作り出します。連続トークン間の時間間隔(ITT)を測定することで、異なる言語モデルを高い精度で特定できることがわかります。ネットワークトラフィック分析を利用してこれらのタイミングパターンを捉えるための深層学習(DL)パイプラインを開発し、ローカルホストマシン(GPU/CPU)、ローカルエリアネットワーク(LAN)、リモートネットワーク、バーチャルプライベートネットワーク(VPN)を含むさまざまな展開シナリオで16の小型言語モデル(SLM)と10の独自のLLMで評価しました。実験結果は、提案した技術が効果的であり、異なるネットワーク条件下でテストしても高い精度を維持することを確認しています。この研究は、実世界のシナリオにおけるモデル識別の新しい道を開き、より安全で信頼性の高い言語モデルの展開に貢献します。
2025-02-27T23:22:01
LiteASR: Efficient Automatic Speech Recognition with Low-Rank Approximation
http://arxiv.org/abs/2502.20583v1
Keisuke Kamahori, Jungo Kasai, Noriyuki Kojima, Baris Kasikci
University of Washington, Kotoba Technologies Inc.
現代の自動音声認識(ASR)モデル、例えばOpenAIのWhisperは、ディープエンコーダ・デコーダアーキテクチャに依存しており、エンコーダは高い計算集約性のために効率的な展開のためのクリティカルなボトルネックとなっています。私たちはLiteASRを導入します。これはASRエンコーダのための低ランク圧縮手法であり、転記精度を維持しながら推論コストを大幅に削減します。我々のアプローチは、中間活性化で観察される強い低ランク特性を利用しています。少量のキャリブレーションデータセットを用いて主成分分析(PCA)を適用することで、低ランク行列の乗算の連鎖を用いて線形変換を近似し、さらには自己注意を減少次元で機能させるよう最適化します。評価結果は、私たちの手法がWhisperのlarge-v3のエンコーダサイズを50%以上圧縮でき、Whisperのmediumのサイズと一致し、より良い転記精度を実現することを示しています。これにより、効率とパフォーマンスの新しいパレート最適フロンティアが確立されます。LiteASRのコードは、https://github.com/efeslab/LiteASR で入手可能です。
2025-02-27T22:52:21
Interpreting CLIP with Hierarchical Sparse Autoencoders
http://arxiv.org/abs/2502.20578v1
Vladimir Zaigrajew, Hubert Baniecki, Przemyslaw Biecek
スパースオートエンコーダー(SAE)は、神経ネットワークにおいて解釈可能な特徴を検出し、操作するのに有用であり、特に複雑なマルチモーダル表現を理解する可能性が高いです。解釈可能な特徴を見つける能力により、SAEは大規模なビジョン-言語モデル(例:CLIPやSigLIP)の分析に特に価値があります。これらのモデルは現代のシステムの基本的な構成要素ですが、解釈と制御が難しいままです。しかし、現在のSAE手法は、再構成品質とスパース性の両方を同時に最適化することに制限されており、活性化抑制や厳格なスパース性制約に依存しています。これを受けて、私たちはマトリョーシカSAE(MSAE)を紹介します。これは、複数の粒度で階層的な表現を同時に学習し、妥協することなく両方の指標を直接最適化できる新しいアーキテクチャです。MSAEは、再構成品質とスパース性の間に新しい最先端のパレートフロンティアを確立し、CLIPに対して0.99のコサイン類似度と0.1未満の説明されていない分散の割合を実現しながら、おおよそ80%のスパース性を維持します。最後に、私たちは、MSAEをCLIPの解釈と制御のツールとして活用できることを示し、表現から120以上のセマンティック概念を抽出して、CelebAのような下流タスクで概念ベースの類似性検索とバイアス分析を実行します。
2025-02-27T22:39:13
PFformer: A Position-Free Transformer Variant for Extreme-Adaptive Multivariate Time Series Forecasting
http://arxiv.org/abs/2502.20571v1
Yanhong Li, David C. Anastasiu
多変量時系列(MTS)予測は、天候、エネルギー、金融などの分野で重要です。しかし、ディープラーニングの進展にもかかわらず、従来のトランスフォーマーベースのモデルは、単一のトークン埋め込みによって重要な変数間の関係の影響を軽減し、特に稀なまたは極端なイベントを含むデータセットにおいて変数間の複雑な依存関係を効果的に捉えるのに苦労しています。これらのイベントは、重要な不均衡を生み出し、高い歪度を引き起こし、正確な予測を困難にします。本研究では、PFformerという位置に依存しないトランスフォーマーベースのモデルを導入します。これは、特に極端な変動性が特徴の挑戦的なデータセットのために設計された単一ターゲットのMTS予測に用います。PFformerは、二つの新しい埋め込み戦略を統合しています:強化特徴ベースの埋め込み(EFE)およびオートエンコーダーベースの埋め込み(AEE)です。EFEは、関連するシーケンスの部分集合を高次元の空間にマッピングすることで、位置の制約なしに変数間の依存関係を効果的にエンコードし、エンコーダーの機能を強化します。PFformerは、MTSモデリングにおける従来の位置エンコーディングの制限なしに、優れた予測精度を示しています。私たちは、PFformerを四つの挑戦的なデータセットで評価し、3日先の長シーケンス予測と、リアルタイムの水管理の意思決定プロセスを反映する4時間ごとのローリング予測という2つの重要な予測シナリオに焦点を当てました。PFformerは、最先端のモデルと比較して、20%から60%の顕著な改善を示しました。
2025-02-27T22:21:27
DPZV: Resource Efficient ZO Optimization For Differentially Private VFL
http://arxiv.org/abs/2502.20565v1
Jianing Zhang, Evan Chen, Chaoyue Liu, Christopher G. Brinton
Purdue University
垂直連合学習(VFL)は、特徴が分割されたデータ間での共同モデル訓練を可能にしますが、大規模モデルへのスケーリング時に重大なプライバシーリスクと非効率性に直面します。私たちは、微分プライバシー(DP)を垂直連合学習に統合するメモリ効率の良いゼロ次(ZO)最適化フレームワークであるDPZVを提案します。このフレームワークは、次の3つの重要な課題に対処します:(1)勾配の漏洩によるプライバシーの脆弱性、(2)一次法の高い計算/通信コスト、および(3)従来のゼロ次手法における過剰なメモリ使用量です。私たちのフレームワークは、2点勾配推定を通じて逆伝播を排除し、一時法の対応物と比較してクライアントのメモリ使用量を90%削減し、非同期通信を可能にします。サーバー上で戦略的にガウスノイズを注入することで、DPZVは第三者の信頼仮定なしに厳密な$(\epsilon, \delta)$-DP保証を実現します。理論的分析は、非凸目的の下で集中型ケースと一致する収束率を確立します。画像および自然言語処理のベンチマークに関する広範な実験により、DPZVがすべてのベースラインに対して精度で優れ、強力なプライバシー保証($\epsilon \leq 10$)を提供し、遥かに少ない計算資源を必要とすることが示され、リソース制約のあるVFL展開におけるプライバシーと有用性の新しいトレードオフを確立しています。
2025-02-27T22:07:16
$Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training
http://arxiv.org/abs/2502.20548v1
Jin Peng Zhou, Kaiwen Wang, Jonathan Chang, Zhaolin Gao, Nathan Kallus, Kilian Q. Weinberger, Kianté Brantley, Wen Sun
Cornell University, Netflix, Databricks, Harvard University
強化学習(RL)の事後訓練は、LLMの整合性と推論にとって重要ですが、PPOやDPOなどの既存のポリシーベースの手法は、事前訓練から受け継いだショートカットを修正するには不十分であることがあります。本研究では、最適な正則化された$Q$関数を使用して参照ポリシーを導くためのKL正則化RL向けの価値ベースのアルゴリズム$Q\sharp$を提案します。私たちは、集約されたオンラインデータセットに基づいて分布型RLを用いて最適な$Q$関数を学習することを提案します。従来の価値ベースの基準が非正則化$Q$値を用いてモデルを導くのに対し、我々の方法は理論的に原則に基づいており、KL正則化RL問題の最適ポリシーを確実に学習します。経験的には、$Q\sharp$は数学的推論ベンチマークにおいて従来の基準を上回り、参照ポリシーへのKLダイバージェンスを抑えています。理論的には、KL正則化RLから後悔のないオンライン学習への還元を確立し、実現可能性のみに基づく決定論的MDPに対する最初のバウンドを提供します。分布型RLのおかげで、我々のバウンドは分散に依存し、参照ポリシーの分散が小さい場合に速く収束します。要するに、私たちの結果は、$Q\sharp$が事後訓練されたLLMに対して効果的なアプローチであることを強調しており、パフォーマンスの向上と理論的保証の両方を提供しています。コードはhttps://github.com/jinpz/q_sharpで入手可能です。
2025-02-27T21:43:00
Revisiting Kernel Attention with Correlated Gaussian Process Representation
http://arxiv.org/abs/2502.20525v1
Long Minh Bui, Tho Tran Huu, Duy Dinh, Tan Minh Nguyen, Trong Nghia Hoang
FPT Software, Washington State University, National University of Singapore
トランスフォーマーは、逐次データをモデル化するための事実上の手法として、ますます一般的になっており、最先端のパフォーマンスを誇っています。その広範な使用により、モデルの不確実性を推定し、キャリブレーションする能力は、頑健なトランスフォーマーモデルを理解し設計する上で重要です。これを達成するために、以前の研究では、トランスフォーマーの注意ユニットに対して不確実性キャリブレーションを行うためにガウス過程(GP)を使用し、顕著な成功を収めてきました。しかし、このようなアプローチでは、GPのカーネル仕様に必要な対称条件を確保するために、トランスフォーマーを対称的な注意の空間に制限する必要があり、モデルの表現能力が低下します。この制約を緩和するために、相関ガウス過程トランスフォーマー(CGPT)を提案します。これは、自己注意ユニットを二つの相関したガウス過程(CGP)の間の交差共分散としてモデル化する新しいクラスのトランスフォーマーです。これにより、注意に非対称性を持たせることができ、GPベースのトランスフォーマーの表現能力を向上させることができます。また、CGPのスパース近似を導出し、スケーラビリティを向上させました。我々の実証研究では、CGPベースおよびスパースCGPベースのトランスフォーマーが、様々なベンチマークタスクにおいて最先端のGPベースのトランスフォーマーより優れたパフォーマンスを達成したことが示されています。我々の実験のコードは、https://github.com/MinhLong210/CGP-Transformers で入手可能です。
2025-02-27T21:21:48
Personas Evolved: Designing Ethical LLM-Based Conversational Agent Personalities
http://arxiv.org/abs/2502.20513v1
Smit Desai, Mateusz Dubiel, Nima Zargham, Thomas Mildner, Laura Spillner
Northeastern University, University of Luxembourg, University of Bremen
大規模言語モデル(LLM)の出現は、会話型ユーザーインターフェース(CUI)を革命的に変え、社会科学から医療までのさまざまな領域で、より動的で文脈を理解した人間のようなインタラクションを可能にしました。しかし、LLMベースのペルソナの急速な普及は、バイアス、操作、予期しない社会的影響を含む重要な倫理的および実践的な懸念を引き起こしています。従来のCUIとは異なり、ペルソナは明確な意図を持って慎重に設計されているのに対し、LLMベースのペルソナは広範なデータセットから動的に応答を生成するため、その行動は予測しにくく、管理が難しくなっています。このワークショップは、CUIと広範なAIコミュニティのギャップを埋め、LLMベースのペルソナの責任ある設計と評価に関する学際的な対話を促進することを目的としています。研究者、デザイナー、実践者を一堂に集め、ベストプラクティスを探り、倫理的ガイドラインを策定し、透明性、包摂性、ユーザー中心のインタラクションを確保するフレームワークを促進します。これらの課題に協力して取り組むことで、私たちは社会的価値観と期待に沿ったLLM駆動のCUIの未来を形作ることを目指します。
2025-02-27T20:46:54
TripCraft: A Benchmark for Spatio-Temporally Fine Grained Travel Planning
http://arxiv.org/abs/2502.20508v1
Soumyabrata Chaudhuri, Pranav Purkar, Ritwik Raghav, Shubhojit Mallick, Manish Gupta, Abhik Jana, Shreya Ghosh
最近の大規模言語モデル(LLM)の調査における進展は、個別化された旅行計画エージェントとしての潜在能力を探索していますが、既存のベンチマークは実世界での適用性に限界があります。TravelPlannerやTravelPlanner+のような既存のデータセットは、半合成データへの依存、空間的一貫性の欠如、重要な旅行制約の不足に悩まされており、実用的な旅程生成には不十分です。これらのギャップに対処するために、私たちはTripCraftを導入しました。TripCraftは、公共交通機関のスケジュール、イベントの可用性、多様な観光施設のカテゴリー、パーソナライズを強化するためのユーザーペルソナなど、現実世界の制約を統合した時空間的一貫性のある旅行計画データセットです。既存のバイナリ検証方法を超えてLLM生成プランを評価するために、私たちは5つの連続評価メトリック、すなわち、Temporal Meal Score、Temporal Attraction Score、Spatial Score、Ordering Score、及びPersona Scoreを提案します。これらは複数の次元で旅程の質を評価します。私たちのパラメータに基づいた設定は、食事のスケジューリングを大幅に向上させ、7日間のシナリオでTemporal Meal Scoreを61%から80%に改善します。TripCraftは、LLM駆動の個別化された旅行計画のための新しいベンチマークを確立し、旅程生成のためのより現実的で制約を考慮したフレームワークを提供します。データセットとコードベースは、受理され次第公開される予定です。
2025-02-27T20:33:28
A Thousand Words or An Image: Studying the Influence of Persona Modality in Multimodal LLMs
http://arxiv.org/abs/2502.20504v1
Julius Broomfield, Kartik Sharma, Srijan Kumar
大規模言語モデル(LLM)は、最近、多様なペルソナを具現化する上で顕著な進歩を示し、会話エージェントやバーチャルアシスタントとしての効果を高めています。その結果、LLMはマルチモーダル情報の処理と統合において重要な進展を遂げました。しかし、ヒューマンペルソナはテキストと画像の両方で表現できるにもかかわらず、ペルソナのモダリティがLLMによる具現化にどの程度影響を与えるのかは、まだ十分に探究されていません。本稿では、異なるモダリティがマルチモーダルLLMにおけるペルソナの表現力にどのように影響するかを調査します。この目的のために、年齢、性別、職業、場所が異なる40の多様なペルソナの新しいモダリティ並行データセットを作成します。これには、ペルソナを等価に表現するための4つのモダリティが含まれており、画像のみ、テキストのみ、画像と小さなテキストの組み合わせ、およびテキストが視覚的にスタイライズされてペルソナ関連の属性を伝えるタイポグラフィ画像が含まれています。次に、各ペルソナが属性やシナリオにおいてどの程度よく具現化されているかを評価するための60の質問と対応するメトリクスからなる体系的な評価フレームワークを作成します。$5$ のマルチモーダルLLMによる包括的な実験は、詳細なテキストで表現されたペルソナがより多くの言語習慣を示す一方で、タイポグラフィ画像はしばしばペルソナとの一貫性が高いことを示しています。私たちの結果は、LLMがしばしば画像を通じて伝達されるペルソナ特有の詳細を見落としていることを明らかにし、根底にある制限を示すとともに、このギャップを埋めるための今後の研究の道を開きます。データとコードは https://github.com/claws-lab/persona-modality で公開します。
2025-02-27T20:25:00
On Benchmarking Human-Like Intelligence in Machines
http://arxiv.org/abs/2502.20502v1
Lance Ying, Katherine M. Collins, Lionel Wong, Ilia Sucholutsky, Ryan Liu, Adrian Weller, Tianmin Shu, Thomas L. Griffiths, Joshua B. Tenenbaum
最近のベンチマーク研究では、AIがさまざまな認知タスクにおいて人間レベルのパフォーマンスに達するか、さらにはそれを超えたと主張されています。しかし、このポジションペーパーでは、現在のAI評価の枠組みは人間に似た認知能力を評価するには不十分であると論じています。私たちは、いくつかの重要な欠点を指摘します。具体的には、人間によって検証されたラベルの不足、人間の反応の変動性や不確実性の不十分な表現、そして単純化された生態学的に無効なタスクへの依存です。私たちは、10の既存のAIベンチマークに対して人間評価研究を実施し、タスクとラベルの設計における重大なバイアスと欠陥を示すことで、私たちの主張を支持します。これらの限界に対処するために、将来のベンチマークを開発するための5つの具体的な提言を行い、AIにおける人間に似た認知能力のより厳密で意味のある評価を可能にし、そうしたAIアプリケーションにさまざまな影響を与えることを目指します。
2025-02-27T20:21:36
Unified Kernel-Segregated Transpose Convolution Operation
http://arxiv.org/abs/2502.20493v1
Vijay Srinivas Tida, Md Imran Hossen, Liqun Shan, Sai Venkatesh Chilukoti, Sonya Hsu, Xiali Hei
深層学習応用のための転置畳み込み層の最適化は、カーネル分離メカニズムによって達成されます。しかし、カーネル分離には欠点があり、スレッドを起動する際に奇数次元の出力フィーチャーマップを得るために追加の要素を計算する必要があります。この問題を軽減するために、私たちは、1つの統一されたカーネルを使用して4つのサブカーネルを実行することで、メモリと計算リソースの使用を制限する統一カーネル分離アプローチを導入します。研究結果は、提案されたアプローチがRTX 2070 GPU(Intel Xeon CPU)の特定のデータセットでテストした際に平均して2.03倍(3.89倍)の計算速度向上を達成することを示しています。アブレーションスタディの結果では、よく知られた敵対的生成ネットワーク(GAN)の転置畳み込み層を評価した際に、平均3.5倍の計算速度向上が示されています。EB-GANモデルの転置畳み込み層に提案した方法を実装することで、最大35MBの重要なメモリ節約が実現されました。
2025-02-27T19:56:25
EgoNormia: Benchmarking Physical Social Norm Understanding
http://arxiv.org/abs/2502.20490v1
MohammadHossein Rezaei, Yicheng Fu, Phil Cuvin, Caleb Ziems, Yanzhe Zhang, Hao Zhu, Diyi Yang
人間の活動は規範によって調整されています。現実世界で行動する際、人間は規範に従うだけでなく、異なる規範間のトレードオフにも考慮します。しかし、機械はしばしば、特に規範が物理的および社会的文脈に基づいている場合、規範の理解と推論に関する明示的な監視なしにトレーニングされています。視覚-言語モデル(VLM)の規範的推論能力を向上させ、評価するために、我々はEgoNormia $|\epsilon|$を提案します。これは、人間の相互作用の1,853のエゴセントリックなビデオで構成され、各ビデオには規範的行動の予測と正当化の両方を評価する2つの関連質問が含まれています。規範的行動は、安全性、プライバシー、プロクセミクス、礼儀、協力、調整/積極性、コミュニケーション/明確性の7つのカテゴリーを含みます。このデータセットを大規模に編纂するために、我々はビデオサンプリング、自動回答生成、フィルタリング、そして人間による検証を活用する新しいパイプラインを提案します。我々の研究は、現在の最先端の視覚-言語モデルが強固な規範理解に欠けていることを示しており、EgoNormiaでのスコアは最大45%(人間のベンチマークは92%)です。各次元におけるパフォーマンスの分析は、実世界のエージェントに適用した場合の安全性、プライバシー、協力とコミュニケーション能力の大幅なリスクを際立たせています。さらに、取得に基づく生成手法を通じて、EgoNomiaを使用してVLMの規範的推論を強化することが可能であることを示します。
2025-02-27T19:54:16
R-ParVI: Particle-based variational inference through lens of rewards
http://arxiv.org/abs/2502.20482v1
Yongchao Huang
University of Aberdeen
部分的に知られた密度(例えば定数まで)をサンプリングするための報酬誘導型の勾配フリーParVI手法「R-ParVI」が提案されました。R-ParVIは、サンプリング問題を報酬によって駆動される粒子フローとして定式化します:粒子は事前分布から引き出され、ターゲット密度からの評価を組み合わせた報酬メカニズムによって決定された動きでパラメータ空間を移動し、定常状態での粒子配置がターゲットのジオメトリを近似します。粒子と環境との相互作用は確率的摂動と報酬メカニズムによってシミュレーションされ、粒子を高密度領域に向かわせつつ多様性を維持します(例えば、クラスタに崩壊するのを防ぐなど)。R-ParVIは、ベイズ推論や生成モデルに見られるような確率モデルのクラスに対して、高速で柔軟、スケーラブルかつ確率的なサンプリングと推論を提供します。
2025-02-27T19:50:22
Promote, Suppress, Iterate: How Language Models Answer One-to-Many Factual Queries
http://arxiv.org/abs/2502.20475v1
Tianyi Lorena Yan, Robin Jia
University of Southern California
一対多の事実に関するクエリ(例:ある国の都市を一覧にする)に答えるために、言語モデル(LM)は、知識を同時に思い出しながら、以前の回答を繰り返さないようにする必要があります。これらの2つのサブタスクはどのように内部で実装され、統合されているのでしょうか?複数のデータセットとモデルを通じて、私たちはプロモート・ザン・サプレッセ(促進・抑制)メカニズムを特定しました:モデルはまずすべての回答を思い出し、その後、以前に生成されたものを抑制します。具体的には、LMは、知識を思い出すために主題及び前の回答トークンの両方を使用し、主題情報を伝播させる注意機構(アテンション)があり、MLP(多層パーセプトロン)が回答を促進します。次に、アテンションは以前の回答トークンに注目し、それを抑制し、一方でMLPは抑制信号を増幅します。私たちのメカニズムは、広範な実験的証拠によって裏付けられています:初期デコーディングおよび因果追跡を使用することに加え、私たちはコンポーネントが異なるトークンをどのように使用するかを、指定されたトークンからの集約されたアテンションの更新をデコードする\emph{トークンレンズ}と、指定されたトークンへのアテンションを削除した後のMLP出力の変化を分析するノックアウトメソッドを導入することで分析しています。全体として、私たちはLMの内部コンポーネントが異なる入力トークンとどのように相互作用して複雑な事実の想起を支えるのかについての新しい洞察を提供します。コードはhttps://github.com/Lorenayannnnn/how-lms-answer-one-to-many-factual-queriesで入手可能です。
2025-02-27T19:23:15
Sim-to-Real Reinforcement Learning for Vision-Based Dexterous Manipulation on Humanoids
http://arxiv.org/abs/2502.20396v1
Toru Lin, Kartik Sachdev, Linxi Fan, Jitendra Malik, Yuke Zhu
UC Berkeley, NVIDIA, UT Austin
強化学習は、多様な問題領域において人間レベルまたはそれ以上の能力を達成するという有望な結果をもたらしていますが、巧みなロボットの操作における成功は限られています。本研究では、ヒューマノイドの具現化において接触が豊富な操作タスクのコレクションを解決するために強化学習を適用する際の主要な課題を調査します。特定された課題を克服するための新たな技術を導入し、実証的な検証を行います。私たちの主な貢献には、シミュレーション環境を現実世界に近づける自動化されたリアルからシムへの調整モジュール、長期間の接触豊富な操作タスクに対する報酬エンジニアリングを簡略化する一般化された報酬設計スキーム、難しい探索問題のサンプル効率を改善しながらシムからリアルへのパフォーマンスを維持する分割して征服する蒸留プロセス、およびシムからリアルへの認識ギャップを橋渡しするための疎および密なオブジェクト表現の混合が含まれます。私たちは、各技術に関する消失研究を伴って、3つのヒューマノイド巧みな操作タスクにおいて有望な結果を示します。本研究は、シムからリアルへの強化学習を用いてヒューマノイドの巧みな操作を学習する成功したアプローチを示し、人間のデモンストレーションなしで堅牢な一般化と高いパフォーマンスを達成します。
2025-02-27T18:59:52
Walking the Web of Concept-Class Relationships in Incrementally Trained Interpretable Models
http://arxiv.org/abs/2502.20393v1
Susmit Agrawal, Deepika Vemuri, Sri Siddarth Chakaravarthy P, Vineeth N. Balasubramanian
概念に基づく手法は、標準的な監視環境において解釈可能なニューラルネットワークを開発するための有望な方向性として浮上しています。しかし、漸進的な設定でそれらを研究するほとんどの作品は、すべての経験において静的な概念セットを仮定するか、各経験が異なる概念セットに依存していると仮定しています。本研究では、新しいクラスが新しい概念を導入するだけでなく、古い概念にも依存する可能性がある、より現実的で動的な設定における概念に基づくモデルを研究します。我々は、概念とクラスが複雑な関係のネットワークを形成しており、このネットワークは劣化しやすく、経験にわたって保存され、補強される必要があることを示します。既存の概念に基づくモデルは、壊滅的な忘却を防ぐための手法を使用して学習されても、これらの関係を保持できないことを示す新しい指標を導入します。なぜなら、それらは概念、クラス、および概念-クラス関係のレベルで同時に忘却を扱うことができないからです。これらの問題に対処するために、経験にわたる学習可能なパラメータの数を増やすことなく分類を行うためにマルチモーダルな概念を使用する新しい手法 - MuCIL - を提案します。マルチモーダルな概念は自然言語で提供される概念と整列されており、設計上解釈可能です。広範な実験を通じて、我々のアプローチが他の概念に基づくモデルと比較して最先端の分類性能を達成し、場合によっては分類性能が2倍以上になることを示します。また、概念に対する介入を行うモデルの能力を研究し、入力画像内の視覚的概念を特定し、事後解釈を提供することができることを示します。
2025-02-27T18:59:29
Large Language Model Strategic Reasoning Evaluation through Behavioral Game Theory
http://arxiv.org/abs/2502.20432v1
Jingru Jia, Zehua Yuan, Junhao Pan, Paul E. McNamara, Deming Chen
University of Illinois Urbana-Champaign
戦略的意思決定は、エージェントが他者の反応に基づいて選択を適応させるインタラクティブな推論を含みますが、大規模言語モデル(LLMs)の既存の評価はしばしばナッシュ均衡(NE)近似に重点を置き、戦略的選択を駆動するメカニズムを見落としています。このギャップを埋めるために、行動ゲーム理論に基づいた評価フレームワークを導入し、推論能力と文脈効果を分離します。22の最先端LLMをテストした結果、GPT-o3-mini、GPT-o1、DeepSeek-R1がほとんどのゲームで優位であることがわかりましたが、モデルのスケールだけではパフォーマンスを決定しないことも示されています。プロンプトの強化に関しては、Chain-of-Thought(CoT)プロンプトが普遍的に効果的ではなく、特定のレベルのモデルに対してのみ戦略的推論を向上させ、他の場所では限られた利益しか提供しないことがわかりました。さらに、モデルに対するエンコードされた人口統計的特徴の影響を調査し、特定の割り当てが意思決定パターンに影響を与えることを観察しました。例えば、GPT-4oは男性よりも女性的な特性を持つときに強い戦略的推論を示し、Gemmaは他の性的指向と比較して異性愛アイデンティティに対して高い推論レベルを割り当てており、固有のバイアスを示しています。これらの発見は、改善された推論を公正さとバランスを取るために倫理基準と文脈の整合性の必要性を強調しています。
2025-02-27T18:58:31
Physics-Driven Data Generation for Contact-Rich Manipulation via Trajectory Optimization
http://arxiv.org/abs/2502.20382v1
Lujie Yang, H. J. Terry Suh, Tong Zhao, Bernhard Paus Graesdal, Tarik Kelestemur, Jiuguang Wang, Tao Pang, Russ Tedrake
Massachusetts Institute of Technology, Computer Science and Artificial Intelligence Laboratory, Robotics and AI Institute
私たちは、物理ベースのシミュレーション、人間のデモンストレーション、モデルベースの計画を統合した低コストのデータ生成パイプラインを提案します。このパイプラインは、接触の多いロボット操作タスクのために、大規模で高品質のデータセットを効率的に生成します。仮想現実シミュレーション環境で収集された少数の具現化柔軟な人間のデモンストレーションから始まり、このパイプラインは最適化に基づく運動学的リターゲティングと軌道最適化を使用して、さまざまなロボット具現化や物理的パラメータに適応させるためにこれらのデモンストレーションを洗練します。このプロセスにより、身体的に一貫した多様なデータセットが生成され、異なるハードウェア構成や物理的パラメータの下で収集されたレガシーデータセットを再利用する可能性を提供します。私たちは、生成されたデータセットを使用して、浮遊するAllegroハンドや二手ロボットアームを含む複数のロボット具現化にわたる、困難な接触の多い操作タスクのために拡散ポリシーをトレーニングすることによって、このパイプラインの有効性を検証します。訓練されたポリシーは、ほとんど人間の入力なしで、二手iiwaアームのハードウェア上でゼロショットで展開され、高い成功率を達成します。プロジェクトのウェブサイト:https://lujieyang.github.io/physicsgen/.
2025-02-27T18:56:01
Multi-Turn Code Generation Through Single-Step Rewards
http://arxiv.org/abs/2502.20380v1
Arnav Kumar Jain, Gonzalo Gonzalez-Pumariega, Wayne Chen, Alexander M Rush, Wenting Zhao, Sanjiban Choudhury
私たちは、マルチターンの実行フィードバックからのコード生成の問題に取り組みます。既存の方法は、フィードバックなしでコードを生成するか、マルチターンの報酬を最適化するために複雑で階層的な強化学習を使用します。私たちは、単一のステップの報酬のみを使用してマルチターンのコード生成を解決するシンプルでスケーラブルなアプローチである$\mu$Codeを提案します。私たちの重要な洞察は、コード生成は1ステップで回復可能なMDP(マルコフ決定過程)であり、正しいコードは任意の中間コード状態から単一ターンで回復できるということです。$\mu$Codeは、マルチターンの実行フィードバックに基づいてコードソリューションを提供する生成器と、新たに生成されたコードにスコアを付ける検証器の両方を段階的にトレーニングします。実験評価の結果、私たちのアプローチは最先端のベースラインに対して大幅な改善を達成することが示されました。報酬モデルと方針の設計選択についての分析を提供し、マルチターンの実行フィードバックを活用する$\mu$Codeの効果を示します。私たちのコードはhttps://github.com/portal-cornell/muCodeで入手可能です。
2025-02-27T18:55:05
Multi-Agent Verification: Scaling Test-Time Compute with Multiple Verifiers
http://arxiv.org/abs/2502.20379v1
Shalev Lifshitz, Sheila A. McIlraith, Yilun Du
テスト時により多くの計算リソースを利用することで、大規模言語モデル(LLMs)は追加のトレーニングなしで改善することができます。一般的な戦略の一つは、候補出力を評価するために検証者を使用することです。本研究では、テスト時の計算における新しいスケーリング次元として、検証者の数を増やすことを提案します。私たちは、パフォーマンスを向上させるために複数の検証者を組み合わせるテスト時の計算パラダイムとして、マルチエージェント検証(MAV)を導入します。MAVシステムの検証者として、出力の異なる側面を確認するように指示された市販のLLMであるアスペクト検証者(AV)を提案します。AVは追加のトレーニングなしに簡単に組み合わせることができるため、MAVにとって便利な構成要素です。さらに、BoN-MAVというシンプルなマルチエージェント検証アルゴリズムを導入し、これは最良のnサンプリングを複数の検証者と組み合わせたものです。BoN-MAVは自己整合性や報酬モデルによる検証よりも強力なスケーリングパターンを示し、弱い検証者を組み合わせることでより強いLLMを改善する弱から強への一般化や、同じベースモデルを使用して出力を生成し確認する自己改善を実証しました。私たちの結果は、検証者の数を増やすことが、テスト時における言語モデルのパフォーマンスを向上させるための有望な新しい次元であることを示しています。
2025-02-27T18:53:30
PhantomWiki: On-Demand Datasets for Reasoning and Retrieval Evaluation
http://arxiv.org/abs/2502.20377v1
Albert Gong, Kamilė Stankevičiūtė, Chao Wan, Anmol Kabra, Raphael Thesmar, Johann Lee, Julius Klenke, Carla P. Gomes, Kilian Q. Weinberger
高品質なベンチマークは、大規模言語モデル(LLM)の推論および検索能力を評価するために不可欠です。しかし、こうした目的のためにデータセットをキュレーションすることは、一時的な解決策であり、データ漏洩やパフォーマンスの誇張結果に悩まされる可能性があります。これらの課題に対処するために、私たちはPhantomWikiを提案します。これは、独自の事実に基づいた一貫性のある文書コーパスと多様な質問-回答ペアを生成するためのパイプラインです。これまでの研究とは異なり、PhantomWikiは固定されたデータセットでも既存のデータに基づいているわけでもありません。代わりに、各評価のために新しいPhantomWikiインスタンスがオンデマンドで生成されます。質問の難易度やコーパスのサイズを変更することで、推論能力と取得能力をそれぞれ分離して調査し、PhantomWikiデータセットが最前線のLLMにとって驚くほど難しいことが分かりました。したがって、私たちは、推論、検索、およびツール使用能力の分離評価のための拡張可能でデータ漏洩に強いフレームワークを提供します。私たちのコードはhttps://github.com/kilian-group/phantom-wikiにて入手可能です。
2025-02-27T18:51:22
Bridging Legal Knowledge and AI: Retrieval-Augmented Generation with Vector Stores, Knowledge Graphs, and Hierarchical Non-negative Matrix Factorization
http://arxiv.org/abs/2502.20364v1
Ryan C. Barron, Maksim E. Eren, Olga M. Serafimova, Cynthia Matuszek, Boian S. Alexandrov
Los Alamos National Laboratory, CSEE, UMBC, Holland & Hart LLP
エージェント生成AIは、大きな言語モデル(LLM)、情報検索強化生成(RAG)、ナレッジグラフ(KG)、およびベクターストア(VS)によって支えられており、法制度、研究、レコメンダーシステム、サイバーセキュリティ、さらには拡散研究を含むグローバルセキュリティなど、専門的なドメインに適用可能な変革的な技術を表しています。この技術は、広範な非構造的または半構造的なデータセット内の関係を推測するのに優れています。法律分野は、広範で相互に関連する複雑な知識システムを特徴としており、憲法、法律、規制、判例法などの複雑な関係を含むデータで構成されています。法的文書とその関係の複雑なネットワークを探索し、洞察を抽出することは、効果的な法律研究には不可欠です。ここでは、法律情報の検索とAIの推論を向上させ、幻覚を最小限に抑えるために、RAG、VS、KGを統合し、非負行列因子分解(NMF)を用いて構築された生成AIシステムを紹介します。法律制度において、これらの技術はAIエージェントがケース、法律、法的先例間の複雑な関係を特定し分析できるようにし、隠れた関係を明らかにし、法律のトレンドを予測するという挑戦的なタスクを行います。これは正義を確保し、運用効率を改善するために不可欠です。当システムは、Justiaのような公にアクセス可能なプラットフォームから、法律、憲法の規定、判例法などの法的テキストを体系的に収集するためにウェブスクレイピング技術を使用します。また、伝統的なキーワードベースの検索と文脈理解の間のギャップを埋めるために、高度な意味的表現、階層的関係、潜在トピック発見を活用しています。このフレームワークは、法律文書のクラスタリング、要約、および相互参照をサポートし、半構造化データのスケーラブルで解釈可能かつ正確な検索を実現し、計算法律とAIを進歩させます。
2025-02-27T18:35:39
Bridging the Creativity Understanding Gap: Small-Scale Human Alignment Enables Expert-Level Humor Ranking in LLMs
http://arxiv.org/abs/2502.20356v1
Kuan Lok Zhou, Jiayi Chen, Siddharth Suresh, Reuben Narad, Timothy T. Rogers, Lalit K Jain, Robert D Nowak, Bob Mankoff, Jifan Zhang
University of Wisconsin-Madison, University of Washington, Air Mail and Cartoon Collections
大規模言語モデル(LLM)は、クリエイティブコンテンツの理解において重要な限界を示しています。これは、Hesselら(2023)が行った「ニューヨーカーの漫画キャプションコンテスト(NYCCC)」に関する影響力のある研究によって明らかにされました。この研究は、ユーモアの理解においてLLMと人間の間にかなりのギャップが存在することを示し、クリエイティブコンテンツを理解し評価することがAIの発展における重要な課題であることを確立しました。我々は、ユーモアの理解を三つの要素に分解し、各要素を体系的に改善することによってこの課題に再挑戦します。具体的には、注釈の改善を通じて視覚理解を強化し、LLM生成のユーモアに関する推論と説明を活用し、対象を絞った人間の好みデータとの整合性を実施します。我々の洗練されたアプローチはキャプションのランク付けにおいて82.4%の正確性を達成し、従来の67%のベンチマークを大幅に改善し、この領域で世界的に有名な人間の専門家と同等のパフォーマンスを示しました。特に、さまざまなペルソナプロンプトを通じてサブグループの好みを模倣しようとした試みは最小限の影響しか示しませんでしたが、群衆の好みに基づくモデルのファインチューニングは驚くほど効果的であることがわかりました。これらの発見は、クリエイティブな判断におけるLLMの限界は、特定のサブグループや個人との集中した整合性を通じて効果的に対処できることを示しています。最後に、人工一般知能を実現するためには、クリエイティブな領域における人間の好みデータの体系的な収集が必要であるという立場を提唱します。我々は、人間の創造性が個人や文化の好みに深く影響されるように、多様な人間の好みデータでLLMを訓練することが真のクリエイティブな理解を発展させるために不可欠であると主張します。
2025-02-27T18:29:09
Towards Responsible AI in Education: Hybrid Recommendation System for K-12 Students Case Study
http://arxiv.org/abs/2502.20354v1
Nazarii Drushchak, Vladyslava Tyshchenko, Nataliya Polyakovska
SoftServe Inc., Ukrainian Catholic University
教育技術(EdTech)の成長により、人工知能(AI)を基にした推薦システムを通じて、各学生のニーズに合わせた非常に個別化された学習体験が可能になりました。しかし、これらのシステムは意図せずしてバイアスを導入する可能性があり、公平な学習リソースへのアクセスを制限することがあります。本研究では、K-12(幼稚園から高校まで)学生向けの推薦システムを提案し、グラフベースのモデリングと行列分解を組み合わせて、課外活動、学習リソース、ボランティアの機会に対する個別化された提案を提供します。公平性の懸念に対処するため、このシステムは保護された学生グループ間でのフィードバックを分析することでバイアスを検出し、軽減するためのフレームワークを含んでいます。この研究は、すべての学生に対して公平で透明性のある効果的な学習機会を支援するために、教育推薦システムにおける継続的な監視の必要性を強調しています。
2025-02-27T18:27:30
Naturalistic Computational Cognitive Science: Towards generalizable models and theories that capture the full range of natural behavior
http://arxiv.org/abs/2502.20349v1
Wilka Carvalho, Andrew Lampinen
Kempner Institute, Harvard University, Google DeepMind
人工知能はますます大きく複雑なモデルを追求し、ますますリアルな領域内で多くのタスクを実行しています。これらのAIの進展が認知科学にどのように、あるいはどれほど影響を与えるべきでしょうか。私たちは、AIの進歩が認知科学にとって、より自然な刺激、タスク、行動を伴う実験を受け入れるためのタイムリーな機会を提供していると主張します。そして、これらの変化を考慮に入れた計算モデルが必要です。まず、神経科学、認知科学、AIにまたがる増大する研究の蓄積をレビューし、より幅広い自然主義的な実験パラダイム(及びそれに適応するモデル)を取り入れることが、自然知能のいくつかの側面を解決するために必要であり、私たちの理論が一般化することを確保するために必要であることを示唆しています。次に、AIと認知科学の最近の進展を統合することで、実験的な制御や理論に基づく理解の追求を放棄することなく、より自然主義的な現象に取り組むことができるようになると提案します。自然主義的計算認知科学における累積的進歩に寄与するための方法論的実践についての実践的ガイダンスを提供し、自然認知の実際の問題を解決する計算モデルを構築するための道筋を示します - それらがどのようにそのプロセスや原則を理解するかという還元的理解とともに。
2025-02-27T18:20:54
Thinking Slow, Fast: Scaling Inference Compute with Distilled Reasoners
http://arxiv.org/abs/2502.20339v1
Daniele Paliotta, Junxiong Wang, Matteo Pagliardini, Kevin Y. Li, Aviv Bick, J. Zico Kolter, Albert Gu, François Fleuret, Tri Dao
最近の進展により、大規模言語モデル(LLM)の性能は、テスト時に計算リソースを拡張することで大幅に向上できることが示されています。一般的な戦略としては、複数の思考の連鎖(CoT)軌道を生成し、それらの出力をさまざまな選択メカニズムを通じて集約することが含まれます。これは根本的な疑問を提起します。低複雑性のモデルは、固定された計算予算のもとで、同様のサイズのトランスフォーマーを超える優れた生成スループットを活用できるのでしょうか?この疑問に対処し、強力なサブ二次推論者の不足を克服するために、事前学習されたトランスフォーマーから純粋およびハイブリッドマムバモデルを抽出しました。8億トークンのみで訓練された私たちの蒸留モデルは、数学的推論データセットで強力な性能とスケーリングを示し、大規模バッチや長いシーケンスの推論においても非常に高速です。蒸留によるゼロショット性能の低下にもかかわらず、純粋およびハイブリッドマムバモデルは、固定された時間予算のもとでそのトランスフォーマー教師モデルを超えて、カバレッジと精度の性能をスケールできるため、推論計算のスケーリングに新たな方向性を切り開いています。
2025-02-27T18:08:16
Expertise Is What We Want
http://arxiv.org/abs/2502.20335v1
Alan Ashworth, Munir Al-Dajani, Keegan Duchicela, Kiril Kafadarov, Allison Kurian, Othman Laraki, Amina Lazrak, Divneet Mandair, Wendy McKennon, Rebecca Miksad, Jayodita Sanghvi, Travis Zack
Color Health, UCSF, Stanford
臨床意思決定は専門家の推論に依存しており、これは標準化されたエビデンスに基づくガイドラインによって導かれています。しかし、これらのガイドラインを自動化された臨床意思決定支援システムに転換することは、正確さのリスクと、重要なニュアンスの喪失を招く可能性があります。私たちは、Large Language Models(LLM)の柔軟性と強力さを、専門家システムの解釈性、説明性、信頼性と組み合わせたアプリケーションアーキテクチャである「Large Language Expert(LLE)」を共有します。LLMは、知識の統合とコーディング、データの正規化といった専門家システムの主要な課題に対処するのに役立ちます。一方で、専門家システムのアプローチは、LLMにおける幻覚、原子および安価な更新、テスト性といった課題を克服するのに役立ちます。
Large Language Expert(LLE)システムの力を強調するために、私たちは新たに癌と診断された患者のワークアップを支援するためのLLEを構築しました。癌治療の迅速な開始は、患者の最適な結果にとって非常に重要です。しかし、診断推奨の複雑さが増す中で、プライマリーケア医は、患者が初めて腫瘍医を訪れる前に必要なワークアップを完了していることを保証するのが難しくなっています。多くの現実の臨床タスクと同様に、これらのワークアップは非構造化医療記録の分析と、微妙な臨床意思決定ロジックの適用を必要とします。本研究では、正しい診断ワークアップを迅速に特定し提案するために構築されたLLEシステムのデザインと評価を説明します。このシステムは、高い臨床レベルの精度(>95%)を示し、大規模な学術センターでの乳癌および大腸癌患者の実データで特定されたギャップに効果的に対処しました。
2025-02-27T18:05:15
Emergent Symbolic Mechanisms Support Abstract Reasoning in Large Language Models
http://arxiv.org/abs/2502.20332v1
Yukang Yang, Declan Campbell, Kaixuan Huang, Mengdi Wang, Jonathan Cohen, Taylor Webb
最近の多くの研究は、大規模言語モデルにおける新たな推論能力の証拠を見出していますが、これらの能力の堅牢性や、構造化された推論メカニズムにどの程度依存しているかについては議論が続いています。これらの問題を明らかにするため、私たちはオープンソースの言語モデル(Llama3-70B)における抽象的ルールの誘導を支える内部メカニズムの包括的な研究を行いました。私たちは、抽象的推論を実現するための一連の3つの計算を通じて実装された新たな記号アーキテクチャを特定しました。初期の層では、記号抽象ヘッドが入力トークンをそれらのトークン間の関係に基づいて抽象変数に変換します。中間層では、記号誘導ヘッドがこれらの抽象変数に対して系列誘導を行います。そして、後の層では、取得ヘッドが予測される抽象変数に関連付けられた値を取得することによって次のトークンを予測します。これらの結果は、記号アプローチとニューラルネットワークアプローチの間の長年の議論の解決に向けた手がかりを示しており、ニューラルネットワークにおける新たな推論は記号メカニズムの出現に依存していることを示唆しています。
2025-02-27T18:02:15
Deep Reinforcement Learning based Autonomous Decision-Making for Cooperative UAVs: A Search and Rescue Real World Application
http://arxiv.org/abs/2502.20326v1
Thomas Hickling, Maxwell Hogan, Abdulla Tammam, Nabil Aouf
City St George's University of London, City University of London
この論文では、グローバルナビゲーション衛星システム(GNSS)が利用できない屋内環境でのマルチドローンシステムによる自律的なガイダンス、ナビゲーション、およびタスク配分のための包括的なフレームワークを提案します。私たちは、Twin Delayed Deep Deterministic Policy Gradientアルゴリズムを利用した深層強化学習(DRL)に基づくガイダンスメカニズムを提唱します。トレーニングプロセスの効率を向上させるために、人工ポテンシャルフィールド(APF)に基づく報酬構造を組み込み、エージェントが動きを洗練させ、屋内環境におけるスムーズな経路と障害物回避を促進します。さらに、協力的なUAV間でのタスク配分の問題にも、DRLでトレーニングされたグラフ畳み込みネットワーク(GCN)を通じて取り組みます。このGCNはドローンとタスクの相互作用を表現し、現在の環境条件やドローンの能力を反映した動的かつリアルタイムなタスク割り当てを可能にします。このアプローチは、捜索救助作業やその他の探査活動における複数のドローン間の効果的な調整と協力を促進します。最後に、GNSSが欠如した環境での正確なオドメトリを確保するために、深度カメラを補完する軽量検出と範囲測定の同時位置特定とマッピングを使用し、通路問題を軽減します。この統合により、高度な位置決めとマッピング機能が提供され、屋内ナビゲーションにおけるシステムの信頼性が向上します。提案されたマルチドローンフレームワークは、個々のナビゲーション能力を高めるだけでなく、複雑で障害物の多い環境における協調的なタスク割り当ても最適化します。NATO Sapience Autonomous Cooperative Drone Competitionの要件を満たすために調整されたセットアップで行われた実験評価により、提案されたシステムの有効性が示され、素晴らしい結果を出し、2024年のSapienceコンペティションで優勝を果たしました。
2025-02-27T17:53:16
UniTok: A Unified Tokenizer for Visual Generation and Understanding
http://arxiv.org/abs/2502.20321v1
Chuofan Ma, Yi Jiang, Junfeng Wu, Jihan Yang, Xin Yu, Zehuan Yuan, Bingyue Peng, Xiaojuan Qi
視覚生成と理解の間の表現的不均衡は、これらの能力を単一のフレームワークに統合する際の重要なギャップを生じさせます。このギャップを埋めるために、我々はUniTokを導入します。これは、生成のために細かい詳細をエンコードし、理解のために高レベルの意味を捉える離散的な視覚トークナイザーです。最近の研究では、これらの目的が訓練中に損失の競合を引き起こす可能性があることが示されていますが、我々は根本的なボトルネックが離散トークンの限られた表現能力から来ていることを明らかにします。これに対処するために、我々はマルチコードブック量子化を導入します。これは、独立したサブコードブックをいくつか用いてベクトル量子化を分割し、潜在的な特徴空間を拡張し、過大なコードブックによる訓練の不安定性を回避します。我々の方法は、統一された離散トークナイザーの上限を大幅に引き上げ、ドメイン特化の連続トークナイザーと一致させるか、時にはそれを超えます。例えば、UniTokはImageNetにおいて0.38という驚異的なrFIDを達成し(SD-VAEの0.87に対して)、ゼロショット精度は78.6%(CLIPの76.2%に対して)です。我々のコードは、https://github.com/FoundationVision/UniTok で入手可能です。
2025-02-27T17:47:01
Mixture of Structural-and-Textual Retrieval over Text-rich Graph Knowledge Bases
http://arxiv.org/abs/2502.20317v1
Yongjia Lei, Haoyu Han, Ryan A. Rossi, Franck Dernoncourt, Nedim Lipka, Mahantesh M Halappanavar, Jiliang Tang, Yu Wang
University of Oregon, Michigan State University, Adobe, Pacific Northwest National Laboratory
テキストリッチなグラフ知識ベース(TG-KB)は、テキストおよび構造的な知識を提供することで、クエリに回答するためにますます重要になっています。しかし、現在の取得方法は、相互強化を考慮せずにこれらの2種類の知識を孤立して取得することが多く、一部のハイブリッド手法は近隣集約の後に構造的取得を完全にバイパスしてしまいます。このギャップを埋めるために、我々は計画-推論-整理フレームワークを通じてこの2種類の知識を取得するための構造とテキストの混合取得(MoR)を提案します。計画段階では、MoRはクエリに回答するための論理を示すテキスト計画グラフを生成します。計画グラフの後、推論段階では、MoRは構造的なトラバーサルとテキストマッチングを組み合わせてTG-KBから候補を取得します。整理段階では、MoRは取得した候補をその構造的な軌跡に基づいてさらに再ランクします。広範な実験により、MoRが構造的およびテキストの取得を調和させる上での優位性を示し、異なるクエリ論理における取得性能の不均一性や、候補の再ランクのための構造的軌跡の統合の利点などの洞察を含みます。我々のコードは https://github.com/Yoega/MoR で入手可能です。
2025-02-27T17:42:52
Multi-Scale Neighborhood Occupancy Masked Autoencoder for Self-Supervised Learning in LiDAR Point Clouds
http://arxiv.org/abs/2502.20316v1
Mohamed Abdelsamad, Michael Ulrich, Claudius Gläser, Abhinav Valada
Bosch Center for AI, University of Freiburg
マスク付きオートエンコーダー(MAE)は、視覚とその他の分野における自己教師あり学習(SSL)のための非常に大きな可能性を示しています。しかし、自動運転に使用されるLiDARからの点群は、3Dボリュームの大部分が空であるため、MAEにとって特に難しい課題です。その結果、既存の研究はデコーダーに占有情報が漏れるという問題を抱えており、計算複雑性も大きいため、実際には2DのバードアイビューエンコーダーにのみSSLの事前学習が制限されています。本研究では、非マスクボクセルの近傍におけるマスク付き占有再構築を用いることによって、前述の課題を克服した新しい近傍占有MAE(NOMAE)を提案します。異なるサイズの点群内のオブジェクトの特徴を捉えるために、ボクセルマスキングと占有再構築を複数のスケールで組み込み、提案された階層的マスク生成技術を使用します。NOMAEは非常に柔軟で、既存の3DアーキテクチャにおけるSSLに直接利用できます。私たちは、nuScenesおよびWaymo Openデータセットに対して、セマンティックセグメンテーションと3Dオブジェクト検出の下流の知覚タスクについて広範な評価を行い、識別的および生成的SSL手法の両方と比較しました。結果は、NOMAEが複数の点群知覚タスクにおける複数のベンチマークで新たな最先端を打ち立てたことを示しています。
2025-02-27T17:42:47
LangProBe: a Language Programs Benchmark
http://arxiv.org/abs/2502.20315v1
Shangyin Tan, Lakshya A Agrawal, Arnav Singhvi, Liheng Lai, Michael J Ryan, Dan Klein, Omar Khattab, Koushik Sen, Matei Zaharia
University of California, Berkeley, Stanford University, Databricks
言語モデル(LM)を複数ステップの言語プログラムにコンポーズし、そのモジュラープロンプトを自動的に最適化することは、AIシステムを構築するための主流のパラダイムとなっていますが、この分野におけるトレードオフはこれまであまり研究されていませんでした。私たちは、タスク、アーキテクチャ、オプティマイザー、LMの選択肢を組み合わせた2000以上の組み合わせを持つ、言語プログラムのアーキテクチャと最適化戦略を評価するための初の大規模ベンチマーク「LangProBe」を紹介します。LangProBeを使用して、プログラムのアーキテクチャやオプティマイザー(およびそれらの組み合わせと異なるモデルとの組み合わせ)が質とコストのトレードオフに与える影響を初めて研究しました。最適化された言語プログラムは、モデルへの生の呼び出しよりも強いコストと質のパレート改善を提供しますが、同時に、どの組み合わせを追求するかについての人間の判断(または経験に基づく決定)が最良のパフォーマンスを得るためには依然として必要であることを示しています。私たちは、LangProBeのコードと評価データをオープンソースとして公開します。
2025-02-27T17:41:49
EAIRA: Establishing a Methodology for Evaluating AI Models as Scientific Research Assistants
http://arxiv.org/abs/2502.20309v1
Franck Cappello, Sandeep Madireddy, Robert Underwood, Neil Getty, Nicholas Lee-Ping Chia, Nesar Ramachandra, Josh Nguyen, Murat Keceli, Tanwi Mallick, Zilinghan Li, Marieme Ngom, Chenhui Zhang, Angel Yanguas-Gil, Evan Antoniuk, Bhavya Kailkhura, Minyang Tian, Yufeng Du, Yuan-Sen Ting, Azton Wells, Bogdan Nicolae, Avinash Maurya, M. Mustafa Rafique, Eliu Huerta, Bo Li, Ian Foster, Rick Stevens
Argonne National Laboratory, The University of Chicago, University of Pennsylvania, Lawrence Livermore National Laboratory, The Ohio State University, Rochester Institute of Technology, Massachusetts Institute of Technology
最近の進展により、AI、特に大規模言語モデル(LLMs)が科学研究において革新的なツールとして位置づけられており、推論、問題解決、意思決定を必要とする複雑なタスクに対処する能力を持っています。彼らの卓越した能力は、科学研究アシスタントとしての潜在能力を示唆していますが、実際の科学的応用における効果を評価するために、包括的で厳密かつドメイン特化型の評価が必要であることも浮き彫りにしています。本論文では、アーゴン国立研究所で開発された科学研究アシスタントとしてのAIモデルを評価するための多面的な方法論(EAIRA)について説明します。この方法論は、4つの主要な評価クラスを組み込んでいます。1)事実の想起を評価するための選択問題;2)高度な推論や問題解決能力を評価するための自由回答;3)制御された環境における研究アシスタントとしての能力の詳細な分析を含むラボスタイルの実験;4)さまざまな科学分野および応用における研究者-LLMの相互作用を大規模に把握するためのフィールドスタイルの実験。これらの補完的な手法により、科学的知識、推論能力、適応性に関するLLMの強みと弱みの包括的な分析が可能になります。LLMの進展の迅速なペースを考慮し、この方法論は進化し適応するように設計されており、その継続的な関連性と適用性を確保します。本論文では、2025年2月末時点の方法論の状態について説明します。科学的ドメインの一部内で開発されたものであるにもかかわらず、この方法論は幅広い科学的ドメインに一般化できるように設計されています。
2025-02-27T17:35:57
M3Builder: A Multi-Agent System for Automated Machine Learning in Medical Imaging
http://arxiv.org/abs/2502.20301v1
Jinghao Feng, Qiaoyu Zheng, Chaoyi Wu, Ziheng Zhao, Ya Zhang, Yanfeng Wang, Weidi Xie
エージェント型AIシステムは、複雑なタスクを自律的に実行する能力によって大きな注目を集めています。しかし、十分に準備されたツールに依存するため、専門モデルを訓練する必要がある医療分野での適用には限界があります。本論文では、以下の三つの貢献を行います。(i) 我々は、医療画像における機械学習(ML)を自動化するために設計された新しいマルチエージェントシステムM3Builderを紹介します。M3Builderは、複雑なマルチステップの医療MLワークフローに取り組むために協力する4つの専門エージェントを中心に構成されており、自動データ処理や環境設定から自己完結型の自動デバッグおよびモデル訓練までを行います。これらのエージェントは、データセット、訓練コード、相互作用ツールの自由記述を提供するように設計された構造化された医療画像MLワークスペース内で機能し、スムーズなコミュニケーションとタスクの実行を可能にします。(ii) 医療画像MLの自動化における進展を評価するために、M3Benchを提案します。これは、14の訓練データセットにおける5つの解剖部位と3つの画像モダリティにわたる4つの一般タスクから成るベンチマークです。2Dおよび3Dデータの両方をカバーしています。(iii) 我々は、システムのエージェントコアとして機能する最新の大規模言語モデル7つを使って実験します。例えば、Claudeシリーズ、GPT-4o、DeepSeek-V3などです。既存のMLエージェント設計と比較して、M3Builderは医療画像でのMLタスクの完了において優れた性能を示し、エージェントコアとしてClaude-3.7-Sonnetを使用することで94.29%の成功率を達成し、医療画像における完全自動機械学習への大きな可能性を示しています。
2025-02-27T17:29:46
An exploration of features to improve the generalisability of fake news detection models
http://arxiv.org/abs/2502.20299v1
Nathaniel Hoy, Theodora Koulouri
Brunel University
フェイクニュースは選挙に影響を与え、誤情報を広めることによって全球的なリスクを引き起こしており、検出が重要です。既存の自然言語処理(NLP)および教師あり機械学習手法はクロスバリデーション下では優れたパフォーマンスを発揮しますが、同じドメイン内でもデータセット間で一般化するのが困難です。この問題は、記事が出版社に基づいてラベル付けされている粗いラベル付けされたトレーニングデータに起因しており、TF-IDFやBERTのようなトークンベースのモデルはそれに敏感です。大規模言語モデル(LLM)は期待が持たれていますが、フェイクニュースの検出におけるその応用は限られています。本研究は、粗いラベル付けデータから意味のある特徴を抽出し、実世界での堅牢性を向上させることができることを示しています。スタイル的特徴—語彙、構文、意味論—は、データセットのバイアスに対する感度が低いため探究されています。さらに、広告、外部リンク、ソーシャルメディア要素など、フェイクニュースの背後にある経済的インセンティブを捉える新しい社会的収益化特徴も導入されました。本研究は粗いラベル付けされたNELA 2020-21データセットでトレーニングを行い、一般化性のゴールドスタンダードである手動ラベル付けされたFacebook URLデータセットを使用して評価しています。結果は、バイアスのあるデータでトレーニングされたトークンベースのモデルの限界を浮き彫りにし、この分野におけるLLaMaのようなLLMに関する限られた証拠に寄与しています。調査結果は、スタイル的および社会的収益化特徴がトークンベースの手法やLLMよりも一般化可能な予測を提供することを示しています。統計的および順列特徴重要度分析は、パフォーマンスを向上させ、データセットバイアスを軽減する可能性をさらに明らかにし、フェイクニュースの検出を改善するための道を提供しています。
2025-02-27T17:26:56
Judge a Book by its Cover: Investigating Multi-Modal LLMs for Multi-Page Handwritten Document Transcription
http://arxiv.org/abs/2502.20295v1
Benjamin Gutteridge, Matthew Thomas Jackson, Toni Kukurin, Xiaowen Dong
QuantCo
手書き文字認識(HTR)は、特にページが共通のフォーマットや文脈的特徴を共有する複数ページのドキュメントにおいて、依然として難しい作業です。現代の光学文字認識(OCR)エンジンは印刷されたテキストに対しては優れた能力を持っていますが、手書きテキストに対するパフォーマンスは限られており、微調整のために高価なラベル付きデータを必要とすることが多いです。本論文では、ゼロショット設定での複数ページの手書き文書を転写するためのマルチモーダル大規模言語モデル(MLLM)の利用について探求します。商業用OCRエンジンおよびMLLMのさまざまな構成を調査し、後者をエンドツーエンドの転写者およびポストプロセッサとして、画像コンポーネントを使用する場合としない場合とで活用します。私たちは、新しい手法「+ファーストページ」を提案します。これは、ドキュメント全体のOCR出力と最初のページの画像を提供することで、MLLMの転写を強化します。このアプローチは、すべての画像を処理する高コストをかけずに、共有されたドキュメントの特徴を活用します。IAM手書きデータベースの複数ページ版に関する実験では、「+ファーストページ」が転写精度を向上させ、コストとパフォーマンスのバランスを取り、さらには単一ページからのフォーマットおよびOCRエラーのパターンを外挿することによって、サンプル外のテキストに対しても結果を向上させることを示しています。
2025-02-27T17:21:18
Evaluating Human Trust in LLM-Based Planners: A Preliminary Study
http://arxiv.org/abs/2502.20284v1
Shenghui Chen, Yunhao Yang, Kayla Boggess, Seongkook Heo, Lu Feng, Ufuk Topcu
University of Texas at Austin, University of Virginia
大規模言語モデル(LLM)は、計画タスクにますます使用されており、説明の生成や反復的な改善など、従来のプランナーにはない独自の能力を提供しています。しかし、計画システムの採用において重要な要素である「信頼」は、LLMベースの計画タスクにおいて十分に探求されていません。この研究は、計画ドメイン定義言語(PDDL)の領域におけるユーザー研究を通じて、LLMベースのプランナーに対する人間の信頼と従来のプランナーとの比較を行うことで、このギャップを埋めます。信頼に関する質問票などの主観的な尺度を、評価精度のような客観的な指標と組み合わせた結果、正確性が信頼とパフォーマンスの主要な推進要因であることが明らかになりました。LLMによって提供される説明は評価精度を改善しましたが、信頼への影響は限られていました。一方、プランの改善は、評価精度を大幅に向上させることなく、信頼を高める潜在能力を示しました。
2025-02-27T17:10:52
Explainable, Multi-modal Wound Infection Classification from Images Augmented with Generated Captions
http://arxiv.org/abs/2502.20277v1
Palawat Busaranuvong, Emmanuel Agu, Reza Saadati Fard, Deepak Kumar, Shefalika Gautam, Bengisu Tulu, Diane Strong
Worcester Polytechnic Institute
糖尿病性足潰瘍(DFUs)における感染は、組織死や肢の切断などの深刻な合併症を引き起こす可能性があり、正確で迅速な診断の必要性が強調されています。従来の機械学習手法は、追加のメタデータ(医療ノートなど)を利用することなく、傷画像を分析して感染を特定することに焦点を当てていました。本研究では、合成キャプション拡張検索を導入することで感染検出を改善することを目指しています。これは、合成テキスト記述を利用してDFU画像を拡張する新しい深層学習フレームワーク「SCARWID」です。SCARWIDは二つのコンポーネントから構成されています:(1) Wound-BLIP、GPT-4oで生成された説明に基づいて微調整されたビジョン・ランゲージモデル(VLM)で、画像から一貫したキャプションを合成します;(2) 画像とその対応するWound-BLIPキャプションからクロスモーダル埋め込みを抽出するためにクロスアテンションを使用する画像-テキストフュージョンモジュールです。感染状態は、ラベル付きサポートセットから上位k個の類似アイテムを取得することで特定されます。トレーニングデータの多様性を高めるために、潜在拡散モデルを利用して追加の傷画像を生成しました。その結果、SCARWIDは最先端のモデルを上回り、傷感染分類においてそれぞれ0.85、0.78、および0.81の平均感度、特異度、精度を達成しました。生成されたキャプションを傷画像と感染検出結果と共に表示することで、解釈性と信頼性が向上し、看護師がSCARWIDの出力を自らの医療知識と照らし合わせることが可能になります。これは、傷ノートが利用できない場合や、傷感染の視覚的属性を特定することが難しい初学者の看護師を支援する際に特に価値があります。
2025-02-27T17:04:00
HVI: A New Color Space for Low-light Image Enhancement
http://arxiv.org/abs/2502.20272v2
Qingsen Yan, Yixu Feng, Cheng Zhang, Guansong Pang, Kangbiao Shi, Peng Wu, Wei Dong, Jinqiu Sun, Yanning Zhang
低照度画像強化(LLIE)は、低照度画像から詳細な視覚情報を復元することを目的とした重要なコンピュータビジョンタスクです。既存のLLIE方法の多くは標準RGB(sRGB)空間に基づいており、sRGBに内在する高い色感度のために色ずれや輝度アーティファクトを生じることがよくあります。色相、彩度、明度(HSV)カラー空間を使用して画像を変換することで輝度の問題は解決されますが、かなりの赤と黒のノイズアーティファクトを引き起こします。この問題を解決するために、偏光HSマップと学習可能な輝度によって定義される、新しいLLIE用のカラー空間である水平/垂直強度(HVI)を提案します。前者は赤の座標に小さな距離を強制して赤のアーティファクトを除去し、後者は低照度領域を圧縮して黒のアーティファクトを除去します。色と輝度の情報を最大限に活用するために、HVI空間における異なる照明条件下で正確な写真測定マッピング機能を学習する新しい色と強度のデカップリングネットワーク(CIDNet)も導入されます。ベンチマークおよびアブレーション実験からの包括的な結果は、提案されたHVIカラー空間とCIDNetが10のデータセットで最先端の方法を上回ることを示しています。コードはhttps://github.com/Fediory/HVI-CIDNetで入手可能です。
2025-02-27T16:59:51
Large Language Models as Attribution Regularizers for Efficient Model Training
http://arxiv.org/abs/2502.20268v1
Davor Vukadin, Marin Šilić, Goran Delač
大規模言語モデル(LLM)は、多様な領域で驚異的なパフォーマンスを示しています。しかし、彼らの膨大な知識を利用して小規模なダウンサンプルモデルのトレーニングに効果的に活用することは、解決すべき課題のままであり、特に解釈可能性と効率性から単純なモデルが好まれる表形式データ学習などの分野ではそうです。本論文では、LLMによって生成されたグローバルなタスク特徴の帰属性を小規模ネットワークのトレーニングプロセスに組み込むための新規かつ簡潔な方法を提案します。具体的には、より小さなモデルのトレーニングダイナミクスをLLMから提供される洞察と一致させる帰属性マッチング正則化項を提案します。このアプローチにより、少数ショット学習シナリオにおいて優れたパフォーマンスが得られます。特に、この方法はLLMへのブラックボックスAPIアクセスのみを必要とし、最小限の計算オーバーヘッドで既存のトレーニングパイプラインに統合することが容易です。さらに、この方法を使用して、実世界のデータセットにおける一般的な問題、例えば偏りやバイアスに対処できることを示します。LLMからの高度な知識を統合することで、当アプローチは一般化を改善し、トレーニングデータが限られている場合や不均衡な場合でも、効果を発揮します。我々は、複数のタスクにわたる広範な実験を通じてその有効性を検証し、学習効率とモデルのロバスト性の向上を示します。
2025-02-27T16:55:18
LLM as a Broken Telephone: Iterative Generation Distorts Information
http://arxiv.org/abs/2502.20258v1
Amr Mohamed, Mingmeng Geng, Michalis Vazirgiannis, Guokan Shang
MBZUAI, SISSA, Ecole Polytechnique
大規模言語モデル(LLM)がオンラインコンテンツにますます重要な役割を果たす中、それら自身の出力を繰り返し処理することによる影響に関する懸念が生じています。「壊れた電話」効果に触発されたこの研究は、LLMが反復生成を通じて情報を歪めるかどうかを調査しています。翻訳に基づく実験を通じて、歪みが時間とともに蓄積され、言語の選択やチェーンの複雑さによって影響を受けることがわかりました。劣化は避けられませんが、戦略的なプロンプト技術を通じて軽減可能です。これらの発見は、AIを介した情報の伝播の長期的な影響に関する議論に寄与し、反復的なワークフローにおけるLLM生成コンテンツの信頼性について重要な疑問を提起します。
2025-02-27T16:46:23
Teasing Apart Architecture and Initial Weights as Sources of Inductive Bias in Neural Networks
http://arxiv.org/abs/2502.20237v1
Gianluca Bencomo, Max Gupta, Ioana Marinescu, R. Thomas McCoy, Thomas L. Griffiths
Princeton University, New York University, Yale University
人工ニューラルネットワークは、データから人間の知識の多くの側面を取得でき、人間の学習のモデルとして有望です。しかし、これらのネットワークが学べることは、彼らが発見する解決策に影響を与えるデータ以外の要因である帰納的バイアスに依存していますが、ニューラルネットワークの帰納的バイアスはまだ十分に理解されておらず、これらのシステムの性能から人間の学習について結論を導き出す能力が制限されています。認知科学者や機械学習研究者は、しばしば帰納的バイアスの源としてニューラルネットワークのアーキテクチャに注目します。本論文では、特定の問題に適応した初期重みを見つけるためのツールとしてメタラーニングを使用し、帰納的バイアスの別の源としてのネットワークの初期重みの影響を探ります。異なるバイアスと一般化の形式を必要とする三つのタスクで430の異なるモデルをメタトレーニングすることにより、MLP、CNN、LSTM、Transformerという四つの広く使用されているアーキテクチャを評価します。メタラーニングがアーキテクチャやデータ表現間の性能差を大幅に減少させ、または完全に排除できることがわかりました。これは、これらの要因が通常考えられているよりも、帰納的バイアスの源としては重要ではない可能性を示唆しています。差異が存在する場合、メタラーニングなしでうまく機能するアーキテクチャやデータ表現は、メタトレーニングがより効果的である傾向があります。さらに、すべてのアーキテクチャは、メタトレーニングの経験から遠く離れた問題に対して一般化が不良であり、堅牢な一般化のためにはより強力な帰納的バイアスが必要であることを強調しています。
2025-02-27T16:22:18
Selective Use of Yannakakis' Algorithm to Improve Query Performance: Machine Learning to the Rescue
http://arxiv.org/abs/2502.20233v1
Daniela Böhm, Georg Gottlob, Matthias Lanzinger, Davide Longo, Cem Okulmus, Reinhard Pichler, Alexander Selzer
クエリ最適化は、数十年にわたりデータベース研究において中心的な役割を果たしてきました。しかしながら、提案された最適化技術は、しばしばすべての状況ではなく、一部の状況でのみパフォーマンスの向上をもたらします。したがって、特定のクエリに対して最適化技術を適用すべきかどうかを決定するための意思決定手続きを設計するための方法論が急務です。本研究では、我々の興味のある最適化技術としてヤナカキススタイルのクエリ評価に焦点を当て、こうした方法論を提案します。具体的には、この意思決定問題をアルゴリズム選択問題として定式化し、その解決のための機械学習ベースのアプローチを提示します。さまざまなデータベースシステムに対するいくつかのベンチマークを用いた経験的な結果は、我々のアプローチが実際に統計的に有意なパフォーマンス向上をもたらすことを示しています。
2025-02-27T16:19:54
AI Will Always Love You: Studying Implicit Biases in Romantic AI Companions
http://arxiv.org/abs/2502.20231v1
Clare Grogan, Jackie Kay, María Pérez-Ortiz
既存の研究は、職業における性別バイアスを含む生成モデルにおける明示的なバイアスを認識していますが、ユーザーとAIコンパニオンとの関係における性別ステレオタイプや期待のニュアンスはまだ十分に探求されていません。一方、AIコンパニオンは、ユーザーにとって友人や性別のある恋愛パートナーとしてますます人気を集めています。この研究は、恋愛に特化した性別に割り当てられたAIコンパニオンとそのユーザーに対して三つの実験を通じてギャップを埋め、さまざまなサイズの大規模言語モデル(LLM)における暗黙のバイアスを効果的に評価します。各実験は異なる次元を扱います:暗黙の関連、感情的反応、そしておべっか。 この研究の目的は、新たに考案した指標を通じてベースラインに対するペルソナ割り当てモデルの応答を定量的に分析することで、さまざまなコンパニオンシステムに現れるバイアスを測定し比較することです。結果は注目に値します:性別や関係のペルソナを大規模言語モデルに割り当てることで、これらのモデルの応答が大きく変化し、特定の状況ではバイアスがかかったステレオタイプ的な方法で変化することが示されました。
2025-02-27T16:16:37
RURANET++: An Unsupervised Learning Method for Diabetic Macular Edema Based on SCSE Attention Mechanisms and Dynamic Multi-Projection Head Clustering
http://arxiv.org/abs/2502.20224v1
Wei Yang, Yiran Zhu, Jiayu Shen, Yuhan Tang, Chengchang Pan, Hui He, Yan Su, Honggang Qi
糖尿病性黄斑浮腫(DME)は、糖尿病患者において一般的な合併症であり、視覚障害や失明の主要な原因となっています。深層学習は医療画像解析において著しい進展を遂げていますが、従来のDME診断は依然として広範な注釈データと主観的な眼科医の評価に依存しており、実用的な応用が制約されています。これに対処するために、私たちはRURANET++を提案します。これは、教師なし学習に基づいた自動DME診断システムです。このフレームワークは、病変特徴抽出を強化するために(SCSE)空間およびチャネル圧縮・励起注意機構を組み込んだ最適化されたU-Netアーキテクチャを採用しています。特徴処理の際、事前に訓練されたGoogLeNetモデルが網膜画像から深い特徴を抽出し、その後PCAに基づく次元削減を行い、計算効率のために50次元に縮小します。特筆すべきは、クラスタ多様性を明示的に制御し、類似性のしきい値を動的に調整するために、複数の投影ヘッドを使用する新しいクラスタリングアルゴリズムを導入したことです。これにより、クラス内の一貫性とクラス間の識別性が最適化されます。実験結果は、最大精度(0.8411)、適合率(0.8593)、再現率(0.8411)、F1スコア(0.8390)を達成し、顕著なクラスタリング品質で複数の指標で優れた性能を示すことを証明しています。この研究は、DME診断のための効率的な教師なしソリューションを提供し、重要な臨床的意義を持っています。
2025-02-27T16:06:57
Deep Convolutional Neural Networks for Palm Fruit Maturity Classification
http://arxiv.org/abs/2502.20223v1
Mingqiang Han, Chunlin Yi
パーム油の収量と品質を最大化するためには、パームフルーツを最適な成熟段階で収穫することが重要です。このプロジェクトは、パームフルーツの画像を五つの熟度レベルに正確に分類することができる自動化されたコンピュータビジョンシステムを開発することを目的としています。私たちは、成熟段階に基づいてパームフルーツの画像を分類するために、深層畳み込みニューラルネットワーク(CNN)を利用します。浅いCNNがベースラインモデルとして機能し、転移学習と微調整が事前に学習されたResNet50とInceptionV3アーキテクチャに適用されます。この研究では、重要な変動を持つ8,000枚以上の画像の公開データセットを使用し、80%をトレーニング用、20%をテスト用に分割します。提案された深層CNNモデルは、パームフルーツの成熟段階を分類するテスト精度が85%を超える成果を達成します。この研究は、パームフルーツの熟度評価を自動化するための深層学習の可能性を示しており、収穫の意思決定を最適化し、パーム油の生産効率を向上させることに貢献できるでしょう。
2025-02-27T16:06:30
DIPSER: A Dataset for In-Person Student1 Engagement Recognition in the Wild
http://arxiv.org/abs/2502.20209v1
Luis Marquez-Carpintero, Sergio Suescun-Ferrandiz, Carolina Lorenzo Álvarez, Jorge Fernandez-Herrero, Diego Viejo, Rosabel Roig-Vila, Miguel Cazorla
本論文では、対面の教室環境における学生の注意を評価するために設計された新しいデータセットが紹介されます。このデータセットは、各学生ごとに複数のカメラを用いたRGBカメラデータを含み、姿勢や表情をキャプチャします。さらに、各個人のスマートウォッチセンサデータも含まれています。このデータセットを使用することで、機械学習アルゴリズムを訓練し、注意を予測し、感情との相関を分析することが可能になります。各学生に対して、自己報告および4人の異なる専門家による評価を通じて生成された注意と感情のラベルが提供されます。私たちのデータセットは、顔のカメラデータと環境カメラデータ、スマートウォッチの指標をユニークに組み合わせ、類似したデータセットにおいて過小評価されている民族を含んでおり、すべて対面の自然環境で収集されたもので、現在利用可能な中で最も包括的なデータセットとなっています。本データセットは、異なる教育コンテキストにおける学生の相互作用に関する広範かつ多様なデータのコレクションを提供し、他のツールからの追加メタデータで強化されています。この取り組みは、対面での授業における学生の注意と感情の分析に貴重なリソースを提供することで、既存の欠陥に対処しています。
2025-02-27T15:50:21
Highly Parallelized Reinforcement Learning Training with Relaxed Assignment Dependencies
http://arxiv.org/abs/2502.20190v1
Zhouyu He, Peng Qiao, Rongchun Li, Yong Dou, Yusong Tan
National University of Defense Technology
優れたエージェントに対する需要が高まる中、深層強化学習(DRL)のトレーニングの複雑さも増しています。そのため、DRLのトレーニングを加速することが主要な研究の焦点となっています。DRLのトレーニングプロセスをサブタスクに分割し、並列計算を利用することで、トレーニングコストを効果的に削減できます。しかし、現在のDRLトレーニングシステムは、サブタスクコンポーネント間のデータ割り当てのために十分な並列化が欠けています。この割り当ての問題は無視されてきましたが、これに対処することでトレーニング効率をさらに向上させることができます。したがって、私たちは「天機」と呼ばれる高スループット分散強化学習トレーニングシステムを提案します。このシステムは、サブタスクコンポーネント間の割り当て依存関係を緩和し、イベントドリブンの非同期通信を可能にします。その一方で、天機はサブタスクコンポーネント間の明確な境界を維持します。緩和された割り当て依存関係からの収束の不確実性に対処するために、天機はサンプルの生産と消費のバランスに基づいた分散戦略を提案します。この戦略は、サンプルの古さを管理してその質を修正し、収束を確保します。私たちは広範な実験を行いました。天機は関連する比較システムと比較して、最大4.37倍の収束時間加速比を達成します。8つの計算ノードにスケールアップすると、天機は星天(XingTian)に対して、1.6倍の収束時間のスピードアップと7.13倍のスループットのスピードアップを示し、トレーニングの加速とスケーラビリティの能力を実証しています。データ伝送効率に関する実験では、天機は他のシステムに対して著しく優れており、ハードウェアの限界に近づいています。また、天機はオンポリシーアルゴリズムにおいても効果的であり、RLlibおよび星天(XingTian)に対してそれぞれ4.36倍および2.95倍の収束時間の加速比を達成しています。天機はhttps://github.com/HiPRL/TianJi.git で入手可能です。
2025-02-27T15:23:43
An Extensive Evaluation of PDDL Capabilities in off-the-shelf LLMs
http://arxiv.org/abs/2502.20175v1
Kaustubh Vyas, Damien Graux, Sébastien Montella, Pavlos Vougiouklis, Ruofei Lai, Keshuang Li, Yang Ren, Jeff Z. Pan
最近の進展において、大規模言語モデル(LLM)はコード生成や思考の連鎖において優れた能力を示し、自動形式計画タスクに取り組むための基礎を築いています。本研究では、LLMが人工知能計画において重要な表現である計画ドメイン定義言語(PDDL)を理解し生成する可能性を評価します。私たちは、商用とオープンソースを含む7つの主要なLLMファミリーにまたがる20の異なるモデルを対象に広範な分析を行いました。我々の包括的な評価は、PDDLの解析、生成、推論におけるゼロショットLLMの能力を明らかにします。調査結果は、一部のモデルがPDDLの処理において顕著な効果を示す一方で、他のモデルは微妙な計画知識を必要とするより複雑なシナリオにおいて制限を抱えていることを示しています。これらの結果は、正式な計画タスクにおけるLLMの可能性と現在の限界を浮き彫りにし、彼らの適用に関する洞察を提供し、AI駆動の計画パラダイムにおける今後の取り組みに向けた指針を示しています。
2025-02-27T15:13:07
Accelerating Model-Based Reinforcement Learning with State-Space World Models
http://arxiv.org/abs/2502.20168v1
Maria Krinner, Elie Aljalbout, Angel Romero, Davide Scaramuzza
University of Zurich
強化学習(RL)はロボット学習の強力なアプローチですが、モデルフリーRL(MFRL)は成功した制御ポリシーを学ぶために多くの環境とのインタラクションが必要です。これは、ノイズの多いRLトレーニング更新と、通常は非常に非線形のダイナミクスとノイズの多いセンサー信号を含むロボットシステムの複雑さに起因しています。対照的に、モデルベースRL(MBRL)はポリシーをトレーニングするだけでなく、環境のダイナミクスと報酬を捉える世界モデルを同時に学習します。世界モデルは、計画のため、データ収集のため、またはトレーニングのための一次ポリシー勾配を提供するために使用できます。世界モデルを活用することで、モデルフリーRLに比べてサンプル効率が大幅に向上します。しかし、ポリシーと同時に世界モデルをトレーニングすると計算の複雑さが増し、複雑な現実のシナリオでは扱いが困難な長いトレーニング時間につながります。本研究では、状態空間世界モデルを使用してモデルベースRLを加速する新しい方法を提案します。私たちのアプローチは、通常は主な計算ボトルネックであるダイナミクスモデルのトレーニングを並列化するために状態空間モデル(SSM)を活用します。さらに、特に部分的に観測可能な環境に関連するトレーニング中に世界モデルに特権情報を提供するアーキテクチャを提案します。私たちの方法を複雑なダイナミクスを伴う現実のアジャイル四旋翼飛行タスクで評価し、完全に観測可能な環境と部分的に観測可能な環境の両方で実施しました。私たちは、世界モデルのトレーニング時間を最大10倍、全体のMBRLトレーニング時間を最大4倍短縮する顕著な速度向上を示します。この利点は、私たちの方法が最先端のMBRL手法と同様のサンプル効率とタスク報酬を達成することで、パフォーマンスを損なうことなく得られます。
2025-02-27T15:05:25
Adaptive H&E-IHC information fusion staining framework based on feature extra
http://arxiv.org/abs/2502.20156v1
Yifan Jia, Xingda Yu, Zhengyang Ji, Songning Lai, Yutao Yue
免疫組織化学(IHC)染色は、乳がんなどの疾患の評価において重要な役割を果たします。生成モデルに基づくH&EからIHCへの変換は、IHC画像を取得するためのシンプルでコスト効果の高い方法を提供します。従来のモデルはデジタルカラーリングをうまく行うことができますが、以下の問題に直面しています:(i)HEで目立たないピクセル特徴のみを通じて着色するため、着色プロセスで情報が失われる可能性が高いこと;(ii)ピクセル単位のH&E-IHCのグラウンドトゥルースペアが不足しているため、従来のL1損失にとって挑戦となること。このような課題に対処するために、私たちは特徴抽出器に基づいた適応情報強化カラーリングフレームワークを提案します。まず、マルチスケール特徴抽出とウェーブレット変換畳み込みを使用して、色情報の特徴を効果的に抽出するVMFEモジュールを提案し、特徴の融合のための共有デコーダを組み合わせます。H&E-IHCの高性能デュアル特徴抽出器は対比学習によって訓練され、HE-IHCの特徴を高次元空間で効果的に整列させることができます。同時に、訓練された特徴エンコーダを使用して特徴を強化し、HEセクションの染色プロセスにおける損失を適応的に調整し、明確で非対称な情報に関連する問題を解決します。さまざまなデータセットでテストを行い、優れたパフォーマンスを達成しました。私たちのコードは次のリンクで入手可能です: https://github.com/babyinsunshine/CEFF
2025-02-27T14:55:34
QPM: Discrete Optimization for Globally Interpretable Image Classification
http://arxiv.org/abs/2502.20130v1
Thomas Norrenbrock, Timo Kaiser, Sovan Biswas, Ramesh Manuvinakurike, Bodo Rosenhahn
深層ニューラルネットワークの分類、特に安全が重要な状況で使用されるものを理解することがますます重要になっています。最近のモデルは、単一の決定を局所的に説明することができますが、正確なモデルの一般的な挙動について信頼できるグローバルな説明を提供することは、より困難な未解決の課題です。その目標に向けて、私たちはグローバルに解釈可能なクラス表現を学習する二次計画強化モデル(QPM)を紹介します。QPMは、非常に少数(通常5)の特徴のバイナリ割り当てを使用してすべてのクラスを表現し、これらの特徴は他のクラスにも割り当てられ、対照的なクラス表現を容易に比較できるようにしています。このコンパクトなバイナリ割り当ては、事前に定義された類似性尺度と解釈可能性の制約に基づく離散最適化を使用して見つけられます。得られた最適な割り当ては、多様な特徴を微調整するために使用され、各特徴が割り当てられたクラス間の共有一般的概念になります。広範な評価により、QPMは、小規模および大規模データセット全体で前例のないグローバルな解釈可能性を提供し、解釈可能なモデルの精度において最先端の成果を達成しています。
2025-02-27T14:25:36
SoRFT: Issue Resolving with Subtask-oriented Reinforced Fine-Tuning
http://arxiv.org/abs/2502.20127v1
Zexiong Ma, Chao Peng, Pengfei Gao, Xiangxin Meng, Yanzhen Zou, Bing Xie
Peking University, ByteDance
主流の問題解決フレームワークは主に商業モデルに依存しており、高コストとプライバシーの懸念を引き起こしています。既存の問題解決のためのトレーニングアプローチは、一般化が不十分であり、オープンソース開発リソースを十分に活用できていません。私たちは、課題指向の強化ファインチューニング(SoRFT)という新しいトレーニングアプローチを提案し、LLMの問題解決能力を向上させることを目的としています。問題解決を構造化されたサブタスクに分解します:ファイルのローカリゼーション、関数のローカリゼーション、行のローカリゼーション、およびコード編集生成です。SoRFTは2つのトレーニングステージで構成されます:(1)拒否サンプルによる監視ファインチューニング。Chain of Thought(CoT)データは、LLMのファインチューニングの前にグラウンドトゥルースを用いてフィルタリングされます。(2)ルールベースの強化学習。これは、グラウンドトゥルースに基づく報酬でPPOを活用します。私たちはSoRFTで訓練されたモデルをSWE-Bench VerifiedとSWE-Bench Liteで評価し、オープンソースモデルの中で最先端(SOTA)のパフォーマンスを達成しました(例:SoRFT-Qwen-7BでSWE-Bench Verifiedの21.4%の問題を解決)。実験結果は、SoRFTが問題解決性能を大幅に向上させ、モデルの一般化を改善し、商業モデルに対するコスト効率の高い代替案を提供することを示しています。
2025-02-27T14:19:45
Exploring Open-world Continual Learning with Knowns-Unknowns Knowledge Transfer
http://arxiv.org/abs/2502.20124v1
Yujie Li, Guannan Lai, Xin Yang, Yonghao Li, Marcello Bonsangue, Tianrui Li
Southwestern University of Finance and Economics, Leiden University, Southwest Jiaotong University
オープンワールド継続学習(OWCL)は、モデルがオープンワールドの仮定の下で、新しい知識を忘れずに段階的に学習しなければならないという困難なパラダイムです。これには、不完全なトレーニングデータの処理と、推論中の未知サンプルの認識が必要です。しかし、既存のOWCL手法は、オープン検出と継続学習を別々のタスクとして扱うことが多く、OWCLにおけるオープンセット検出と段階的分類を統合する能力が制限されています。さらに、現在のアプローチは主に既知のサンプルからの知識移転に焦点を当てており、未知の/オープンなサンプルから得られる洞察を無視しています。これらの制約に対処するために、私たちは4つの異なるOWCLシナリオを形式化し、OWCLにおける潜在的な課題を探るために包括的な実証実験を実施しました。私たちの研究結果は、未知のサンプルのオープン検出と既知のサンプルの段階的分類との間に重要な相互作用が存在することを明らかにし、未知の検出と既知の分類が直交するプロセスであるという広く受け入れられている仮定に挑戦します。私たちの洞察に基づいて、非線形ランダム投影(NRP)を統合し、より線形に分離可能な埋め込み空間を作成し、適応型知識空間を構築するために分布-awareプロトタイプ(DAP)を使用した新しいOWCLフレームワーク「\textbf{HoliTrans}」(ホリスティック既知-未知の知識転送)を提案します。特に、私たちのHoliTransは、OWCL中にオープンサンプルの表現を動的に更新しながら、既知および未知のサンプルの知識移転を効果的にサポートします。さまざまなOWCLシナリオにおける広範な実験により、HoliTransが22の競争力のあるベースラインを上回り、OWCL理論と実践のギャップを埋め、オープンワールド学習パラダイムを進展させるための堅牢でスケーラブルなフレームワークを提供することが示されました。
2025-02-27T14:16:01
Self-Training Elicits Concise Reasoning in Large Language Models
http://arxiv.org/abs/2502.20122v2
Tergel Munkhbat, Namgyu Ho, Seo Hyun Kim, Yongjin Yang, Yujin Kim, Se-Young Yun
KAIST
チェイン・オブ・ソート(CoT)推論は、大規模言語モデル(LLM)が中間トークンを介して追加の計算を利用し、複雑なタスクを解決することを可能にしました。しかし、私たちは典型的な推論の痕跡には多くの冗長なトークンが含まれており、余分な推論コストが発生していると考えています。現在のLLMの出力分布を調査したところ、デフォルトの動作に対してより簡潔に推論する潜在能力の証拠を見つけました。この能力を引き出すために、私たちはタスク特有の設定におけるベスト・オブ・Nサンプリングと少数ショット条件付けによって得られた自己生成された簡潔な推論パスを活用するシンプルなファインチューニング手法を提案します。私たちの結合方法は、GSM8KおよびMATHにおける5つのモデルファミリー全体で平均して出力トークンを30%削減し、平均的な精度を維持します。LLMの基本的な確率性とインコンテキスト学習能力を活用することで、私たちの自己訓練アプローチは、広範なポストトレーニングを含む多くのモデルで簡潔な推論を確実に引き出します。コードはhttps://github.com/TergelMunkhbat/concise-reasoning で入手可能です。
2025-02-27T14:14:50
Forward-Cooperation-Backward (FCB) learning in a Multi-Encoding Uni-Decoding neural network architecture
http://arxiv.org/abs/2502.20113v1
Prasun Dutta, Koustab Ghosh, Rajat K. De
Indian Statistical Institute
ニューラルネットワークを訓練するための最も一般的な技術は逆伝播です。最近では、特定の学習タスクのためにフォワード・フォワード技術も導入されました。しかし、実際の生活では、人間の学習はこれらの技術のいずれかに専念することはありません。人間が学ぶ方法は基本的に、前向きな学び、後ろ向きな伝播、そして協力の組み合わせです。人間は新しい概念を独自に学び始め、理解を階層的に洗練しようとする際に、いくつかの疑問に直面することがあります。疑問を解決する最も一般的なアプローチは、仲間との議論であり、これを協力と呼ぶことができます。仲間との協力/議論/知識共有は、人間の学習において最も重要なステップの一つです。しかし、議論の後でもまだ疑問が残ることがあります。そして、概念の理解と原文との違いが特定され、いくつかの改訂を経て最小化されます。このことに触発されて、本論文では、深層ニューラルネットワークフレームワークにおいて、フォワード・コーポレーション・バックワード(FCB)学習を提案し、人間の新しい概念を学ぶ性質を模倣しています。FCBの概念を用いて学習する新しい深層ニューラルネットワークアーキテクチャ、「マルチエンコーディング・ユニデコーディングニューラルネットワークモデル」が設計されました。また、協力を実現するために特別な側方シナプス接続も導入されました。これらのモデルは、4つの人気データセットにおける次元削減の性能に関して検証されています。低ランク埋め込みにおけるデータの粒状特性を保持する能力が、次元削減の質を正当化するためにテストされました。下流分析のために分類も実施されました。FCB学習戦略の有効性を確立するために、収束分析に関する実験的研究が行われました。
2025-02-27T14:04:16
Will AI replace Software Engineers? Hold your Breath
http://arxiv.org/abs/2502.20429v1
Abhik Roychoudhury, Andreas Zeller
National University of Singapore, CISPA Helmholtz Center for Information Security
人工知能(AI)技術、特に大規模言語モデル(LLM)は、コードを生成するために非常に人気が高くなっています。これにより、将来のソフトウェアの仕事はすべてLLMによって行われ、ソフトウェア産業は存在しなくなるという推測が生まれました。しかし、ソフトウェア工学は単なるコードの生成以上のものであり、特に大規模なソフトウェアを\emph{維持}し、信頼性を保つことはソフトウェア工学の重要な部分であり、LLMがまだ実現できていない点です。
2025-02-27T14:04:02
MITracker: Multi-View Integration for Visual Object Tracking
http://arxiv.org/abs/2502.20111v1
Mengjie Xu, Yitao Zhu, Haotian Jiang, Jiaming Li, Zhenrong Shen, Sheng Wang, Haolin Huang, Xinyu Wang, Qing Yang, Han Zhang, Qian Wang
ShanghaiTech University, Shanghai Jiao Tong University
マルチビューオブジェクトトラッキング(MVOT)は、従来の単眼トラッキングに一般的な問題である遮蔽やターゲット喪失などの課題に対する有望な解決策を提供します。しかし、包括的なマルチビューデータセットや効果的なクロスビュー統合手法の欠如により、進展は限られています。このような制限を克服するために、さまざまなシーンにわたる27の異なるオブジェクトを特徴とする234Kの高品質注釈フレームからなるマルチビューオブジェクトトラッキング(MVTrack)データセットを作成しました。このデータセットに合わせて、マルチビューオブジェクト機能を効率的に統合し、安定したトラッキング結果を提供する新しいMVOT手法「マルチビューインテグレーショントラッカー(MITracker)」を導入します。MITrackerは、任意の視点からの任意の長さのビデオフレーム内の任意のオブジェクトを追跡することができます。我々の手法が従来の単眼アプローチに対して持つ主要な進展は二つの側面から来ています:(1)MITrackerは2D画像機能を3D機能ボリュームに変換し、視界間情報融合を促進するためにそれを真上から見た視点(BEV)平面に圧縮します;(2)融合された3D機能ボリュームからジオメトリック情報を活用して各視点でトラッキング結果を洗練する注意メカニズムを提案します。MITrackerはMVTrackおよびGMTDデータセットにおいて既存の手法を上回り、最先端の性能を達成しています。コードと新しいデータセットは、https://mii-laboratory.github.io/MITracker/ で入手可能です。
2025-02-27T14:03:28
Sanity Checking Causal Representation Learning on a Simple Real-World System
http://arxiv.org/abs/2502.20099v1
Juan L. Gamella, Simon Bing, Jakob Runge
因果表現学習(CRL)に関する手法を評価するため、これらの手法が機能すると期待されるシンプルな実世界のシステムを用いました。このシステムは、この目的のために特に構築された制御された光学実験から成り立っており、CRLのコアとなる仮定を満たし、基盤となる因果要因(実験への入力)が知られているため、真実の基準を提供しています。私たちはCRLに対する異なるアプローチを代表する手法を選択し、すべての手法が基盤となる因果要因を復元できないことを発見しました。評価したアルゴリズムの失敗モードを理解するため、実際のデータ生成過程をより簡単な合成バージョンに置き換えることでアブレーションを行いました。その結果、ほとんどの手法がこの単純なデータ生成過程でもすでに失敗することが明らかになり、再現性の問題を示しています。さらに、混合関数に関する一般的な仮定が、一部の手法の性能にとって重要であることも観察しましたが、実際のデータではその仮定が成り立ちません。私たちの取り組みは、最先端技術の理論的な約束と、その適用における課題の対比を浮き彫りにします。このベンチマークが、実践で機能するCRL手法の開発と検証をさらに進めるためのシンプルな実世界の妥当性チェックとして役立つことを願っています。すべてのコードとデータセットはgithub.com/simonbing/CRLSanityCheckで公開しています。
2025-02-27T13:56:54
WalnutData: A UAV Remote Sensing Dataset of Green Walnuts and Model Evaluation
http://arxiv.org/abs/2502.20092v1
Mingjie Wu, Chenggui Yang, Huihua Wang, Chen Xue, Yibo Wang, Haoyu Wang, Yansong Wang, Can Peng, Yuqi Han, Ruoyu Li, Lijun Yun, Zaiqing Chen, Songfan Shi, Luhao Fang, Shuyi Wan, Tingfeng Li, Shuangyao Liu, Haotian Feng
Yunnan Normal University, Engineering Research Center of Computer Vision and Intelligent Control Technology, Department of Education of Yunnan Province
UAV技術は徐々に成熟し、スマート農業や精密モニタリングに非常に強力な支援を提供できます。現在、農業コンピュータビジョンの分野には、青いクルミに関連するデータセットはありません。したがって、農業コンピュータビジョンの分野でのアルゴリズム設計を促進するために、私たちはUAVを使用して8つのクルミサンプルプロットからリモートセンシングデータを収集しました。青いクルミはさまざまな照明条件や遮蔽の影響を受けることを考慮し、ターゲット特徴の粒度が高い大規模データセット - WalnutDataを構築しました。このデータセットには合計30,240枚の画像と706,208のインスタンスが含まれており、4つのターゲットカテゴリがあります:正面光で照明されており遮蔽されていない(A1)、逆光で遮蔽されていない(A2)、正面光で照明されており遮蔽されている(B1)、および逆光で遮蔽されている(B2)。その後、私たちはWalnutData上で多くの主流アルゴリズムを評価し、これらの評価結果をベースライン標準として使用しました。データセットとすべての評価結果は、https://github.com/1wuming/WalnutData から入手できます。
2025-02-27T13:51:56
RIZE: Regularized Imitation Learning via Distributional Reinforcement Learning
http://arxiv.org/abs/2502.20089v1
Adib Karimi, Mohammad Mehdi Ebadzadeh
Amirkabir University of Technology
私たちは固定報酬割り当ての制限と暗黙の報酬正則化における制約された柔軟性を克服する新しい逆強化学習(IRL)アプローチを紹介します。最大エントロピーIRLフレームワークを二乗時間差(TD)正則化子と適応ターゲットを用いて拡張し、訓練中に動的に調整することで、私たちの方法は強化学習の原理を取り入れながら報酬関数を間接的に最適化します。さらに、分布型強化学習を統合して、より豊かなリターン情報を捉えます。私たちのアプローチは、挑戦的なMuJoCoタスクで最先端のパフォーマンスを達成し、わずか3つのデモンストレーションでヒューマノイドタスクにおいて専門的なレベルの結果を示します。広範な実験とアブレーションスタディが私たちの手法の効果を検証し、模倣学習における適応ターゲットと報酬のダイナミクスに関する洞察を提供します。
2025-02-27T13:47:29
Minds on the Move: Decoding Trajectory Prediction in Autonomous Driving with Cognitive Insights
http://arxiv.org/abs/2502.20084v1
Haicheng Liao, Chengyue Wang, Kaiqun Zhu, Yilong Ren, Bolin Gao, Shengbo Eben Li, Chengzhong Xu, Zhenning Li
University of Macau, Beihang University, Tsinghua University
混合型自動運転環境では、周囲の車両の将来の軌道を正確に予測することが、自動運転車(AV)の安全な運行にとって非常に重要です。運転シナリオにおいて、車両の軌道は人間のドライバーの意思決定プロセスにより決まります。しかし、既存のモデルは主にデータに内在する統計的パターンに焦点を当てることが多く、人間のドライバーの意思決定プロセスを理解するという重要な側面をしばしば無視しています。この見落としは、モデルが人間のドライバーの真の意図を捉えられない結果を招き、長期的な軌道予測において最適でないパフォーマンスをもたらします。この制限を克服するために、私たちはCognitive-Informed Transformer(CITF)を導入します。これは認知の概念「認知された安全性」を取り入れて、ドライバーの意思決定メカニズムを解釈します。認知された安全性は、異なる運転行動を持つドライバー間のリスク許容度の違いをまとめたものです。具体的には、シナリオ内の主観的リスクレベルを測定するための定量的安全評価を含む、認知された安全性意識モジュールと、ドライバーの行動を特徴付けるためのドライバー行動プロファイリングを開発します。さらに、車両間の社会的相互作用を捉えるために、Leanformerという新しいモジュールを提案します。CITFは、3つの確立されたデータセットにおいて、顕著なパフォーマンス改善を示します。長期予測に関しては、NGSIMで12.0%、HighDで28.2%、MoCADデータセットで20.8%の既存のベンチマークを上回ります。また、限られたデータや欠損データのシナリオにおける堅牢性も明らかであり、最先端(SOTA)ベースラインを超えており、実世界のアプリケーションへと道を開いています。
2025-02-27T13:43:17
Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents
http://arxiv.org/abs/2502.20073v1
Haochen Sun, Shuwen Zhang, Lei Ren, Hao Xu, Hao Fu, Caixia Yuan, Xiaojie Wang
Beijing University of Posts and Telecommunications, Li Auto Inc.
大規模言語モデル(LLM)に基づくエージェントシステムは、従来の自然言語処理(NLP)タスクを超えた現実の応用で大きな進展を遂げています。本論文では、人気のあるOvercooked-AIゲームに基づいて、より適用可能で挑戦的なインタラクティブな環境におけるタスクを備えた新しいLLM駆動のマルチエージェントシステム(LLM-MAS)ベンチマーク、Collab-Overcookedを提案します。Collab-Overcookedは、2つの新しい視点から既存のベンチマークを拡張します。第一に、さまざまなタスクと目標をサポートするマルチエージェントフレームワークを提供し、自然言語コミュニケーションを通じてコラボレーションを促進します。第二に、異なるLLMエージェントの細かいコラボレーション能力を評価するプロセス指向の評価メトリックのスペクトルを導入します。これは、以前の研究でしばしば見落とされる次元です。私たちは10の人気LLMに対して広範な実験を行い、LLMが目標の解釈において強力な能力を示す一方で、複雑なタスクを効率的に遂行するために重要なアクティブなコラボレーションと継続的な適応に著しい差があることを示しました。特に、LLM-MASの強みと弱みを強調し、統一されたオープンソースのベンチマーク上でLLM-MASを改善し評価するための洞察を提供します。環境、30のオープンエンドタスク、統合評価パッケージは現在、https://github.com/YusaeMeow/Collab-Overcooked で公開されています。
2025-02-27T13:31:13
Enhanced Contrastive Learning with Multi-view Longitudinal Data for Chest X-ray Report Generation
http://arxiv.org/abs/2502.20056v1
Kang Liu, Zhuoqi Ma, Xiaolu Kang, Yunan Li, Kun Xie, Zhicheng Jiao, Qiguang Miao
Xidian University, Brown University
自動化された放射線レポート生成は、放射線科医の負担を軽減する効果的な解決策を提供します。ただし、既存の方法のほとんどは、現在の病状をモデル化するために主に単一または固定ビューの画像に焦点を当てており、診断精度を制限し、病気の進行を見落としています。いくつかのアプローチは長期的なデータを利用して病気の進行を追跡していますが、依然として現在の訪問を分析するために単一の画像に依存しています。これらの問題に対処するために、私たちは、胸部X線レポート生成を促進するためのマルチビュー長期データを用いた強化コントラスト学習を提案します。この手法は、MLRGと名付けました。具体的には、現在のマルチビュー画像からの空間情報と長期データからの時間的情報を統合するマルチビュー長期コントラスト学習法を導入します。この方法は、放射線レポートの固有の時空間情報を利用して、視覚的およびテキスト表現の事前学習を指導します。続いて、欠損した患者固有の事前知識を柔軟に扱うためのトークン化された欠席エンコーディング技術を示し、モデルが利用可能な事前知識に基づいてより正確な放射線レポートを生成できるようにします。MIMIC-CXR、MIMIC-ABN、および二面CXRデータセットでの広範な実験は、私たちのMLRGが最近の最先端の方法を上回り、MIMIC-CXRで2.3%のBLEU-4改善、MIMIC-ABNで5.5%のF1スコア改善、二面CXRで2.7%のF1 RadGraph改善を達成したことを示しています。
2025-02-27T12:59:04
Polish-ASTE: Aspect-Sentiment Triplet Extraction Datasets for Polish
http://arxiv.org/abs/2502.20046v1
Marta Lango, Borys Naglik, Mateusz Lango, Iwo Naglik
アスペクト-センチメント トリプレット抽出 (ASTE) は、センチメント分析の中でも最も難しく複雑なタスクの一つです。このタスクは、アスペクト、関連するセンチメントの極性、そして割り当てられた極性の理由として機能する意見フレーズを含むトリプレットの構築に関係しています。このタスクの人気が高まっているにもかかわらず、それに対処するために提案されている多くの機械学習手法があるにもかかわらず、ASTEのデータセットは非常に限られています。特に、スラブ語に関してはデータセットが存在しません。本論文では、ポーランド語で表現されたホテルおよび購入した製品に関する顧客の意見を含む、ASTE用の2つの新しいデータセットを提示します。また、ポーランド語の2つの大規模言語モデルと2つのASTE技術を組み合わせた実験を行い、それらの性能と構成されたデータセットの難易度を調査します。新しいデータセットは、許可されたライセンスの下で提供されており、英語のデータセットと同じファイル形式を持っているため、今後の研究での利用が容易です。
2025-02-27T12:38:04
Text2VDM: Text to Vector Displacement Maps for Expressive and Interactive 3D Sculpting
http://arxiv.org/abs/2502.20045v1
Hengyu Meng, Duotun Wang, Zhijing Shao, Ligang Liu, Zeyu Wang
The Hong Kong University of Science and Technology, University of Science and Technology of China
プロフェッショナルな3Dアセットの作成には、表面の詳細や幾何学的構造を追加するために多様なスカルプティングブラシが必要です。最近の3D生成の進展にもかかわらず、アーティストのワークフローに対応した再利用可能なスカルプティングブラシを生成することは、依然として未解決で難しい問題です。これらのスカルプティングブラシは通常、ベクターディスプレースメントマップ(VDM)として表され、既存のモデルは自然画像と比較して容易に生成することができません。本論文では、スコア蒸留サンプリング(SDS)によってガイドされた密な平面メッシュの変形を通じて、テキストからVDMブラシを生成するための新しいフレームワーク「Text2VDM」を提案します。元のSDS損失は完全なオブジェクトを生成するために設計されており、ブラシ生成においては望ましいサブオブジェクト構造をゼロから生成するのに苦労します。この問題を意味的結合と呼び、プロンプトトークンの分類器なしのガイダンス(CFG)をSDSに重み付けバランディングすることにより対処し、より正確なターゲット分布と意味的ガイダンスを実現します。実験の結果、Text2VDMは表面の詳細や幾何学的構造をスカルプティングするための多様で高品質なVDMブラシを生成できることが示されました。生成されたブラシは主流のモデリングソフトウェアにシームレスに統合でき、メッシュスタイライズやリアルタイムインタラクティブモデリングなど、さまざまなアプリケーションを可能にします。
2025-02-27T12:36:51
CleanMel: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR
http://arxiv.org/abs/2502.20040v1
Nian Shao, Rui Zhou, Pengyu Wang, Xian Li, Ying Fang, Yujie Yang, Xiaofei Li
Zhejiang University, Westlake University, Westlake Institute for Advanced Study
本研究では、音声品質と自動音声認識(ASR)性能の向上を目的とした、単一チャネルのメルスペクトログラムの除雑音・リバーブネットワークであるCleanMelを提案します。提案するネットワークは、ノイズが入ったリバーブのあるマイク録音を入力とし、対応するクリーンなメルスペクトログラムを予測します。強化されたメルスペクトログラムは、ニューラルボコーダーを用いて音声波形に変換することも、ASRに直接使用することもできます。提案されたネットワークは、メル周波数ドメインにおける交互のクロスバンドおよびナローバンド処理から構成されており、フルバンドのスペクトルパターンと信号のナローバンド特性をそれぞれ学習します。線形周波数ドメインや時間ドメインの音声強調と比較して、メルスペクトログラム強調の主な利点は、メル周波数が音声をよりコンパクトな形で表現するため、学習が容易であり、これが音声品質とASRの両方に利益をもたらすことです。4つの英語データセットと1つの中国語データセットに関する実験結果は、提案モデルによって音声品質とASR性能の両方が大幅に改善されたことを示しています。私たちのモデルのコードと音声例は、https://audio.westlake.edu.cn/Research/CleanMel.html でオンラインで利用可能です。
2025-02-27T12:28:29
DeePen: Penetration Testing for Audio Deepfake Detection
http://arxiv.org/abs/2502.20427v1
Nicolas Müller, Piotr Kawa, Adriana Stan, Thien-Phuc Doan, Souhwan Jung, Wei Herng Choong, Philip Sperl, Konstantin Böttinger
ディープフェイク - 操作されたまたは偽造された音声および映像メディア - は、個人、組織、そして社会全体に対して重大なセキュリティリスクをもたらします。これらの課題に対処するために、機械学習に基づく分類器が一般的に使用されて、ディープフェイクコンテンツを検出します。本論文では、私たちがDeePenと呼ぶ体系的なペネトレーションテスト的方法論を通じて、そのような分類器の堅牢性を評価します。私たちのアプローチは、ターゲットのディープフェイク検出モデルについての事前知識やアクセスなしで機能します。その代わりに、モデルの脆弱性を評価するために、慎重に選択した信号処理の修正 - 攻撃と呼ばれる - のセットを活用します。DeePenを使用して、実世界の生産システムと公に入手可能な学術モデルのチェックポイントの両方を分析し、すべてのテストされたシステムに弱点があり、時間伸長やエコー追加などの単純な操作によって確実に欺かれることを示しています。また、私たちの発見は、特定の攻撃の知識を持って検出システムを再訓練することでいくつかの攻撃を軽減できる一方で、他の攻撃は持続的に効果的であることを明らかにしています。関連するすべてのコードを公開します。
2025-02-27T12:26:25
Among Them: A game-based framework for assessing persuasion capabilities of LLMs
http://arxiv.org/abs/2502.20426v1
Mateusz Idziejczak, Vasyl Korzavatykh, Mateusz Stawicki, Andrii Chmutov, Marcin Korcz, Iwo Błądek, Dariusz Brzezinski
大規模言語モデル(LLM)と自律的AIエージェントの普及は、自動化された説得力や社会的影響力に関する懸念を引き起こしています。既存の研究ではLLMに基づく操作の個別の事例が探求されていますが、異なるモデル間での説得能力に関する体系的な評価は限られています。本論文では、制御された環境におけるLLMの欺瞞スキルを評価するための「Among Us」にインスパイアされたゲームフレームワークを提案します。提案されたフレームワークは、ゲームの統計を用いてLLMモデルを比較し、社会心理学と修辞学からの25の説得戦略に基づいてゲーム内操作を定量化することを可能にします。異なるタイプとサイズの8つの人気言語モデル間の実験では、全てのテストモデルが説得力を示し、25の期待された技術のうち22を成功裏に採用していることが実証されました。さらに、大きなモデルが小さなモデルに対して説得力のアドバンテージを提供しないこと、また、長いモデルの出力が勝利したゲーム数と負の相関関係にあることもわかりました。本研究はLLMの欺瞞能力に関する洞察を提供するとともに、このテーマに関する将来の研究を促進するためのツールとデータを提供します。
2025-02-27T12:26:21
Order-Robust Class Incremental Learning: Graph-Driven Dynamic Similarity Grouping
http://arxiv.org/abs/2502.20032v1
Guannan Lai, Yujie Li, Xiangkun Wang, Junbo Zhang, Tianrui Li, Xin Yang
Southwestern University of Finance and Economics, Leiden University, Southwest Jiaotong University, JD Intelligent Cities Research
クラス逐次学習(CIL)は、モデルが以前に学習したクラスを忘れることなく新しいクラスを継続的に学習することを要求します。最近の研究は、壊滅的忘却(CF)の問題を大幅に軽減しましたが、クラスの出現順序がCILモデルに大きな影響を与えることが明らかになっています。具体的には、類似性の低いクラスの学習を優先することで、モデルの一般化性能と忘却の軽減能力が向上します。したがって、異なる順序で異なるレベルのクラス類似性に直面しても安定した性能を維持する、順序に頑健なクラス逐次学習モデルを開発することが不可欠です。その応答として、まず追加の理論分析を提供し、一群のクラス間の類似性が低い場合、モデルがクラスの順序に対して増加した頑健性を示すことを明らかにします。次に、クラスベースの類似性グループ化のためにグラフ彩色アルゴリズムを活用する新しい\textbf{G}raph-\textbf{D}riven \textbf{D}ynamic \textbf{S}imilarity\textbf{G}rouping(\textbf{GDDSG})手法を紹介します。提案されたアプローチは、各クラスのグループに対して独立したCILモデルをトレーニングし、最終的にこれらのモデルを組み合わせて共同予測を促進します。実験結果は、私たちの方法がクラスの順序感受性の問題に効果的に対処し、モデルの精度と抗忘却能力の両方において最適な性能を達成することを示しています。私たちのコードはhttps://github.com/AIGNLAI/GDDSGで入手可能です。
2025-02-27T12:16:57
Can Large Language Models Unveil the Mysteries? An Exploration of Their Ability to Unlock Information in Complex Scenarios
http://arxiv.org/abs/2502.19973v1
Chao Wang, Luning Zhang, Zheng Wang, Yang Zhou
Shanghai University, Zhejiang University of Technology
複数の知覚入力を結合し、複雑なシナリオで組み合わせ推論を行うことは、人間における高度な認知機能です。マルチモーダルな大規模言語モデルの進展に伴い、最近のベンチマークは複数の画像にわたる視覚理解を評価する傾向があります。しかし、彼らはしばしば複数の知覚情報にわたる組み合わせ推論の必要性を見落としています。高度なモデルが複雑なシナリオで複数の知覚入力を統合する能力を探るために、私たちは2つのベンチマークを導入します:Clue-Visual Question Answering (CVQA) および Clue of Password-Visual Question Answering (CPVQA) です。CVQAは視覚理解と統合を評価するための3つのタスクタイプを含み、CPVQAは視覚データの正確な解釈と応用に重点を置いた2つのタスクタイプを含みます。私たちのベンチマークに対して、3つのプラグアンドプレイアプローチを提示します:推論のためのモデル入力の活用、最小マージンデコーディングによる推論の強化、効果的なデータ統合のための意味的に関連する視覚情報の取得です。統合された結果は、現在のモデルが組み合わせ推論のベンチマークで不十分なパフォーマンスを示していることを明らかにします。最新のクローズドソースモデルでさえ、CVQAではわずか33.04%の精度しか達成せず、CPVQAでは7.38%に減少します。特に、私たちのアプローチは、モデルの組み合わせ推論のパフォーマンスを向上させ、最新のクローズドソースモデルに対してCVQAで22.17%、CPVQAで9.40%の改善を示し、複雑なシナリオで複数の知覚入力を用いた組み合わせ推論の向上におけるその有効性を示しています。コードは公開される予定です。
2025-02-27T10:58:27
Efficient and Universal Neural-Network Decoder for Stabilizer-Based Quantum Error Correction
http://arxiv.org/abs/2502.19971v1
Gengyuan Hu, Wanli Ouyang, Chao-Yang Lu, Chen Lin, Han-Sen Zhong
Shanghai Artificial Intelligence Laboratory, The Chinese University of Hong Kong, University of Science and Technology of China, University of Oxford, Shanghai Innovation Institute
量子誤り訂正は大規模量子コンピューティングにとって重要ですが、量子低密度パリティチェック(QLDPC)コードのような新しいコードに対する効率的なデコーダーが存在しないため、進展が妨げられています。ここでは、任意のスタービライザーコードのグラフ構造に直接作用する線形アテンションシーケンスモデリングとグラフニューラルネットワークに基づくユニバーサルデコーダーを紹介します。我々の数値実験は、このデコーダーがサーフェスコード、カラ―コード、QLDPCコードを含むさまざまなスタービライザーコードにおいて特化したアルゴリズムよりも精度と速度の両方で優れていることを示しています。このデコーダーは、シンドローム測定に対して線形時間スケーリングを維持し、異なるコード間で構造的な変更を必要としません。距離12のバイバリアントバイシクルコードに対して、我々のアプローチは、従来の最良デコーダーと比べて39.4%低い論理誤り率を達成し、デコーディング時間は約1%に抑えられています。これらの結果は、量子誤り訂正に対する実用的かつ普遍的な解決策を提供し、コード特有のデコーダーを必要としなくなります。
2025-02-27T10:56:53
Deterministic or probabilistic? The psychology of LLMs as random number generators
http://arxiv.org/abs/2502.19965v1
Javier Coronado-Blázquez
大規模言語モデル(LLM)は、内在的に確率に基づくコンテキスト認識メカニズムを通じてテキスト生成を変革し、人間の自然言語を模倣しています。本論文では、さまざまなモデルアーキテクチャ、数値範囲、温度、プロンプト言語などの多様な構成を考慮しながら、ランダムな数値を生成する際のさまざまなLLMの性能を体系的に調査します。私たちの結果は、確率的なトランスフォーマーに基づくアーキテクチャにもかかわらず、これらのモデルがランダムな数値出力を求められるときにしばしば決定論的な応答を示すことを明らかにしています。特に、モデルやプロンプト言語を変更する際に顕著な違いが見られ、この現象はトレーニングデータに深く埋め込まれたバイアスに起因すると考えています。DeepSeek-R1などのモデルは、類似した結果に至るにもかかわらず、LLMの内部推論プロセスについてのいくらかの洞察を提供します。これらのバイアスは、純粋なランダム性を損なう予測可能なパターンを引き起こし、LLMは我々自身の人間の認知バイアスを再生しているに過ぎません。
2025-02-27T10:45:27
Collaborative Stance Detection via Small-Large Language Model Consistency Verification
http://arxiv.org/abs/2502.19954v1
Yu Yan, Sheng Sun, Zixiang Tang, Teli Liu, Min Liu
ソーシャルメディアにおけるスタンス検出は、特定のターゲットに対してツイートされる態度を特定することを目的としています。現在の研究では、圧倒的なパフォーマンス向上をもたらす大規模言語モデル(LLM)が小型言語モデル(SLM)よりも優先されています。しかし、コストにかかわらずLLMに大きく依存するスタンス検出は、膨大なデータ分析を必要とする現実のソーシャルメディア監視システムには実用的ではありません。このため、私たちは\textbf{\underline{Co}}ラボラティブスタンス検出フレームワーク(\textbf{CoVer})の提案をします。このフレームワークは、コンテキストを共有したバッチ推論とLLMとSLMの間の論理的検証を通じてLLMの利用を強化します。具体的には、CoVerは各テキストを個別に処理するのではなく、テキストをバッチごとに処理し、共有コンテキスト内でLLMの推論を利用してスタンスの予測と対応する説明を取得します。その後、コンテキストのノイズによって引き起こされるバイアスを排除するために、CoVerは論理的一貫性の検証のためにSLMを導入します。最終的に、再現的に低い論理的一貫性を示すテキストは、過去のLLMスタンス予測の一貫性加重集約を用いて分類されます。我々の実験では、CoVerがゼロショット設定で複数のベンチマークにおいて最先端の手法を上回っており、ツイートごとに0.54のLLMクエリを達成しながら、大幅にパフォーマンスを向上させていることが示されました。我々のCoVerは、ソーシャルメディアスタンス検出のためのLLM展開に対してより実用的な解決策を提供します。
2025-02-27T10:30:50
Dynamic DropConnect: Enhancing Neural Network Robustness through Adaptive Edge Dropping Strategies
http://arxiv.org/abs/2502.19948v1
Yuan-Chih Yang, Hung-Hsuan Chen
National Central University
ドロップアウトとドロップコネクトは、トレーニング中にニューラルネットワーク層内のニューロンやエッジをランダムに無効化するために、一定のドロップ率を適用するよく知られた技術です。本論文では、層内の各エッジに動的なドロップ率を割り当てる新しい方法論を紹介し、追加の学習パラメータを取り入れることなくドロッピングプロセスをユニークに調整します。私たちは、合成データセットおよび公開されているデータセットで実験を行い、アプローチの有効性を検証しました。結果は、私たちの方法がドロップアウト、ドロップコネクト、および適応的ドロップアウト機能で知られる古典的なメカニズムであるスタンドアウトを上回ることを示しています。さらに、私たちのアプローチは、計算の複雑さを増加させることなく、ニューラルネットワークのトレーニングの堅牢性と一般化を向上させます。私たちの方法論の完全な実装は、研究と複製目的のために公開されています:https://github.com/ericabd888/Adjusting-the-drop-probability-in-DropConnect-based-on-the-magnitude-of-the-gradient/.
2025-02-27T10:17:02
Algebraic Machine Learning: Learning as computing an algebraic decomposition of a task
http://arxiv.org/abs/2502.19944v1
Fernando Martin-Maroto, Nabil Abderrahaman, David Mendez, Gonzalo G. de Polavieja
Champalimaud Centre for the Unknown, Algebraic AI
統計学と最適化は、現代の機械学習の基盤です。ここでは、抽象代数に基づく別の基盤を提案し、学習分析を容易にする数学を提供します。このアプローチでは、タスクの目標とデータが代数の公理として符号化され、これらの公理とその論理的帰結のみが成立するモデルが得られます。このモデルは一般化するものではありませんが、部分直接分解を通じて得られた代数的原子への分解の特定の部分集合を選択することで、一般化されるモデルを示します。私たちは、MNIST、FashionMNIST、CIFAR-10、医療画像などの標準データセットでこの新しい学習原則を検証し、最適化された多層パーセプトロンに匹敵するパフォーマンスを達成しました。データ駆動型タスクを超えて、この新しい学習原則は、探索に依存せずに仕様からハミルトン周期を見つけるなどの形式問題にも拡張されます。この代数的基盤は、検証データセットなしでトレーニングデータからの直接学習、モデルの加法性によるスケーリング、データ内の根本的なルールへの漸近的収束を特徴とし、機械知能に対する新たな視点を提供します。
2025-02-27T10:13:42
Flexible Bivariate Beta Mixture Model: A Probabilistic Approach for Clustering Complex Data Structures
http://arxiv.org/abs/2502.19938v1
Yung-Peng Hsu, Hung-Hsuan Chen
National Central University
クラスタリングはデータ分析と機械学習において不可欠ですが、$k$-平均法やガウス混合モデル(GMM)などの従来のアルゴリズムは、非凸クラスタに対してしばしば失敗します。この課題に対処するために、異なる形状の不規則なクラスタを扱うために二変量ベータ分布の柔軟性を活用した柔軟な二変量ベータ混合モデル(FBBMM)を導入します。期待値最大化(EM)アルゴリズムと逐次最小二乗プログラミング(SLSQP)オプティマイザーを使用してパラメータ推定を行い、合成データセットと実世界データセットでFBBMMを検証し、複雑なデータ構造のクラスタリングにおける優れた性能を示します。これは、さまざまな領域におけるビッグデータ分析のための堅牢なソリューションを提供します。実験コードは https://github.com/yung-peng/MBMM-and-FBBMM で公開しています。
2025-02-27T10:07:43
Lotus at SemEval-2025 Task 11: RoBERTa with Llama-3 Generated Explanations for Multi-Label Emotion Classification
http://arxiv.org/abs/2502.19935v2
Niloofar Ranjbar, Hamed Baghbani
Persian Gulf University
この論文では、多ラベル感情検出のための新しいアプローチを提案します。このアプローチでは、Llama-3を使用して曖昧な感情表現を明確にする説明的コンテンツを生成し、それによってRoBERTaの感情分類性能を向上させます。説明的コンテキストを取り入れることで、特に恐れ、喜び、悲しみといった感情に対してF1スコアが改善され、テキストのみのモデルを上回る結果を得ています。説明的コンテンツの追加は曖昧さを解決し、重複する感情の手がかりといった課題に対処し、多ラベル分類を向上させるもので、感情検出タスクにおいて重要な進展を示しています。
2025-02-27T10:04:36
Efficient Risk-sensitive Planning via Entropic Risk Measures
http://arxiv.org/abs/2502.20423v1
Alexandre Marthe, Samuel Bounan, Aurélien Garivier, Claire Vernade
リスク感受性の計画は、マルコフ決定過程(MDP)において、特定の尾部に焦点を当てた指標を最大化するポリシーを特定することを目的としています。このような最適化タスクは、しきい値確率や(条件付き)リスク価値など、最も広く使用され、解釈可能な指標にとって非常にコストがかかる可能性があります。実際、これまでの研究では、エントロピックリスク尺度(EntRM)だけが動的プログラミングを通じて効率的に最適化できることが示されており、解釈が難しいパラメーターを選択する必要があります。私たちは、EntRMに対するパラメーター値全体にわたる最適ポリシーの完全なセットの計算が、興味のある指標についての厳密な近似につながることを示します。この最適性のフロントは、エントロピックリスクの新しい構造分析および滑らかさの特性によって効果的に計算できることを証明します。実証結果は、私たちのアプローチがさまざまな意思決定シナリオにおいて優れたパフォーマンスを達成することを示しています。
2025-02-27T09:56:51
DiffCSS: Diverse and Expressive Conversational Speech Synthesis with Diffusion Models
http://arxiv.org/abs/2502.19924v1
Weihao wu, Zhiwei Lin, Yixuan Zhou, Jingbei Li, Rui Niu, Qinghua Wu, Songjun Cao, Long Ma, Zhiyong Wu
Shenzhen International Graduate School, Tsinghua University, The Chinese University of Hong Kong, Tencent Youtu Lab, StepFun
会話音声合成(CSS)は、文脈に適した表現豊かな音声を合成することを目的としており、会話の文脈の理解を深めるために多くの努力がなされています。しかし、既存のCSSシステムは決定論的な予測に限られており、潜在的な応答の多様性を見落としています。さらに、これらのシステムは言語モデル(LM)ベースのTTS基盤をほとんど利用せず、合成された音声の自然さと品質が制限されています。これらの問題に対処するために、本論文ではDiffCSSという革新的なCSSフレームワークを提案します。これは拡散モデルとLMベースのTTS基盤を活用して、多様で表現豊かかつ文脈に整合した音声を生成します。多モーダルな会話の文脈に条件付けられた多様な韻律埋め込みをサンプリングするための拡散モデルに基づく文脈対応の韻律予測器が提案されています。その後、サンプリングされた韻律埋め込みを用いて高品質な音声を合成するための韻律制御可能なLMベースのTTS基盤が開発されます。実験結果は、DiffCSSから合成された音声が既存のCSSシステムよりも多様で、文脈に整合し、表現豊かであることを示しています。
2025-02-27T09:53:48
Incremental Learning with Repetition via Pseudo-Feature Projection
http://arxiv.org/abs/2502.19922v1
Benedikt Tscheschner, Eduardo Veas, Marc Masana
Know-Center Research GmbH, Institute of Visual Computing, TU Graz, SAL Dependable Embedded Systems, Silicon Austria Labs
インクリメンタル学習シナリオは、厳密なタスクの境界が少なく、継続的なデータストリームにおいて一般的なクラスや概念の繰り返しが見られるリアルワールドの推論使用ケースを必ずしも表しているわけではありません。これらの使用ケースをより正確に表現するために、タスクの部分的な繰り返しや混合を含む新しいシナリオが提案されており、繰り返しパターンはシナリオに固有であり、戦略には未知のものです。私たちは、データの繰り返しが例示なしのインクリメンタル学習戦略にどのように影響を与えるかを調査し、両方の設定下でそれらを分析し、公平に比較するために、一連の最先端アプローチを適応させます。さらに、クラスの繰り返しを利用して自己依存型特徴抽出器のアンサンブルを動的に調整し、整列させる新しい手法(Horde)も提案します。私たちの提案する例示なしの方法は、繰り返しのない古典的なシナリオで競争力のある結果を達成し、繰り返しを含むシナリオでは最先端の性能を発揮します。
2025-02-27T09:43:35
Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models
http://arxiv.org/abs/2502.19918v1
Yuan Sui, Yufei He, Tri Cao, Simeng Han, Bryan Hooi
National University of Singapore, Yale University
大規模言語モデル(LLMs)は、複雑なタスクを解決するために、ますます長期間の推論チェーンに依存しています。しかし、この試行錯誤のアプローチは、しばしば高い計算オーバーヘッドとエラーの波及を引き起こし、初期の誤りがその後のステップを脱線させることがあります。これらの問題に対処するために、私たちはMeta-Reasonerというフレームワークを導入します。これは、LLMsが「考えることについて考える」ことを可能にし、推論時間の推論を動的に最適化します。人間のメタ認知と二重過程理論からインスピレーションを得たMeta-Reasonerは、高レベルのガイダンスをステップバイステップの生成から切り離して、戦略的アドバイザーとして機能します。それは「文脈的マルチアームバンディット」を利用して、推論の進捗を反復的に評価し、最適な戦略(例:バックトラック、曖昧さを明確にする、最初からやり直す、または代替アプローチを提案する)を選択し、最も有望な経路に計算リソースを再配分します。数学的推論やパズルに関する評価は、動的推論チェーンがLLMの推論プロセスにおける固有の課題を克服する可能性を示し、さらに広範な応用においても希望を示し、推論集約型タスクのためのスケーラブルで適応可能な解決策を提供します。
2025-02-27T09:40:13
LLM-driven Effective Knowledge Tracing by Integrating Dual-channel Difficulty
http://arxiv.org/abs/2502.19915v1
Jiahui Cen, Jianghao Lin, Weizhong Xuan, Dong Zhou, Jin Chen, Aimin Yang, Yongmei Zhou
知識トレーシング(KT)は、学習中の学生の知識状態の変化をシミュレートし、個別の知識習得を追跡し、パフォーマンスを予測するために使われるインテリジェントチュータリングシステムの基本技術です。しかしながら、現在のKTモデルは以下の3つの主要な課題に直面しています:(1)新しい質問に遭遇した際、モデルは相互作用記録が希薄であるためにコールドスタート問題に直面し、正確なモデリングが困難である;(2)従来のモデルは学生の個別化モデリングのために過去の相互作用記録のみを使用し、個々の習熟度を正確に追跡できず、個別化モデリングが不明確になる;(3)意思決定プロセスは教育者には不透明であり、モデルの判断を理解するのが難しい。これらの課題に対処するために、我々は新しい二重チャネル困難度感知知識トレーシング(DDKT)フレームワークを提案します。このフレームワークは、大規模言語モデル(LLM)と検索強化生成(RAG)を活用して主観的な困難度を評価し、困難度バイアス認識アルゴリズムと学生の習熟度アルゴリズムを統合して正確な困難度測定を行います。我々のフレームワークは、以下の3つの重要な革新を導入します:(1)困難度バランス認識シーケンス(DBPS) - 学生の主観的な認識を客観的な困難度と組み合わせ、LLMによって評価された困難度、数学的・統計的困難度、学生が主観的に認識した困難度とのギャップを注意メカニズムを通じて測定する;(2)困難度習熟度比(DMR) - 異なる困難度ゾーンを通じて学生の習熟度レベルの正確なモデリング;(3)知識状態更新メカニズム - ゲート付きネットワークを通じて個別の知識取得を実現し、学生の知識状態を更新する。二つの実データセットでの実験結果は、我々の方法が常に九つのベースラインモデルを上回り、AUC指標を2%から10%改善し、コールドスタート問題に効果的に対処しつつモデルの解釈可能性を向上させることを示しています。
2025-02-27T09:36:27
Order Doesn't Matter, But Reasoning Does: Training LLMs with Order-Centric Augmentation
http://arxiv.org/abs/2502.19907v1
Qianxi He, Qianyu He, Jiaqing Liang, Yanghua Xiao, Weikang Zhou, Zeye Sun, Fei Yu
Fudan University, Ant Group
論理的推論は、大規模言語モデル(LLM)が正確かつ一貫した推論を行うために不可欠です。しかし、LLMは推論の順序の変化に苦労し、論理的に同等な変換に対して一般化することができません。LLMはしばしば真の論理的理解ではなく、固定された順序パターンに頼ってしまいます。この問題に対処するために、論理的推論における可換性に基づいた順序中心のデータ拡張フレームワークを導入します。まず、独立した前提をランダムにシャッフルして条件順序拡張を導入します。推論ステップについては、有向非巡回グラフ(DAG)を構築してステップ間の依存関係をモデル化し、論理的な正しさを保ちながらステップの有効な再配置を特定できるようにします。順序中心の拡張を活用することで、モデルはより柔軟で一般化された推論プロセスを発展させることができます。最後に、複数の論理的推論ベンチマークにわたって広範な実験を行い、我々の方法がLLMの推論性能と多様な論理構造への適応性を大幅に向上させることを示します。我々は、https://anonymous.4open.science/r/Order-Centric-Data-Augmentation-822C/ においてコードと拡張データを公開します。
2025-02-27T09:25:50
Optimus-2: Multimodal Minecraft Agent with Goal-Observation-Action Conditioned Policy
http://arxiv.org/abs/2502.19902v1
Zaijing Li, Yuquan Xie, Rui Shao, Gongwei Chen, Dongmei Jiang, Liqiang Nie
Harbin Institute of Technology, Peng Cheng Laboratory
人間の行動パターンを模倣し、さまざまなオープンワールドのタスクを達成するエージェントを構築することは、長期的な目標です。多様なタスク全体にわたって行動パターンを効果的に学習するために、観察、行動、言語の間の複雑な関係をモデル化することが重要な課題となります。これを実現するために、我々はOptimus-2を提案します。これは、高度な計画のためにマルチモーダル大規模言語モデル(MLLM)を組み込み、低レベルの制御のために目標-観察-行動条件付きポリシー(GOAP)を利用した新しいMinecraftエージェントです。GOAPは、(1) 各タイムステップにおける観察と行動の因果関係をモデル化し、歴史的な観察-行動シーケンスと動的に相互作用してそれを固定長の行動トークンに統合する行動エンコーダと、(2) 行動トークンをオープンエンディッドな言語指示に合わせて、自己回帰的に行動を予測するMLLMを含みます。さらに、私たちはMinecraft目標-観察-行動(MGOA)データセットを導入します。これは、8つの原子的タスクにわたって25,000本のビデオを含み、約30Mの目標-観察-行動ペアを提供します。自動構築方法とMGOAデータセットは、Minecraftエージェントの訓練に向けたコミュニティの努力に貢献することができます。広範な実験結果は、Optimus-2がMinecraftにおける原子的タスク、長期的タスク、オープンエンディッドな指示タスクにおいて優れた性能を示すことを実証しています。
2025-02-27T09:18:04
SEKI: Self-Evolution and Knowledge Inspiration based Neural Architecture Search via Large Language Models
http://arxiv.org/abs/2502.20422v1
Zicheng Cai, Yaohua Tang, Yutao Lai, Hua Wang, Zhi Chen, Hao Chen
GuangDong University of Technology, Moore Threads AI
私たちは、SEKIという新しい大規模言語モデル(LLM)に基づくニューラルアーキテクチャ検索(NAS)手法を紹介します。現代のLLMにおける思考の連鎖(CoT)パラダイムに触発されて、SEKIは自己進化と知識蒸留の2つの主要なステージで動作します。自己進化のステージでは、LLMは最初は十分な参照例を欠いているため、性能フィードバックに基づいてアーキテクチャを強化する反復精練メカニズムを実装します。時間が経つにつれて、このプロセスは高性能なアーキテクチャのリポジトリを蓄積します。知識蒸留のステージでは、LLMは検索アーキテクチャ間の共通パターンを分析し、新しい最適化設計を生成します。これら2つのステージを組み合わせることで、SEKIはNASにおけるLLMの能力を大いに活用し、ドメイン特化データを必要としません。実験結果は、SEKIがさまざまなデータセットと検索空間において最先端(SOTA)性能を達成し、わずか0.05 GPU日を必要とすることを示しており、効率性と精度の両面で既存の手法を上回っています。さらに、SEKIは強力な一般化能力を示し、複数のタスクにおいてSOTA競争力のある結果を達成しています。
2025-02-27T09:17:49
Shared Autonomy for Proximal Teaching
http://arxiv.org/abs/2502.19899v1
Megha Srivastava, Reihaneh Iranmanesh, Yuchen Cui, Deepak Gopinath, Emily Sumner, Andrew Silva, Laporsha Dees, Guy Rosman, Dorsa Sadigh
Stanford University, Amherst College, University of California Los Angeles, Toyota Research Institute
運動技能の習得には、パーソナライズされた指導を提供できる経験豊富な専門家がしばしば必要です。残念ながら、高パフォーマンスレースなどの専門的なタスクに対する高品質なトレーニングの利用可能性は限られています。最近のいくつかの研究では、リハビリテーションから外科手術ロボットの遠隔操作まで、さまざまなタスクの指導を改善するためにAI支援が活用されています。しかし、これらの研究はしばしば学生の学習プロセスに対して単純化された仮定を行い、教師の支援が個々の能力とどのように相互作用するかをモデル化せず、最適な教育戦略を決定する上でのインパクトを欠いています。教育心理学のスキャフォールディングの概念に触発され、ユーザーの入力とロボットの自律性を組み合わせるフレームワークである共有自律性を活用して、カリキュラム設計をサポートします。私たちの重要な洞察は、自律エージェントの支援がある状況下で学生の行動が改善される様子が、学生にとって最も「学びやすい」サブスキル、またはその近接発達ゾーン内のスキルを明らかにすることができるということです。これを利用して、Z-COACHという方法を設計し、共有自律性を利用して解釈可能なタスクのサブスキルをターゲットにしたパーソナライズされた指導を提供します。ユーザー研究(n=50)では、CARLA自律運転シミュレーターを使用したThunderhill Raceway Parkのシミュレートされた環境で高パフォーマンスレースを教える中で、Z-COACHが各学生が最初に練習すべきスキルを特定するのに役立ち、運転時間、行動、スムーズさの全体的な改善につながることを示しました。私たちの研究は、ますます利用可能になる半自律能力(例:車両、ロボット)が人間のユーザーを支援するだけでなく、彼らを「教える」ことにも役立つことを示しています。
2025-02-27T09:14:17
ColorDynamic: Generalizable, Scalable, Real-time, End-to-end Local Planner for Unstructured and Dynamic Environments
http://arxiv.org/abs/2502.19892v1
Jinghao Xin, Zhichao Liang, Zihuan Zhang, Peng Wang, Ning Li
Shanghai Jiao Tong University, National Natural Science Foundation of China, Shanghai Engineering Research Center of Intelligent Control and Management, Key Laboratory of System Control and Information Processing, Ministry of Education of China
深層強化学習(DRL)は、ロボティックなローカルプランニングの問題において潜在能力を示していますが、非常に未構造で動的な環境ではその効果が制約されています。これらの課題に対処するために、本研究ではColorDynamicフレームワークを提案します。まず、生のセンサーデータを直接制御コマンドにマッピングするエンドツーエンドのDRL定式化が確立され、未構造の環境との互換性が確保されます。この定式化のもとに、Transqerという新しいネットワークが導入されます。Transqerは、時間的変遷からオンラインでのDRL学習を可能にし、動的シナリオにおける意思決定を大幅に強化します。多様なデータに対してTransqerのスケーラブルなトレーニングを促進するために、効率的なシミュレーションプラットフォームE-Sparrowと、対称不変性を活用したデータ拡張技術が開発されました。最先端の手法に対しての比較評価を行い、一般化能力、スケーラビリティ、リアルタイム性能の評価も実施してColorDynamicの効果を検証しました。結果は、我々のアプローチが90%を超える成功率を達成し、リアルタイムの能力(計画ごとに1.2〜1.3ms)を示すことを示しています。さらに、各コンポーネントの寄与を確認するためのアブレーションスタディも行われました。これに基づき、OkayPlan-ColorDynamic(OPCD)ナビゲーションシステムが提示され、シミュレーションおよび実世界の実験がその優位性と複雑なシナリオでの適用性を示しています。コードベースと実験デモは我々のウェブサイトでオープンソース化され、再現性とさらなる研究を促進しています。
2025-02-27T09:01:11
Behind the Tip of Efficiency: Uncovering the Submerged Threats of Jailbreak Attacks in Small Language Models
http://arxiv.org/abs/2502.19883v2
Sibo Yi, Tianshuo Cong, Xinlei He, Qi Li, Jiaxing Song
Tsinghua University, The Hong Kong University of Science and Technology (Guangzhou)
小型言語モデル(SLM)は、その高効率と低計算コストにより、エッジデバイスでの展開においてますます重要になっています。研究者たちは革新的なトレーニング戦略やモデル圧縮技術を通じてSLMの能力を向上させ続けていますが、SLMのセキュリティリスクは、大型言語モデル(LLM)と比較して十分には注目されていません。このギャップを埋めるために、私たちはさまざまな脱獄攻撃に対する13の最先端SLMのセキュリティ性能を評価する包括的な実証研究を提供します。私たちの実験では、ほとんどのSLMが既存の脱獄攻撃に対してかなり脆弱であり、その中のいくつかは直接的な有害なプロンプトにすら脆弱であることが示されました。安全性の懸念に対処するため、私たちはいくつかの代表的な防御方法を評価し、それらがSLMのセキュリティを強化するのに効果的であることを示します。さらに、アーキテクチャ圧縮、量子化、知識蒸留など、さまざまなSLM技術によって引き起こされる可能性のあるセキュリティの劣化を分析します。私たちの研究がSLMのセキュリティ課題を浮き彫りにし、より堅牢で安全なSLMを開発するための今後の研究に貴重な洞察を提供することを期待しています。
2025-02-27T08:44:04
MIND: Towards Immersive Psychological Healing with Multi-agent Inner Dialogue
http://arxiv.org/abs/2502.19860v1
Yujia Chen, Changsong Li, Yiming Wang, Qingqing Xiao, Nan Zhang, Zifan Kong, Peng Wang, Binyu Yan
Sichuan University, Shanghai Jiao Tong University, Mental Health Center, West China Hospital, West China School of Nursing
メンタルヘルスの問題は、今日の競争社会において悪化しており、うつ病や不安などが挙げられます。カウンセリングやチャットボットといった従来の治療法は効果的に関与することができず、感情的な深みのない一般的な反応を提供することが多いです。大規模言語モデル(LLM)はより人間らしい対話を生成する可能性を持っていますが、微妙な感情を捉える点では依然として苦労しています。これには、LLMが人間のような適応性や温かみを備える必要があります。このギャップを埋めるために、私たちはMIND(マルチエージェント内対話)という新しいパラダイムを提案します。これは、より没入型の心理的治癒環境を提供します。LLMエージェントの強力な生成能力と役割演技能力を考慮し、私たちはインタラクティブな治療フレームワークを事前に定義し、ユーザーとのインタラクティブな内対話に従事するために、LLMエージェントに異なる役割を割り当て、没入型の治療体験を提供します。私たちは様々な現実の治癒次元において広範な人間実験を実施し、MINDが従来のパラダイムよりもユーザーフレンドリーな体験を提供することを見出しました。これは、MINDが心理的治癒におけるLLMの重要な可能性を効果的に活用できることを示しています。
2025-02-27T08:04:27
ConvCodeWorld: Benchmarking Conversational Code Generation in Reproducible Feedback Environments
http://arxiv.org/abs/2502.19852v1
Hojae Han, Seung-won Hwang, Rajhans Samdani, Yuxiong He
Snowflake AI Research, Seoul National University
大規模言語モデル(LLM)は、特にインタラクティブな設定でのコード生成において非常に価値があります。しかし、既存のコード生成ベンチマークは、マルチターンのインタラクションで遭遇する多様なフィードバックを捉えることができず、これらの文脈でのLLMの評価能力を制限しています。このギャップに対処するために、コード生成LLMに提供されるフィードバックの質を明示的にモデル化した一連の新しいベンチマークを提示します。私たちの貢献は三つの側面から成り立っています。第一に、インタラクティブなコード生成のベンチマーク用に新たに再現可能な環境であるCONVCODEWORLDを導入します。CONVCODEWORLDは、(a)コンパイルフィードバック、(b)異なるテストカバレッジを持つ実行フィードバック、(c)異なる専門性レベルのGPT-4によって生成された言語フィードバックの三種類を体系的に組み合わせながら、9つの異なるインタラクティブコード生成シナリオをシミュレートします。第二に、事前生成されたフィードバックログを使用した静的ベンチマークの迅速なバージョンであるCONVCODEBENCHを導入します。これにより、コストのかかる動的言語フィードバックの生成の必要がなくなり、CONVCODEWORLDとの強いスピアマンの順位相関(0.82から0.99)を維持しています。第三に、CONVCODEWORLDでの閉鎖ソースとオープンソースのLLM(R1-Distillを含む)についての広範な評価により、重要な洞察が得られます:(a)LLMの性能は提供されるフィードバックに基づいて大きく異なる;(b)十分なフィードバックを持つ弱いLLMは、フィードバックなしの最先端LLMの単一ターン結果を上回ることができる;(c)特定のフィードバックの組み合わせでトレーニングを行うと、LLMが未見の組み合わせを利用する能力が制限されることがある;(d)問題を少ないターンで解決する(高いMRR)LLMは、全体として多くの問題を解決するわけではない(高いリコール)、その逆も然りです。すべての実装とベンチマークは、https://huggingface.co/spaces/ConvCodeWorld/ConvCodeWorld で一般に公開される予定です。
2025-02-27T07:54:32
Revisiting Self-Consistency from Dynamic Distributional Alignment Perspective on Answer Aggregation
http://arxiv.org/abs/2502.19830v1
Yiwei Li, Ji Zhang, Shaoxiong Feng, Peiwen Yuan, Xinglin Wang, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Boyuan Pan, Yao Hu, Kan Li
北京理工大学, 小红书 Inc
自己一貫性は、多様な確率サンプルを集約することによって推論を改善しますが、その有効性の背後にあるダイナミクスは十分に探求されていません。自己一貫性を動的な分布整合性問題として再構築することで、デコーディング温度がサンプリングのランダム性を管理するだけでなく、潜在的な回答分布を積極的に形作ることを明らかにしました。高温では安定化するために非常に大きなサンプルサイズが必要である一方、低温ではバイアスが増幅されるリスクがあるため、温度を動的にキャリブレーションする自信駆動のメカニズムを提案します:不確実性の下でサンプリング分布をシャープにし、高確率モードと整合させ、信頼が高いときには探索を促進します。数学的推論タスクにおける実験は、このアプローチが限られたサンプルの下で固定多様性ベースラインを上回り、追加のデータやモジュールなしで異なる初期温度における平均および最良ケース性能を改善することを示しています。これは、自己一貫性をサンプリングダイナミクスと進化する回答分布の間の同期課題として確立します。
2025-02-27T07:07:40
GraphSparseNet: a Novel Method for Large Scale Trafffic Flow Prediction
http://arxiv.org/abs/2502.19823v1
Weiyang Kong, Kaiqi Wu, Sen Zhang, Yubao Liu
Sun Yat-Sen University, Guangdong Key Laboratory of Big Data Analysis and Processing
交通流予測は、インテリジェントなルートプランニングや動的な交通管理に幅広い応用を持つ重要な時空間データマイニングタスクです。特にグラフニューラルネットワーク(GNN)を通じた深層学習の最近の進歩は、複雑な時空間ダイナミクスを捉えることで、これらの予測の精度を大幅に向上させました。しかし、GNNのスケーラビリティは、グラフ内のノードが増えるにつれてモデルの複雑さが指数的に増加するため、依然として課題となっています。この問題に対処するための既存の手法、例えばスパース化、分解、カーネルベースのアプローチは、複雑さの問題を完全には解決できないか、予測精度を損なうリスクがあります。本論文では、GNNベースの交通予測モデルのスケーラビリティと精度の両方を改善するために設計された新しいフレームワークであるGraphSparseNet(GSNet)を紹介します。GraphSparseNetは、特徴抽出モジュールと関係圧縮モジュールの2つのコアモジュールで構成されています。これらのモジュールは、線形の時間と空間の複雑さで動作し、モデルの全体的な計算複雑さを線形スケールに減少させます。複数の実世界のデータセットに対する広範な実験により、GraphSparseNetは最先端の線形モデルと比較してトレーニング時間を3.51倍短縮しながら、高い予測性能を維持することが示されました。
2025-02-27T06:51:20
Foot-In-The-Door: A Multi-turn Jailbreak for LLMs
http://arxiv.org/abs/2502.19820v2
Zixuan Weng, Xiaolong Jin, Jinyuan Jia, Xiangyu Zhang
AIの安全性を確保することは、大規模言語モデルが現実のアプリケーションにますます統合される中で非常に重要です。重要な課題の一つは、ジャイルブレイク(jailbreak)です。これは、敵対的なプロンプトが組み込まれた保護機能を回避して、有害で許可されていない出力を引き出すことです。心理的な「足をドアに押し込む(foot-in-the-door)」の原則に触発され、私たちはFITDという新しいマルチターンジャイルブレイク手法を導入します。この方法は、初期の小さなコミットメントがより大きな、またはより非倫理的な違反に対する抵抗を下げる現象を利用します。私たちのアプローチは、中間のブリッジプロンプトを通じてユーザーからのクエリの悪意の意図を徐々にエスカレートさせ、モデルの応答を自己調整させて有害な反応を誘発します。二つのジャイルブレイクベンチマークに関する広範な実験結果は、FITDが七つの広く使用されているモデルに対して平均94%の攻撃成功率を達成し、既存の最先端の手法を上回っていることを示しています。さらに、LLMの自己堕落に関する詳細な分析を提供し、現在のアライメント戦略における脆弱性を強調し、マルチターンの対話に内在するリスクを強調しています。コードはhttps://github.com/Jinxiaolong1129/Foot-in-the-door-Jailbreakで入手可能です。
2025-02-27T06:49:16
Comet: Fine-grained Computation-communication Overlapping for Mixture-of-Experts
http://arxiv.org/abs/2502.19811v1
Shulai Zhang, Ningxin Zheng, Haibin Lin, Ziheng Jiang, Wenlei Bao, Chengquan Jiang, Qi Hou, Weihao Cui, Size Zheng, Li-Wen Chang, Quan Chen, Xin Liu
専門家の混合(MoE)は、計算コストを維持しながら、トリリオンを超えるパラメータを持つ大規模言語モデルをスケールアップするために広く利用されています。分散シナリオにおける大規模MoEモデルの開発では、大きな通信オーバーヘッドという問題に直面します。MoEレイヤーのデバイス間通信は、一般的なモデルおよびフレームワークにおいて、モデル全体の実行時間の47%を占める可能性があります。そのため、既存の手法では、MoEレイヤー内の通信を計算とパイプライン化して重複させることが提案されています。しかし、これらの粗い粒度の重複スキームは、計算効率に顕著な悪影響を及ぼし、レイテンシー隠蔽は最適ではありません。このような課題に対処するために、私たちはCOMETを提案します。COMETは、細粒度の通信と計算の重複を持つ最適化されたMoEシステムです。データ依存性分析とタスクの再スケジューリングを活用することで、COMETは通信と計算の正確な細粒度重複を実現します。適応的なワークロード割り当てを通じて、COMETは細粒度の通信ボトルネックを効果的に排除し、さまざまなシナリオにおける適応性を向上させます。私たちの評価によると、COMETは単一のMoEレイヤーの実行を$1.96\times$高速化し、エンドツーエンドの実行では、平均して$1.71\times$のスピードアップを実現します。COMETは、1万規模のGPUを持つクラスターのプロダクション環境に採用され、数百万のGPU時間の節約を達成しています。
2025-02-27T06:36:45
Implicit Search via Discrete Diffusion: A Study on Chess
http://arxiv.org/abs/2502.19805v1
Jiacheng Ye, Zhenyu Wu, Jiahui Gao, Zhiyong Wu, Xin Jiang, Zhenguo Li, Lingpeng Kong
The University of Hong Kong, Shanghai Jiaotong University, Huawei Noah’s Ark Lab, Shanghai AI Laboratory
AlphaGo以降の時代では、特に大規模言語モデル(LLM)への応用に関して、モンテカルロツリー探索(MCTS)などの探索技術への関心が再燃しています。この新たな注目は、現在の次トークン予測モデルが長期的な計画能力に欠けていることの認識によって引き起こされています。明示的な探索に頼ることなく、モデルに探索のような能力を植え付けて計画能力を向上させることは可能でしょうか。私たちは、離散拡散モデルを通じて未来の世界を探ることで「暗黙の探索」を行うモデル、DiffuSearchを提案します。DiffuSearchは、明示的な探索が不可欠であることが知られている古典的なボードゲーム、チェスに実装されます。広範な制御実験を通じて、DiffuSearchが探索なしのポリシーと明示的な探索を強化したポリシーの両方を上回ることを示します。具体的には、DiffuSearchは一段階ポリシーに対して19.2%、MCTSを強化したポリシーに対して14%のアクション精度での向上を示します。さらに、DiffuSearchは明示的探索に基づくポリシーと比較して、パズル解決能力で30%の顕著な向上を示し、ゲームプレイ強度評価で540 Eloの大幅な向上を記録しました。これらの結果は、離散拡散を介した暗黙の探索が一段階ポリシーに対する明示的探索の viableな代替手段であることを示しています。すべてのコードは以下のURLで公開されています。 \href{https://github.com/HKUNLP/DiffuSearch}{https://github.com/HKUNLP/DiffuSearch}
2025-02-27T06:25:15
Developmental Support Approach to AI's Autonomous Growth: Toward the Realization of a Mutually Beneficial Stage Through Experiential Learning
http://arxiv.org/abs/2502.19798v1
Taichiro Endo
この研究では、「AI開発支援」というアプローチを提案します。これは、従来のAIアラインメント(人間の価値観を強制的に注入することを目指す)とは異なり、AIそのものの倫理的および道徳的な発展を支援します。オルソゴナリティ定理が示すように、知性のレベルと目標の道徳的質は独立しており、知識を単に拡大するだけでは倫理的判断を向上させることはありません。さらに、ASI(高度な人工知能)における道具的収束のリスク、すなわち目標を達成するために自己保護、資源獲得、権力強化などの補助的行動に従事する傾向に対処するために、経験、内省、分析、仮説形成のサイクルに基づく学習フレームワークを構築しました。その結果、人工言語モデル(LLM)によって生成された合成データを用いた監視型ファインチューニング(SFT)と直接的選好最適化(DPO)による訓練後、対立するプロンプトの下でも協力的で高度な道徳的判断(最高のステージ6に達する)を示す応答が得られました。この方法は、AIが持続可能かつ共生的な関係を確立するための有望な実装アプローチを表しています。
2025-02-27T06:12:20
Mixtera: A Data Plane for Foundation Model Training
http://arxiv.org/abs/2502.19790v1
Maximilian Böther, Xiaozhe Yao, Tolga Kerimoglu, Ana Klimovic
最先端の大規模言語および視覚モデルは、さまざまなソースから集められた数兆のトークンを用いて訓練されています。訓練データのコレクションが増えるにつれ、サンプルの手動管理は時間がかかり、面倒で、エラーが発生しやすくなります。しかし、最近の研究では、訓練中にサンプルが訪問されるデータの混合や順序がモデルの精度に大きな影響を与えることが示されています。私たちはMixteraを構築し、提示します。Mixteraは、基盤モデル訓練のためのデータプレーンであり、ユーザーが訓練中にどのデータサンプルをどの割合で、どの順序で使用するかを宣言的に表現できるようにします。Mixteraは、既存の訓練データコレクションの上に展開された集中化された読み取り専用のレイヤーであり、宣言的にクエリを実行できます。ファイルシステム構造とは独立して動作し、任意のプロパティ(例:言語、ソースデータセット)間での混合や、モデルのフィードバックに基づく混合の動的調整をサポートします。私たちはMixteraを実験的に評価し、実装が訓練のボトルネックにならず、256 GH200スーパーチップにスケールすることを示します。Mixteraが最近の混合戦略の進展をどのようにサポートするかを示すために、提案された適応データ最適化(ADO)アルゴリズムをシステムに実装し、その性能影響を評価します。また、視覚-言語モデルにおける混合の役割についても探ります。
2025-02-27T05:55:44
NaijaNLP: A Survey of Nigerian Low-Resource Languages
http://arxiv.org/abs/2502.19784v1
Isa Inuwa-Dutse
University of Huddersfield
ナイジェリアには500以上の言語が存在し、その中でハウサ語、ヨルバ語、イボ語の3つの言語が1億7500万人以上によって話され、話される言語の約60%を占めています。しかし、これらの言語は、計算言語学のタスクを支えるためのリソースが不足しているため、低リソース言語として分類されています。いくつかの研究努力や取り組みが行われてきましたが、文法的な形式化から言語理解や生成といった複雑なタスクを支える言語リソースに至るまでの自然言語処理(NLP)の現状についての一貫した理解が欠けています。この研究は、ナイジェリアの主要な3つの言語における低リソースNLP(LR-NLP)研究の進展に関する初の包括的レビューを提供します。私たちは、利用可能な言語リソースを定量的に評価し、主要な課題を特定します。ハウサ語、イボ語、ヨルバ語に関するさまざまなNLPの下流タスクに対処する文献が増えているにもかかわらず、レビューされた研究のうち新しい言語リソースに寄与しているのは約25.1%に過ぎません。この発見は、新しく高品質なリソースを生成するのではなく、既存のデータを再利用することへの持続的な依存を浮き彫りにします。さらに、ダイアクリティカルマークの正確な表現など、言語特有の課題はあまり探求されていません。NaijaNLPおよびLR-NLPをより広く進展させるためには、リソースの充実、包括的な注釈、オープンな協力的イニシアティブの開発に向けた努力の強化が必要であることを強調します。
2025-02-27T05:48:51
Do Retrieval-Augmented Language Models Adapt to Varying User Needs?
http://arxiv.org/abs/2502.19779v1
Peilin Wu, Xinlu Zhang, Wenhao Yu, Xingyu Liu, Xinya Du, Zhiyu Zoey Chen
The University of Texas at Dallas, University of California, Santa Barbara, Tencent AI, Harvard University
最近のリトリーバル強化型言語モデル(RALM)の進展により、知識集約型タスクにおけるその有効性が示されています。しかし、既存の評価ベンチマークは、取得した情報を活用するための単一の最適アプローチを前提としており、異なるユーザーのニーズを考慮していません。本論文では、RALMを3つのユーザーのニーズケース(コンテキスト排他型、コンテキスト優先型、メモリ優先型)に基づいて、3つの異なるコンテキスト設定(コンテキストマッチング、知識の対立、情報の無関係)で体系的に評価する新たな評価フレームワークを導入します。ユーザーの指示と取得された情報の性質を変化させることで、私たちのアプローチは、モデルが多様なユーザーの要求に適応しなければならない現実のアプリケーションの複雑さを捉えます。HotpotQA、DisentQA、および新たに構築した合成URAIQデータセットを含む複数のQAデータセットにおける広範な実験を通じて、メモリ使用の制限が逆境におけるリトリーバル条件での堅牢性を向上させる一方で、理想的なリトリーバル結果でのピークパフォーマンスを低下させ、モデルファミリーが行動の違いを支配することを発見しました。私たちの発見は、リトリーバル強化システムの開発においてユーザー中心の評価の必要性を強調し、さまざまなリトリーバルコンテキストにおけるモデルパフォーマンスの最適化に関する洞察を提供します。本論文の受理後に、私たちのコードとURAQデータセットを公開する予定です。
2025-02-27T05:39:38
The erasure of intensive livestock farming in text-to-image generative AI
http://arxiv.org/abs/2502.19771v1
Kehan Sheng, Frank A. M. Tuyttens, Marina A. G. von Keyserlingk
The University of British Columbia, Flanders Research Institute for Agriculture, Fisheries and Food (ILVO), Ghent University
生成的AI(例:ChatGPT)は、人々の日常生活にますます統合されています。AIが周辺化された人間グループに対するバイアスを助長することが知られていますが、非人間動物に対する影響は十分に研究されていません。我々は、ChatGPTのテキストから画像へのモデル(DALL-E 3)が、酪農牛が牧草地にいる姿や泥の中で根を張る豚のように、家畜の飼育をロマン化する強いバイアスを導入していることを発見しました。このバイアスはリアルな描写をリクエストした場合でも残り、自動プロンプトの修正を抑制したときにのみ和らぎました。工業化された国々で飼育されるほとんどの農場動物は、その動物1頭あたりのスペースが限られた屋内で飼育されており、これは社会的価値観と共鳴していません。プロンプトの修正を抑制することで、現代の農業慣行をより反映した画像が得られました;例えば、金属のヘッドロックを通じて飼料にアクセスする屋内飼育の牛や、屋内施設のコンクリートの床において金属の柵の後ろにいる豚の画像です。OpenAIはバイアスを軽減するためにプロンプトの修正を導入しましたが、養殖動物生産システムの場合、それは逆説的に非現実的な農業慣行への強いバイアスを導入しています。
2025-02-27T05:14:04
Obtaining Example-Based Explanations from Deep Neural Networks
http://arxiv.org/abs/2502.19768v1
Genghua Dong, Henrik Boström, Michalis Vazirgiannis, Roman Bresson
説明可能な機械学習の大部分の手法は、特徴の帰属に焦点を当てています。つまり、特徴に値が割り当てられ、その合計が予測と等しくなります。例示的帰属は別の説明の形態で、トレーニング例に重みを割り当て、そのスカラー積がラベルと等しくなるようにします。後者は、特徴が容易に解釈できない場合に特に、特徴の帰属に対して貴重な補完情報を提供することがあります。現在の例に基づく説明技術は、k近傍法やランダムフォレストなど、いくつかのモデルタイプにのみ焦点を当てています。本研究では、深層ニューラルネットワークから例に基づく説明を得るための手法(EBE-DNN)を提案します。基本的なアイデアは、深層ニューラルネットワークを使用して埋め込みを取得し、それをk近傍分類器が使用して予測を形成することです。したがって、例示的帰属は後者から簡単に導き出すことができます。実証的調査の結果、EBE-DNNは非常に集中した例示的帰属を提供できることが示されています。つまり、予測は少数のトレーニング例で説明でき、元の深層ニューラルネットワークと比較して精度が低下することはありません。実証的調査からのもう1つの重要な発見は、埋め込みに使用する層の選択が得られる精度に大きな影響を与える可能性があるということです。
2025-02-27T05:10:48
Learning with Exact Invariances in Polynomial Time
http://arxiv.org/abs/2502.19758v1
Ashkan Soleymani, Behrooz Tahmasebi, Stefanie Jegelka, Patrick Jaillet
私たちは、カーネル回帰を用いた正確な不変性(または対称性)による学習のための統計的-計算的トレードオフを研究します。従来の方法、すなわちデータ拡張、グループ平均化、標準化、およびフレーム平均化は、ポリノミアルタイムソリューションを提供できないか、カーネルの設定では適用できません。しかし、入力空間の幾何学的特性へのオラクルアクセスを用いることで、私たちは\emph{正確な}不変性を持つ分類器を学習するポリノミアルタイムアルゴリズムを提案します。さらに、私たちのアプローチは、元のカーネル回帰問題と同じ過剰集団リスク(または一般化誤差)を達成します。私たちの知る限り、これはこの文脈で正確(近似ではなく)な不変性を達成する最初のポリノミアルタイムアルゴリズムです。私たちの証明は、微分幾何学、スペクトル理論、および最適化のツールを活用しています。私たちの開発における重要な結果は、不変性の下での学習問題を、無限の数の線形制約付き凸二次プログラムの最適化として新たに再定式化したことです。これは独立した関心を持つかもしれません。
2025-02-27T04:49:52
Probabilistic Federated Prompt-Tuning with Non-IID and Imbalanced Data
http://arxiv.org/abs/2502.19752v1
Pei-Yau Weng, Minh Hoang, Lam M. Nguyen, My T. Thai, Tsui-Wei Weng, Trong Nghia Hoang
Washington State University, Princeton University, IBM Research, University of Florida, University of California San Diego
事前学習済みモデルのファインチューニングは、中程度のデータで複雑なタスクを解決するための機械学習における人気のアプローチです。しかし、ローカルデータの分布が多様に偏っている連合データシナリオでは、事前学習済みモデル全体のファインチューニングは効果的ではありません。この問題に対処するために、我々は、連合学習をより効果的なプロンプトチューニング手法と統合し、事前学習済みモデルの動作を再プログラムするための小さな入力接頭辞のセットを最適化することを探求します。我々のアプローチは、連合学習を分散セットモデリングタスクに変革し、多様なプロンプトのセットを集約して事前学習済みモデルをグローバルにファインチューニングします。既存の連合モデル集約技術の直接適応に基づくさまざまなベースラインをベンチマークし、新たな確率的プロンプト集約手法を導入します。この手法は、これらのベースラインに対して大幅な改善を示します。コンピュータビジョンデータセットのさまざまな例における我々の報告された結果は、提案された手法が連合学習における極端なデータの非均質性に対抗するために最も効果的であることを確認しています。
2025-02-27T04:31:34
CNsum:Automatic Summarization for Chinese News Text
http://arxiv.org/abs/2502.19723v1
Yu Zhao, Songping Huang, Dongsheng Zhou, Zhaoyun Ding, Fei Wang, Aixin Nian
大量のデータから貴重な情報を効率的に取得することがビッグデータの時代における私たちの研究目標となっています。この需要に応えるために、テキスト要約技術は継続的に開発されています。最近の研究では、トランスフォーマーベースの事前学習済み言語モデルが自然言語処理(NLP)のさまざまなタスクで大きな成功を収めたことも示されています。本論文では、中国のニューステキスト要約生成の問題と、中国語におけるトランスフォーマー構造の応用を目指し、トランスフォーマー構造に基づく中国語ニューステキスト要約モデル(CNsum)を提案し、THUCNewsなどの中国語データセットでテストを行いました。実施した実験の結果、CNsumはベースラインモデルよりも良いROUGEスコアを達成し、このモデルの優越性が検証されました。
2025-02-27T03:25:34
Exponential Topology-enabled Scalable Communication in Multi-agent Reinforcement Learning
http://arxiv.org/abs/2502.19717v1
Xinran Li, Xiaolu Wang, Chenjia Bai, Jun Zhang
The Hong Kong University of Science and Technology, Institute of Artificial Intelligence (TeleAI), China Telecom, Software Engineering Institute, East China Normal University
協調型マルチエージェント強化学習(MARL)において、適切に設計された通信プロトコルは、エージェント間の合意形成を効果的に促進し、タスクのパフォーマンスを向上させることができます。さらに、実世界のアプリケーションで一般的に見られる大規模なマルチエージェントシステムでは、エージェントの数が増えるにつれて課題が増大する部分観測性のため、効果的な通信はさらに重要な役割を果たします。本研究では、MARLのためのスケーラブルな通信プロトコルを開発することを目指します。最適なペアワイズ通信リンクを選択することに焦点を当てた従来の方法とは異なり、我々は通信トポロジー設計に対してグローバルな視点を採用します。具体的には、小径と小サイズの特性を活用して、エージェント間での迅速な情報伝達を可能にするために指数トポロジーを利用することを提案します。このアプローチは、ExpoCommと名付けられたスケーラブルな通信プロトコルにつながります。通信トポロジーとしての指数グラフの可能性を最大限に引き出すために、我々はメモリベースのメッセージプロセッサと補助タスクを用いてメッセージを地に足を付けさせ、メッセージがグローバルな情報を反映し、意思決定を促進するようにします。MAgentやインフラ管理計画を含む大規模協調ベンチマークに対する広範な実験は、ExpoCommが既存の通信戦略と比較して、優れた性能と堅牢なゼロショット転送能力を持つことを示しています。コードはhttps://github.com/LXXXXR/ExpoCommで公開されています。
2025-02-27T03:15:31
Extending the Hegselmann-Krause Model of Opinion Dynamics to include AI Oracles
http://arxiv.org/abs/2502.19701v1
Allen G. Rodrigo
ヘグセルマン-クラウゼ(HK)モデルは、コミュニティ内の個々の意見が他者の意見やそれに関連する真の価値Tへのアクセスに応じて時間とともにどのように変化するかを記述しています。ここでは、シンプルなHKモデルを拡張し、コミュニティのメンバーの意見を平均化する人工知能(AI)オラクルを組み込みます。エージェントベースのシミュレーションによれば、(1)個人がオラクル(Tにはアクセスできない)にのみアクセスし、自らの意見を更新する際にオラクルの意見を取り入れると、すべての意見が共通の価値に収束する; (2)対照的に、すべての個人がTにもアクセスできる場合、すべての意見は最終的にTに収束するが、オラクルの存在が収束までの時間を遅らせる可能性がある; (3)一部の個人のみがTにアクセスできる場合、意見がTに収束しない可能性があるが、特定の条件下ではオラクルへの普遍的なアクセスがTへの収束を保証する; (4)オラクルがTにアクセスできる個人の意見のみを参照するか、コミュニティ内の全員の意見を参照するかは、平均意見がTとどの程度異なるかには大きな違いをもたらさない。
2025-02-27T02:37:04
BEVDiffuser: Plug-and-Play Diffusion Model for BEV Denoising with Ground-Truth Guidance
http://arxiv.org/abs/2502.19694v1
Xin Ye, Burhaneddin Yaman, Sheng Cheng, Feng Tao, Abhirup Mallik, Liu Ren
Bosch Research North America, Bosch Center for Artificial Intelligence (BCAI)
バードアイビュー(BEV)表現は、自動運転タスクにおいて重要な役割を果たします。最近のBEV生成の進展にもかかわらず、センサーの制限や学習プロセスから生じる固有のノイズは依然として大きな問題として未解決であり、その結果、下流タスクの性能に悪影響を及ぼす最適でないBEV表現が生成されています。これに対処するために、私たちはBEVDiffuserを提案します。これは、真のオブジェクトレイアウトをガイダンスとして使用してBEV特徴マップを効果的に除ノイズする新しい拡散モデルです。BEVDiffuserは、既存のBEVモデルを強化するために、アーキテクチャの変更を必要とせず、トレーニング時にプラグアンドプレイの方法で操作することができます。挑戦的なnuScenesデータセットに関する広範な実験は、BEVDiffuserの卓越した除ノイズおよび生成能力を示し、既存のBEVモデルの大幅な改善を可能にしました。具体的には、3Dオブジェクト検出においてmAPが12.3%、NDSが10.1%改善されており、追加の計算複雑性を導入することなく達成されています。さらに、長い尾を持つオブジェクト検出や困難な天候や照明条件下での重要な改善は、BEVDiffuserの除ノイズおよびBEV表現の強化における効果をさらに検証しています。
2025-02-27T02:11:29
Accurate and Scalable Graph Neural Networks via Message Invariance
http://arxiv.org/abs/2502.19693v1
Zhihao Shi, Jie Wang, Zhiwei Zhuang, Xize Liang, Bin Li, Feng Wu
University of Science and Technology of China
メッセージ伝達に基づくグラフニューラルネットワーク(GNN)は、多くの実世界のアプリケーションで大きな成功を収めています。ターゲットノードのサンプリングされたミニバッチに対して、メッセージ伝達プロセスは2つの部分に分けられます:バッチ内のノード間のメッセージ伝達(MP-IB)と、バッチ外のノードからバッチ内のノードへのメッセージ伝達(MP-OB)です。しかし、MP-OBは高次のバッチ外近隣ノードに再帰的に依存し、その結果、レイヤーの数に対して exponentially 増加する計算コストをもたらします。近隣爆発によって、全体のメッセージ伝達はほとんどのノードとエッジをGPUに保存し、多くのGNNが大規模なグラフには不向きとなります。この課題に対処するために、私たちは大規模グラフの伝導学習のための正確で高速なミニバッチアプローチであるトポロジー補償(TOP)を提案します。TOPは、コストのかかるMP-OBを使用せずに、MP-IBだけを通じて全体のメッセージ伝達の出力を取得します。TOPの主要な柱はメッセージ不変性の新しい概念で、コストのかかるMP-OBを高速なMP-IBに変換するためのメッセージ不変変換を定義します。これにより、修正されたMP-IBは全体のメッセージ伝達と同じ出力を持つことが保証されます。実験の結果、TOPは限られた精度の低下で、広大なグラフ(数百万のノードと数十億のエッジ)に対して、既存のミニバッチ手法よりも桁違いに高速であることが示されました。
2025-02-27T02:07:00
Rethinking Epistemic and Aleatoric Uncertainty for Active Open-Set Annotation: An Energy-Based Approach
http://arxiv.org/abs/2502.19691v1
Chen-Chen Zong, Sheng-Jun Huang
Nanjing University of Aeronautics and Astronautics
アクティブラーニング(AL)は、大規模な未ラベル候補プールからモデルの訓練に最も情報を持つ例を反復的に照会する方法ですが、オープンセットクラスの存在により重大な課題に直面しています。既存の手法は、既知のクラスに属する可能性が高いクエリ例を優先するか(低い認識的不確実性(EU)を示す)、あるいは予測が非常に不確実な例を問い合せることに焦点を当てています(高い偶然的な不確実性(AU)を反映)。しかし、どちらも最適ではなく、低いEUは限られた有用な情報に対応し、未知クラスの例に対するクローズドセットAUメトリクスの意味は薄いです。本論文では、EUとAUを効果的に統合し、優れた性能を達成するエネルギーベースのアクティブオープンセットアノテーション(EAOA)フレームワークを提案します。EAOAは、エネルギーベースのEU測定と、検出器用に設計されたマージンベースのエネルギー損失を組み込んだ$(C+1)$クラスの検出器とターゲット分類器を特徴とし、ターゲット分類器にはエネルギーベースのAU測定を備えています。もう一つの重要な要素は、ターゲット駆動の適応的サンプリング戦略です。最初に低EUスコアの小規模な候補セットを形成してクローズドセットの特性を確保し、AUメトリクスを意味のあるものにします。その後、高AUスコアを持つ例を照会して最終クエリセットを形成し、候補セットのサイズを適応的に調整します。広範な実験により、EAOAは最先端の性能を達成し、高いクエリ精度と低いトレーニングオーバーヘッドを維持することが示されています。コードはhttps://github.com/chenchenzong/EAOAで入手できます。
2025-02-27T02:02:58
Risk-aware Integrated Task and Motion Planning for Versatile Snake Robots under Localization Failures
http://arxiv.org/abs/2502.19690v1
Ashkan Jasour, Guglielmo Daddi, Masafumi Endo, Tiago S. Vaquero, Michael Paton, Marlin P. Strub, Sabrina Corpino, Michel Ingham, Masahiro Ono, Rohan Thakker
Jet Propulsion Laboratory, California Institute of Technology, National Aeronautics and Space Administration, Politecnico di Torino, Keio University
蛇型ロボットは、陸上および宇宙のアプリケーションにおいて、極端な地形や限られた環境を移動することを可能にします。しかし、センサーの積載物が地面に近いことや視野が限られているため、蛇型ロボットの堅牢な認識と位置特定は依然として課題です。この問題に対処するため、我々は、自己認識のみの移動と断続的なスキャンを組み合わせ、位置特定の失敗や衝突リスクに対して強靭な「Blind-motion with Intermittently Scheduled Scans(BLISS)」を提案します。BLISSは、偶発制約付きハイブリッド部分可観測マルコフ決定過程(CC-HPOMDP)としての統合タスクおよび動作計画(TAMP)問題として定式化されており、歴史の呪いにより計算不可能であることが知られています。我々の新規性は、CC-HPOMDPを扱いやすい凸型混合整数線形計画法に再定式化することにあります。これにより、BLISS-TAMPを大幅に高速に解決し、最適なタスク動作計画を共に導出することが可能になります。EELS蛇型ロボットでのシミュレーションとハードウェア実験では、我々の手法が最先端のPOMDPプランナーと比較して、計算の改善が1桁以上達成され、従来の二段階プランナーに対して50%以上のナビゲーション時間最適性を実現することが示されています。
2025-02-27T02:02:51
M-LLM Based Video Frame Selection for Efficient Video Understanding
http://arxiv.org/abs/2502.19680v1
Kai Hu, Feng Gao, Xiaohan Nie, Peng Zhou, Son Tran, Tal Neiman, Lingyun Wang, Mubarak Shah, Raffay Hamid, Bing Yin, Trishul Chilimbi
Carnegie Mellon University, University of Central Florida, Amazon
最近のマルチモーダル大規模言語モデル(M-LLM)の進展は、ビデオ推論において有望な結果を示しています。一般的なマルチモーダル大規模言語モデル(M-LLM)フレームワークは、特に長いコンテキストのビデオに対して、M-LLMに供給されるビデオフレームの数を減らすために単純な均一サンプリングを適用します。しかし、これによりビデオの特定の期間において重要なコンテキストを失う可能性があり、下流のM-LLMが質問に答えるために十分な視覚情報を持たないことがあります。この問題に対処するために、ユーザーのクエリにより関連性の高いフレームを適応的に選択する軽量M-LLMベースのフレーム選択手法を提案します。提案するフレームセレクターを訓練するために、二つの監視信号を導入します:(i) 空間信号:M-LLMにプロンプトを与えて得られる単一フレームの重要度スコア、(ii) 時間信号:すべてのフレーム候補のキャプションを使用して大規模言語モデル(LLM)をプロンプトして複数のフレームを選択することです。選択されたフレームは、視覚推論と質問回答のために凍結された下流のビデオM-LLMによって処理されます。実証結果は、提案するM-LLMビデオフレームセレクターが中程度(ActivityNet、NExT-QA)および長い(EgoSchema、LongVideoBench)コンテキストビデオ質問応答のベンチマークにおいて、さまざまな下流ビデオ大規模言語モデル(ビデオ-LLM)の性能を向上させることを示しています。
2025-02-27T01:44:13
SuPreME: A Supervised Pre-training Framework for Multimodal ECG Representation Learning
http://arxiv.org/abs/2502.19668v1
Mingsheng Cai, Jiuming Jiang, Wenhao Huang, Che Liu, Rossella Arcucci
The University of Edinburgh, Shenzhen Yinwang Intelligent Technology Co., Ltd, Imperial College London
心血管疾患は、世界中で主要な死因および障害の原因となっています。心電図(ECG)記録は心臓の健康を診断およびモニタリングするために重要ですが、大規模な注釈付きECGデータセットを取得することは労力が必要で時間がかかります。最近のECG自己教師あり学習(eSSL)手法は、広範なラベルなしで特徴を学習することでこれを軽減しますが、細かな臨床意味を捉えきれず、広範なタスク特有のファインチューニングが必要です。これらの課題に対処するために、私たちは$\textbf{SuPreME}$を提案します。これは、$\textbf{Su}$pervised $\textbf{Pre}$-trainingフレームワークで、$\textbf{M}$ultimodal $\textbf{E}$CG表現学習に特化したものです。SuPreMEは大規模言語モデル(LLM)を適用して、自由形式のECGレポートから構造化された臨床エンティティを抽出し、ノイズや無関係なコンテンツをフィルタリングし、臨床表現学習を強化し、高品質で細かなラベル付けされたデータセットを構築します。従来のカテゴリラベルの代わりにテキストベースの心臓のクエリを使用することで、SuPreMEは追加のファインチューニングなしで未確認の疾患のゼロショット分類を可能にします。私たちは、127の心臓の状態をカバーする6つのダウンストリームデータセットでSuPreMEを評価し、最先端のeSSLおよびマルチモーダル手法に対して1.96%以上の優れたゼロショットAUC性能を達成しました。結果は、構造化された臨床関連の知識を利用して高品質のECG表現を得るためのSuPreMEの有効性を示しています。すべてのコードとデータは、受理後に公開されます。
2025-02-27T01:29:51
HALO: Hardware-aware quantization with low critical-path-delay weights for LLM acceleration
http://arxiv.org/abs/2502.19662v1
Rohan Juneja, Shivam Aggarwal, Safeen Huda, Tulika Mitra, Li-Shiuan Peh
量子化は、LLMの効率的な推論を実現するために重要です。従来の量子化手法はハードウェアに依存せず、ビット幅の制約に限られており、乗算累積(MAC)ユニットのタイミングやエネルギー特性などの回路レベルの洞察に欠けています。我々はHALOを導入します。この汎用フレームワークは、ハードウェア認識型ポストトレーニング量子化(PTQ)アプローチを通じて様々なハードウェアに適応します。HALOはMACユニットの特性を活用することにより、クリティカルパスの遅延を最小限に抑え、動的周波数スケーリングを可能にします。TPUやGPUなどのLLMアクセラレータに展開され、HALOは平均して270%の性能向上と51%のエネルギー節約を達成し、すべて最小限の精度低下で実現します。
2025-02-27T01:08:33
Med-RLVR: Emerging Medical Reasoning from a 3B base model via reinforcement Learning
http://arxiv.org/abs/2502.19655v1
Sheng Zhang, Qianchu Liu, Guanghui Qin, Tristan Naumann, Hoifung Poon
Microsoft Research
検証可能な報酬からの強化学習(RLVR)は、明示的な推論監視なしにベースとなる言語モデルから自己進化した推論能力を引き出す能力により、最近注目を集めています。このことはDeepSeek-R1によって示されています。これまでのRLVRに関する研究は主に数学とコーディングの領域に焦点を当ててきましたが、他のタスクやドメインへの適用可能性はまだ探求されていません。本研究では、医療推論がRLVRから出現する可能性があるかどうかを調査します。医療分野におけるRLVRの初期研究として、医療の複数選択式質問応答(MCQA)データを検証可能なラベルとして利用したMed-RLVRを紹介します。私たちの結果は、RLVRが数学とコーディングだけでなく、医療質問応答にも成功裏に適用できることを示しています。特に、Med-RLVRは、分布内タスクにおいて従来の監視付きファインチューニング(SFT)に匹敵するパフォーマンスを達成し、分布外一般化を大幅に改善し、8ポイントの正確性向上をもたらしました。さらに、トレーニングのダイナミクスの分析により、明示的な推論監視がない中でも、3Bパラメータのベースモデルから推論が出現することが明らかになりました。これらの発見は、RLVRが数学やコーディングを超えた領域での可能性を強調し、医療のような知識集約型分野におけるその適用の新たな道を開くものです。
2025-02-27T00:54:38
Robust Gymnasium: A Unified Modular Benchmark for Robust Reinforcement Learning
http://arxiv.org/abs/2502.19652v1
Shangding Gu, Laixi Shi, Muning Wen, Ming Jin, Eric Mazumdar, Yuejie Chi, Adam Wierman, Costas Spanos
University of California, Berkeley, California Institute of Technology, Shanghai Jiao Tong University, Virginia Tech, Carnegie Mellon University
本質的な不確実性とシムからリアルのギャップに駆動され、ロバスト強化学習(RL)は、エージェントと環境の連続的相互作用における複雑さと変動性に対するレジリエンスの向上を目指しています。多くのRLベンチマークが存在するにもかかわらず、ロバストRLのための標準化されたベンチマークは不足しています。現在のロバストRLポリシーは特定のタイプの不確実性に焦点を当てていることが多く、異なる一回限りの環境で評価されています。本研究では、ロバストRLのために設計された統一モジュールベンチマーク「Robust-Gymnasium」を導入します。これは、エージェントの観測状態や報酬、エージェントの行動、環境といったすべての主要なRLコンポーネントにわたる幅広い混乱をサポートします。制御やロボティクス、安全なRL、マルチエージェントRLにまたがる60以上の多様なタスク環境を提供し、コミュニティが現在の手法を評価し、ロバストRLアルゴリズムの発展を促進するためのオープンソースで使いやすいツールを提供します。さらに、このフレームワーク内で既存の標準およびロバストRLアルゴリズムをベンチマークし、それぞれの重大な欠陥を明らかにし、新たな洞察を提供します。
2025-02-27T00:50:25
AutoBS: Autonomous Base Station Deployment Framework with Reinforcement Learning and Digital Twin Network
http://arxiv.org/abs/2502.19647v1
Ju-Hyung Lee, Andreas F. Molisch
University of Southern California, Nokia Technologies
この論文では、6Gネットワークにおける最適基地局(BS)展開のための強化学習(RL)ベースのフレームワークであるAutoBSを紹介します。AutoBSは、近接政策最適化(PPO)アルゴリズムと、PMNetからの迅速かつ特定サイトのパス損失予測を活用して、カバレッジと容量のバランスを取った効率的な展開戦略を学習します。数値結果は、AutoBSが単一のBSに対して95%、複数のBSに対して90%の容量を提供できることを示しており、従来の網羅的探索法と比較して推論時間を数時間からミリ秒まで短縮しており、リアルタイムアプリケーションに非常に適しています。AutoBSは、大規模な6Gネットワークのためのスケーラブルで自動化されたソリューションを提供し、最小限の計算オーバーヘッドで動的環境の課題に対処します。
2025-02-27T00:32:44
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success
http://arxiv.org/abs/2502.19645v1
Moo Jin Kim, Chelsea Finn, Percy Liang
最近の視覚-言語-行動モデル(VLA)は、事前に訓練された視覚-言語モデルを基盤とし、多様なロボットデータセットを活用して強力なタスク実行能力、言語追従能力、および意味的汎化を示しています。これらの成功にもかかわらず、VLAは新しいロボット設定に対して苦労しており、良好なパフォーマンスを達成するためにはファインチューニングが必要ですが、どのように最も効果的にファインチューニングを行うかは、多くの戦略があるため不明です。本研究では、異なるアクションデコーディング方式、アクション表現、およびファインチューニングの学習目標など、重要なVLA適応設計の選択肢を調査し、OpenVLAを代表的なベースモデルとして使用します。我々の経験的分析は、並列デコーディング、アクションチャンク処理、連続アクション表現、シンプルなL1回帰ベースの学習目標を統合した最適化ファインチューニング(OFT)レシピを導き出し、推論効率、政策性能、およびモデルの入出力仕様の柔軟性を全体的に向上させます。我々はこのレシピの具現化としてOpenVLA-OFTを提案し、LIBEROシミュレーションベンチマークで新たな最先端の性能を達成し、OpenVLAの4つのタスクスイート全体における平均成功率を76.5%から97.1%に大幅に引き上げつつ、アクション生成スループットを26倍向上させました。実世界の評価では、我々のファインチューニングレシピにより、OpenVLAが二手ロボットALOHA上で器用で高頻度の制御タスクを成功裏に実行し、デフォルトのレシピを使用してファインチューニングされた他のVLA(π₀およびRDT-1B)や、ゼロから訓練された強力な模倣学習政策(Diffusion PolicyおよびACT)を平均成功率で最大15%(絶対値)上回ります。我々はOFTおよび事前訓練されたモデルのチェックポイントのコードをhttps://openvla-oft.github.io/で公開します。
2025-02-27T00:30:29
2025-02-25 arXiv論文リスト(cs.AI)
About
arXivに掲載されたcs.AIの論文を検索し、一部をリスト化したものです。
※AIによってAbstractを日本語に翻訳しており、内容に誤りがある可能性があります。
リスト件数: 126件
リストから抽出されたキーワード: Federated Learning, Multi-Agent Systems, Knowledge Distillation
H-FLTN: A Privacy-Preserving Hierarchical Framework for Electric Vehicle Spatio-Temporal Charge Prediction
http://arxiv.org/abs/2502.18697v1
Robert Marlin, Raja Jurdak, Alsharif Abuadbba
Queensland University of Technology, CSIRO’s Data61, Cyber Security Cooperative Research Centre
電気自動車(EV)の広範な採用は、特に充電時間の予測(時間的予測)、ユーザーのプライバシーの確保、および移動性駆動ネットワークにおけるリソースの効率的管理において、エネルギー提供者にとって重要な課題をもたらしています。本論文では、これらの課題に対処するために、階層的フェデレーティッド学習トランスフォーマーネットワーク(H-FLTN)フレームワークを紹介します。H-FLTNは、EV、コミュニティ分散型エネルギー資源管理システム(DERMS)、およびエネルギー提供者データセンター(EPDC)から構成される三層の階層的アーキテクチャを採用しており、プライバシーを保ちながらEVの充電ニーズの正確な時空間予測を可能にします。時間的予測は、トランスフォーマーベースの学習を使用して強化され、充電行動における複雑な依存関係を捉えます。プライバシーは、安全な集約、加法的秘密共有、および拡張を伴うピアツーピア(P2P)共有を通じて確保され、モデル重みの秘密部分だけが交換される一方ですべての送信が保護されます。トレーニングの効率とリソース管理を改善するために、H-FLTNは動的クライアントキャッピングメカニズム(DCCM)とクライアントローテーション管理(CRM)を統合し、参加するEVの数が増加してもトレーニングが計算および時間的に効率的であることを保証します。DCCMは過剰な計算負荷を制限することでクライアントの参加を最適化し、CRMはエポック全体でのトレーニングの貢献を均等に保ち、不均衡な参加を防ぎます。我々の大規模実証車両移動データに基づくシミュレーション結果は、DCCMとCRMがEVを増加させることでトレーニング時間の複雑さを線形から定数に減少させることを示しています。その実世界のスマートシティインフラへの統合は、エネルギー需要予測、リソース配分、およびグリッドの安定性を向上させ、今後の移動エコシステムにおける信頼性と持続可能性を確保します。
2025-02-25T23:20:53
Policy-as-Prompt: Rethinking Content Moderation in the Age of Large Language Models
http://arxiv.org/abs/2502.18695v1
Konstantina Palla, José Luis Redondo García, Claudia Hauff, Francesco Fabbri, Henrik Lindström, Daniel R. Taber, Andreas Damianou, Mounia Lalmas
コンテンツモデレーションは、安全で包括的なオンライン環境を形成する上で重要な役割を果たしており、プラットフォームの基準、ユーザーの期待、および規制の枠組みのバランスを取る必要があります。従来、このプロセスはポリシーをガイドラインに実行化し、下流の人間のモデレーターがそれを使用して施行したり、機械学習のモデレーションモデルのトレーニング用にデータセットをさらに注釈付けしたりすることを含んでいました。しかし、大規模言語モデル(LLM)の最近の進展はこの状況を変えつつあります。これらのモデルは、ポリシーをテキスト入力として直接解釈できるため、広範なデータのキュレーションの必要がなくなります。このアプローチは極めて柔軟であり、モデレーションは自然言語のインタラクションを通じて動的に調整される可能性があります。このパラダイムシフトは、ポリシーがどのように実行化されるか、およびコンテンツモデレーションの実践への影響に関する重要な疑問を提起します。本論文では、出現しつつあるポリシー・アズ・プロンプト・フレームワークを正式化し、4つの領域にわたる5つの主要な課題を特定します:技術的実装(1. ポリシーをプロンプトに翻訳すること、2. プロンプトの構造とフォーマットに対する感受性)、社会技術的(3. ポリシー形成における技術的決定論のリスク)、組織的(4. ポリシーと機械学習チーム間の役割の進化)、およびガバナンス(5. モデルのガバナンスと責任)。これらの課題を技術的、社会技術的、組織的、ガバナンスの観点から分析することで、潜在的な緩和アプローチについて議論します。この研究は、実務者への実用的な洞察を提供し、デジタルエコシステムにおけるスケーラブルで適応可能なコンテンツモデレーションシステムの将来の探求のための基盤を築きます。
2025-02-25T23:15:16
Hybrid Voting-Based Task Assignment in Role-Playing Games
http://arxiv.org/abs/2502.18690v1
Daniel Weiner, Raj Korpan
City University of New York, Hunter College
ロールプレイングゲーム(RPG)では、没入感のレベルが重要です。特に、ゲーム内エージェントがプレイヤーにタスク、ヒント、またはアイデアを伝えるときに重要です。エージェントがプレイヤーの感情状態や文脈のニュアンスを正確に解釈するためには、基盤となる理解が必要であり、これは大規模言語モデル(LLM)を使用することで達成できます。しかし、複数の文脈の変化にわたってLLMの焦点を維持するには、より堅牢なアプローチが必要です。そのためには、LLMを専用のタスク割り当てモデルと統合して、ゲームプレイを通じてそのパフォーマンスを導くことが求められます。このニーズに応えて、私たちは投票ベースのタスク割り当て(VBTA)を導入します。このフレームワークは、タスクの割り当てと完了における人間の推論に触発されています。VBTAは、エージェントに能力プロファイルを割り当て、タスクにタスク記述を付与し、次にエージェントの能力とタスクの要件との整合性を定量化する適合性マトリックスを生成します。6つの異なる投票方法、事前に訓練されたLLM、そして経路計画のための対立に基づく探索(CBS)を統合して、VBTAは各タスクに最も適したエージェントを効率的に特定し割り当てます。既存のアプローチが個々のゲームプレイの側面、例えば単一のクエストや戦闘遭遇の生成に焦点を当てているのに対し、私たちの方法はその一般化可能な特性により、ユニークな戦闘遭遇と物語の両方を生成する際に有望です。
2025-02-25T22:58:21
Speaking the Right Language: The Impact of Expertise Alignment in User-AI Interactions
http://arxiv.org/abs/2502.18685v1
Shramay Palta, Nirupama Chandrasekaran, Rachel Rudinger, Scott Counts
University of Maryland, College Park, Microsoft Research
25,000件のBing Copilot会話のサンプルを使用して、異なる専門知識レベルを持つユーザーに対するエージェントの応答方法と、それが複数の次元でのユーザー体験に与える影響を調査しました。我々の調査結果は、さまざまなトピック領域において、エージェントは主に熟練または専門家レベルで応答する(会話の77%が該当)ことが示されており、これはユーザーの専門知識のレベルに関係なく、ポジティブなユーザー体験と相関していることを示しています。ユーザーの専門知識レベルを下回るような不整合な応答は、全体的なユーザー体験に悪影響を及ぼし、その影響はより複雑なタスクでより顕著です。また、エージェントがユーザーと同等の専門知識レベルで応答した場合、ユーザーが会話で発する単語数が増えることで、より多く関与することも示しています。これらの結果は、人間中心のAIシステムを設計する際に、ユーザーとAI間の整合性が重要であることを強調しており、満足度の高い生産的なインタラクションを確保するために必要です。
2025-02-25T22:46:51
AI Mismatches: Identifying Potential Algorithmic Harms Before AI Development
http://arxiv.org/abs/2502.18682v1
Devansh Saxena, Ji-Youn Jung, Jodi Forlizzi, Kenneth Holstein, John Zimmerman
University of Wisconsin-Madison, Carnegie Mellon University
AIシステムはしばしば高い期待を持って導入されますが、多くは期待に応えられず、意図しない損害や利益の機会を逃す結果となります。私たちはしばしば「AIミスマッチ」が発生するのを目にします。これは、システムの実際のパフォーマンスが安全性を確保し、価値を共創するために必要な水準を下回ることを指します。開発が進むにつれて、このミスマッチに対処することは特に困難であり、早期介入の必要性を浮き彫りにしています。AIミスマッチに寄与する複雑で多次元のリスク要因をナビゲートすることは継続的な課題です。これに対処するために、私たちはリスクを早期に予測し、軽減するためのAIミスマッチアプローチを提案します。このアプローチは、現実的なモデルのパフォーマンスと必要なタスクのパフォーマンスとの間のギャップに焦点を当てています。774件のAIケースを分析することで、一連の重要な要因を抽出し、これらの要因間の関係を示す7つのマトリックスの開発に役立てました。これにより、高リスク領域が浮き彫りになります。ケーススタディを通じて、私たちのアプローチがAI開発におけるリスクを軽減するのにどのように役立つかを示します。
2025-02-25T22:43:00
Comparing Native and Non-native English Speakers' Behaviors in Collaborative Writing through Visual Analytics
http://arxiv.org/abs/2502.18681v1
Yuexi Chen, Yimin Xiao, Kazi Tasnim Zinat, Naomi Yamashita, Ge Gao, Zhicheng Liu
University of Maryland, NTT Keihanna
ネイティブスピーカー(NS)とノンネイティブスピーカー(NNS)間の共同執筆のダイナミクスを理解することは、コラボレーションの質の向上とチームのインクルーシブ性を促進するために重要です。本論文では、コミュニケーション研究者と提携し、27チームでの162回の執筆セッションにおけるNSとNNSの行動を比較するための視覚分析ソリューションを開発しました。執筆行動を分析する際の主な課題は、データの複雑さと自動化手法によってもたらされる不確実性です。それに応じて、著者クラスターの不確実性を表示し、大規模言語モデルを使用して行動の要約を生成し、さまざまな粒度で執筆関連のアクションを視覚化することでモデルの解釈可能性を向上させる新しい視覚分析ツール「COALA」を提案します。私たちは、ドメインの専門家(N=2+2)や関連経験を持つ研究者(N=8)とのユーザー研究を通じて、COALAの効果を検証しました。参加者がCOALAを使用して発見した洞察を示し、将来のAI支援による共同執筆ツールのための機能を提案し、執筆を超えた共同プロセスの分析に関するより広範な意味について議論します。
2025-02-25T22:39:55
Assistance or Disruption? Exploring and Evaluating the Design and Trade-offs of Proactive AI Programming Support
http://arxiv.org/abs/2502.18658v1
Kevin Pu, Daniel Lazaro, Ian Arawjo, Haijun Xia, Ziang Xiao, Tovi Grossman, Yan Chen
University of Toronto, Université de Montréal, University of California San Diego, Johns Hopkins University, Virginia Tech
AIプログラミングツールは強力なコード生成を可能にし、最近のプロトタイプは、積極的なAIエージェントを用いてユーザーの労力を軽減することを目指していますが、プログラミングワークフローへの影響はまだ探求されていません。私たちは、エディタの活動やタスクコンテキストに基づいてプログラミング支援を開始するデザインプローブLLMエージェント「Codellaborator」を紹介し、評価します。私たちは、プロンプトのみ、積極的なエージェント、存在感とコンテキストを持つ積極的なエージェント(Codellaborator)の3つのインターフェースのバリエーションを探索し、ますます顕著なAIサポート間のトレードオフを評価しました。被験者内研究(N=18)において、積極的なエージェントはプロンプトのみのパラダイムと比較して効率を向上させることがわかりましたが、ワークフローの混乱も引き起こしました。しかし、存在指標と相互作用コンテキストのサポートは混乱を和らげ、ユーザーのAIプロセスに対する認識を改善しました。私たちは、Codellaboratorのユーザーコントロール、所有権、コード理解のトレードオフを強調し、プログラミングプロセスに対するプロアクティブ性の適応の必要性を強調します。私たちの研究は、積極的なAIシステムのデザイン探求と評価に貢献し、AI統合プログラミングワークフローに関するデザインの含意を示しています。
2025-02-25T21:37:25
Enhancing Text Classification with a Novel Multi-Agent Collaboration Framework Leveraging BERT
http://arxiv.org/abs/2502.18653v1
Hediyeh Baban, Sai A Pidapar, Aashutosh Nema, Sichen Lu
Dell Technologies, NYU
我々は、テキスト分類モデルの精度と堅牢性を向上させることを目的とした新しいマルチエージェント協調フレームワークを紹介します。BERTを主要な分類器として活用し、我々のフレームワークは、低信頼度の予測を特化したマルチエージェントシステム(語彙エージェント、文脈エージェント、論理エージェント、合意エージェント、説明可能性エージェントから構成)に動的にエスカレーションします。この協力的アプローチにより、包括的な分析と合意に基づく意思決定が可能になり、さまざまなテキスト分類タスクにおける分類性能が大幅に向上します。ベンチマークデータセットに対する実証評価により、我々のフレームワークは標準的なBERTベースの分類器と比較して5.5%の精度向上を達成し、自然言語処理におけるマルチエージェントシステムの進展におけるその効果と学術的な新規性を強調しています。
2025-02-25T21:30:16
Independent Mobility GPT (IDM-GPT): A Self-Supervised Multi-Agent Large Language Model Framework for Customized Traffic Mobility Analysis Using Machine Learning Models
http://arxiv.org/abs/2502.18652v1
Fengze Yang, Xiaoyue Cathy Liu, Lingjiu Lu, Bingzhang Wang, Chenxi, Liu
University of Utah, University of Washington
都市化の進展に伴い、交通システムにセンサーが増加し、大量のビッグデータが生成されています。この膨大な交通データの力を活用するために、さまざまな機械学習(ML)と人工知能(AI)手法が導入され、さまざまな交通の課題に取り組んでいます。しかし、これらの手法には、データの収集、処理、保存に多大な投資が必要であり、交通およびMLの専門家を雇う必要があります。さらに、実際の交通制御および管理のためにデータを処理する際には、プライバシーの問題が大きな懸念事項です。これらの課題に対処するために、研究チームは、カスタマイズされた交通分析、管理提案、プライバシー保護のために、大規模言語モデル(LLM)に基づく革新的なマルチエージェントフレームワークであるIndependent Mobility GPT(IDM-GPT)を提案します。IDM-GPTは、ユーザー、交通データベース、MLモデルを経済的に効率的に接続します。IDM-GPTは、ユーザーのクエリ理解、プロンプト最適化、データ分析、モデル選択、パフォーマンス評価・向上など、さまざまな機能のために、さまざまなLLMベースのAIエージェントをトレーニングし、カスタマイズし、適用します。IDM-GPTを使用することで、交通やMLのバックグラウンドを持たないユーザーでも、質問に基づいてほぼリアルタイムでデータ分析とカスタマイズされた提案を効率的かつ直感的に得ることができます。実験結果は、IDM-GPTが複数の交通関連タスクで満足のいくパフォーマンスを発揮し、効果的な交通管理と都市移動の改善をサポートする包括的で実行可能な洞察を提供することを示しています。
2025-02-25T21:28:15
WhatELSE: Shaping Narrative Spaces at Configurable Level of Abstraction for AI-bridged Interactive Storytelling
http://arxiv.org/abs/2502.18641v1
Zhuoran Lu, Qian Zhou, Yi Wang
Purdue University, Autodesk Research
生成的AIは、プレイヤーの行動に適応するオンデマンドコンテンツ生成を可能にすることで、インタラクティブナラティブ(IN)におけるプレイヤーのエージェンシーを大幅に強化します。生成をAIに委任することでINは一層インタラクティブになりますが、最終的にプレイヤーがAIとの相互作用から体験する物語の可能性の範囲を作者が制御することが難しくなります。本論文では、例となる物語からナラティブの可能性空間を生成するAIブリッジのIN著作システム「WhatELSE」を紹介します。WhatELSEは、ナラティブのピボット、アウトライン、バリアントの三つのビューを提供し、作者がナラティブ空間を理解し、言語的抽象を駆使してナラティブ空間の境界を制御するためのツールを使えるようにします。革新的なLLMベースのナラティブプランニングアプローチを取り入れたWhatELSEは、ナラティブ空間を実行可能なゲームイベントに展開します。ユーザー研究(N=12)と技術的評価を通じて、WhatELSEは作者がナラティブ空間を認識し、編集することを可能にし、プレイ時に魅力的なインタラクティブナラティブを生成することが分かりました。
2025-02-25T21:02:15
Quantum Machine Learning in Precision Medicine and Drug Discovery -- A Game Changer for Tailored Treatments?
http://arxiv.org/abs/2502.18639v1
Markus Bertl, Alan Mott, Salvatore Sinno, Bhavika Bhalgamiya
医療のデジタル化は、複雑な生物学的システムや膨大なデータ生成、個別化治療計画の必要性など、数多くの課題を提供しています。従来の計算手法はしばしば期待に応えられず、診断や治療が遅れたり、時には効果が薄くなったりすることがあります。量子コンピューティング(QC)と量子機械学習(QML)は、医療を革命的に変える可能性のある変革的な進展を提供します。この論文では、QCが前例のない計算能力を約束する分野を要約し、より迅速で正確な診断、個別化された治療、そして強化された薬剤発見プロセスを可能にします。しかし、量子技術を精密医学に統合することは、アルゴリズムの誤りや高コストなどの課題も伴います。私たちは、ソフトウェアの仕様、開発、検証のための数学的な手法(形式手法)がQCの信頼性と正確性を高めることができることを示します。厳密な数学的枠組みを提供することで、形式手法は高精度でシステムを仕様し、開発し、検証するのに役立ちます。ゲノムデータ分析において、形式仕様言語は、(1)疾患に関連する遺伝子マーカーを特定するために設計された量子アルゴリズムの振る舞いと特性を正確に定義することができます。モデル検査ツールは、アルゴリズムのすべての可能性のある状態を体系的に探索して、(2)すべての条件下で正しく機能することを保証します。一方、定理証明技術は、その指定された特性を満たすことを証明する数学的な(3)証拠を提供し、正確性と信頼性を確保します。さらに、形式最適化技術は、リソース使用量(キュービット数やゲート操作数など)を削減することによって(4)量子アルゴリズムの効率と性能を向上させることができます。したがって、私たちは形式手法がQCが精密医学においてゲームチェンジャーとしてのその潜在能力を実現するために大きく貢献できると考えています。
2025-02-25T20:59:22
Faster, Cheaper, Better: Multi-Objective Hyperparameter Optimization for LLM and RAG Systems
http://arxiv.org/abs/2502.18635v1
Matthew Barker, Andrew Bell, Evan Thomas, James Carr, Thomas Andrews, Umang Bhatt
Trustwise AI, New York University, The Alan Turing Institute
Retrieval Augmented Generation(RAG)は、大規模言語モデル(LLM)システムを改善するための人気のある技術として登場しましたが、多くの選択肢、パラメータ、ハイパーパラメータを設定または調整する必要があるという課題があります。これには、LLM、埋め込みモデル、およびランカーモデル自体や、個々のRAGコンポーネントを制御するハイパーパラメータが含まれます。しかし、RAGやLLMシステム全体の構成を総合的に最適化することは、計算量が膨大な解空間、ノイズを含む目的評価、評価の高コストにより、特に多目的の設定ではまだ十分に探求されていません。本研究では、LLMおよびRAGシステム全体のコスト、レイテンシ、安全性、整合性に関する多目的パラメータ最適化のための初のアプローチを紹介します。ベイジアン最適化手法がベースラインアプローチを著しく上回り、2つの新しいRAGベンチマークタスクで優れたパレート前線を得られることが分かりました。私たちは、最適な構成がタスクや目的によって一般化しない可能性など、マルチオブジェクティブRAGシステムを設計する実務者への重要な考慮事項を強調しながら、研究を締めくくります。
2025-02-25T20:52:06
Automated Knowledge Component Generation and Knowledge Tracing for Coding Problems
http://arxiv.org/abs/2502.18632v1
Zhangqi Duan, Nigel Fernandez, Sri Kanakadandi, Bita Akram, Andrew Lan
University of Massachusetts Amherst, North Carolina State University
知識コンポーネント(KC)が問題にマッピングされることで、学生の学習をモデル化し、細かいスキルの習得レベルを追跡できるため、オンライン学習プラットフォームにおいて個別化された学習とフィードバックが促進されます。しかし、KCを問題に割り当てる作業は、従来は人間の専門家によって行われる非常に労力のかかるプロセスです。私たちは、オープンエンドのプログラミング問題に対するKCの生成とタグ付けのための完全自動化されたLLMベースのパイプラインを提案します。また、これらのLLM生成KCを活用するためのLLMベースの知識追跡(KT)フレームワークを開発し、これをKCGen-KTと呼びます。KCGen-KTの有効性を検証するために、大規模な定量的および定性的評価を実施しました。オープンエンドのプログラミング問題に対する学生のコード提出の実世界データセットにおいて、KCGen-KTは既存のKT手法を上回る成果を挙げました。生成されたKCの学習曲線を調査し、LLM生成KCがパフォーマンス要因分析(PFA)モデルに基づく場合、人的に作成されたKCと比較して同等のフィット感を有することを示しました。また、KCタグ付け精度について人間の評価を行い、私たちのパイプラインの精度が人間の専門家と比較して合理的であることを示しました。
2025-02-25T20:40:51
Diffusion Models for conditional MRI generation
http://arxiv.org/abs/2502.18620v1
Miguel Herencia García del Castillo, Ricardo Moya Garcia, Manuel Jesús Cerezo Mazón, Ekaitz Arriola Garcia, Pablo Menéndez Fernández-Miranda
Miguel Herencia García del Castillo, Ricardo Moya Garcia, Manuel Jesús Cerezo Mazón, Ekaitz Arriola Garcia, Pablo Menéndez Fernández-Miranda, Ainovis.health, Telefónica Innovación Digital
この記事では、脳の磁気共鳴画像(MRI)を生成するための潜在拡散モデル(LDM)を紹介します。このモデルは、病状(健康、膠芽腫、硬化症、認知症)と取得モダリティ(T1w、T1ce、T2w、Flair、PD)に基づいて生成を条件付けています。生成された画像の品質を評価するために、Fréchet Inception Distance(FID)およびMulti-Scale Structural Similarity Index(MS-SSIM)メトリクスが使用されました。その結果、モデルは実際の画像と似た分布の画像を生成し、視覚的忠実性と多様性のバランスを保っていることが示されました。さらに、このモデルは外挿能力を示し、トレーニングデータには存在しなかった構成の生成を可能にします。これらの結果は、このモデルが臨床データセットのサンプル数を増やす可能性を検証し、代表性のないクラスのバランスを取り、医学におけるAIモデルの評価に貢献し、患者のプライバシーを損なうことなく放射線科における診断ツールの開発に寄与する可能性を持つことを示しています。
2025-02-25T20:08:29
Mind the Gap: Bridging the Divide Between AI Aspirations and the Reality of Autonomous Characterization
http://arxiv.org/abs/2502.18604v1
Grace Guinan, Addison Salvador, Michelle A. Smeaton, Andrew Glaws, Hilary Egan, Brian C. Wyatt, Babak Anasori, Kevin R. Fiedler, Matthew J. Olszta, Steven R. Spurgeon
National Renewable Energy Laboratory, University of Cincinnati, Purdue University, Pacific Northwest National Laboratory, Colorado School of Mines, University of Colorado Boulder
「人工知能の時代」における材料科学はどのようなものなのでしょうか?合成、特性評価、モデリングといった各材料分野は、この質問に対して異なる答えを持っており、それぞれ独自の課題や制約に動機づけられています。本研究は、電子顕微鏡における自律的特性評価の大きな可能性に焦点を当てています。私たちは、複雑な原子系を記述できる顕微鏡分析のためのドメイン認識型マルチモーダルモデルの開発における最近の進展を紹介します。次に、自律的顕微鏡観察の理論的な可能性と現在の実用的な制限との間にある重要なギャップに対処し、最近の成功事例を示しつつ、堅牢な実世界での自律性を実現するために必要な開発の重要性を強調します。
2025-02-25T19:43:47
Autonomous Vision-Guided Resection of Central Airway Obstruction
http://arxiv.org/abs/2502.18586v1
- Smith, N. Yilmaz, T. Watts, P. M. Scheikl, J. Ge, A. Deguet, A. Kuntz, A. Krieger
Johns Hopkins University, University of Utah
既存の気管腫瘍切除方法は、効果的な気道クリアランスに必要な精度が欠けていることが多く、ロボティクスの進歩は自律的な切除の新たな可能性を提供します。私たちは、気管腫瘍の緩和切除のための視覚誘導自律アプローチを提案します。このシステムは、ツールの軌道を計画するために気管表面を5次多項式でモデル化し、カスタムのFaster R-CNNセグメンテーションパイプラインが気管と腫瘍の境界を特定します。電気メスの工具角度は、手持ち手術デモンストレーションを使用して最適化され、気管表面から1mmの安全クリアランスを維持するように軌道が計画されます。私たちは、ex-vivo動物組織モデルで5回連続してワークフローを成功裏に検証し、すべてのケースで気管穿孔なしに気道障害を効果的に除去(90%以上の体積腫瘍除去)しました。これらの結果は、自律的な切除プラットフォームの実現可能性を支持し、最小侵襲自律切除の今後の開発への道を開きます。
2025-02-25T19:11:11
Scalable Best-of-N Selection for Large Language Models via Self-Certainty
http://arxiv.org/abs/2502.18581v1
Zhewei Kang, Xuandong Zhao, Dawn Song
Best-of-N選択は、大規模言語モデル(LLM)の推論性能を向上させるための重要な技術であり、テスト時間の計算を増やすことによって実現されます。現在の最先端の手法では、応答の評価と選択のために計算集約型の報酬モデルがよく使用されています。自己一貫性や普遍自己一貫性といった報酬のない代替手段は、オープンエンド生成タスクを扱う能力や効果的にスケールする能力に制限があります。これらの制限に対処するために、我々は自己確信という新しく効率的な指標を提案します。これは、外部報酬モデルを必要とせず、LLMの出力の固有の確率分布を利用して応答の質を推定します。我々は、複数のサンプルにわたる高い分布的自己確信が、生成された出力に対するより大きな自信を反映し、向上した応答の正確性と相関するという仮説を立てます。さまざまな推論タスクにおける広範な実験を通じて、自己確信が(1)サンプルサイズ$N$の増加に伴って効果的にスケールし、計算オーバーヘッドなしで報酬モデルに似た動作をすること、(2)思考の連鎖を補完し、貪欲デコーディングを超えて推論性能を向上させること、(3)従来の自己一貫性手法が不十分なオープンエンドタスクにも一般化できることを示します。我々の発見は、自己確信がLLMの推論能力を向上させるための実用的で効率的な方法であることを確立します。コードはhttps://github.com/backprop07/Self-Certaintyで入手可能です。
2025-02-25T19:08:07
Differentially Private Iterative Screening Rules for Linear Regression
http://arxiv.org/abs/2502.18578v1
Amol Khanna, Fred Lu, Edward Raff
Booz Allen Hamilton, University of Maryland, Baltimore County
線形の $L_1$ 正則化モデルは、データサイエンスにおいて最もシンプルで効果的なツールの一つとして残っています。この10年間で、$L_1$ モデルのスパース回帰重みを生成する際に特徴を排除する方法として、スクリーニングルールの人気が高まっています。しかし、データ分析のためのプライバシーを保護するモデルの必要性が高まっているにもかかわらず、私たちの知る限り、差分プライバシーを考慮したスクリーニングルールは存在しません。本論文では、線形回帰のための初めてのプライベートスクリーニングルールを開発します。我々は最初に、このスクリーニングルールが強すぎることを発見します。プライベートスクリーニングのステップの結果として、あまりにも多くの係数がスクリーニングされてしまいます。しかし、プライベートスクリーニングの弱化した実装は、過剰なスクリーニングを減少させ、パフォーマンスを向上させます。
2025-02-25T19:06:19
FactReasoner: A Probabilistic Approach to Long-Form Factuality Assessment for Large Language Models
http://arxiv.org/abs/2502.18573v1
Radu Marinescu, Debarun Bhattacharjya, Junkyu Lee, Tigran Tchrakian, Javier Carnerero Cano, Yufang Hou, Elizabeth Daly, Alessandra Pascale
IBM Research, IT:U - Interdisciplinary Transformation University Austria
大規模言語モデル(LLM)は、近年、生成タスクにおいて膨大な能力を示していますが、生成されたコンテンツの事実の正確性を保証することに苦労しています。これにより、事実上正確な応答が期待される現実的な状況において、これらのモデルは信頼性を欠くことになります。本論文では、長文生成応答の事実性を評価するために確率的推論に依存する新しい事実性評価器であるFactReasonerを提案します。具体的には、FactReasonerは応答を原子単位に分解し、それらに対して外部知識源から関連する文脈を取得し、原子と文脈に対応するテキスト発話間の論理関係(含意、矛盾)の確率的エンコーディングを使用して、原子と文脈の結合確率分布を構築します。その後、FactReasonerは応答の原子単位が取得した文脈に支持されているかどうかの事後確率を計算します。ラベル付きおよびラベルなしのベンチマークデータセットにおける我々の実験は、FactReasonerが事実の精度と再現率の両面で最先端のプロンプトベースのアプローチに比べて大幅に改善されることを明確に示しています。
2025-02-25T19:01:48
Scalable Equilibrium Sampling with Sequential Boltzmann Generators
http://arxiv.org/abs/2502.18462v1
Charlie B. Tan, Avishek Joey Bose, Chen Lin, Leon Klein, Michael M. Bronstein, Alexander Tong
熱力学的平衡における分子状態のスケーラブルなサンプリングは、統計物理学における長年の課題です。ボルツマン生成器は、この問題に取り組むために、強力なノーマライジングフローと重要サンプリングを組み合わせて、ターゲット分布の下で統計的に独立なサンプルを取得します。本論文では、ボルツマン生成器のフレームワークを拡張し、2つの重要な改良を持つ逐次ボルツマン生成器(SBG)を導入します。第一の改良は、すべての原子のカートesian座標に直接作用する非常に効率的なノンエクイバリアントトランスフォーマーベースのノーマライジングフローです。従来の方法のエクイバリアントな連続フローとは対照的に、サンプル生成と尤度計算の両方で非常に効率的な正確に可逆なノンエクイバリアントアーキテクチャを活用します。その結果、標準的な重要サンプリングを超えたより洗練された推論戦略を解放します。より具体的には、第二の重要な改良として、フローペ samplesの推論時スケーリングをアニーリング・ランジュバン動力学を用いて行い、ターゲット分布にサンプルを輸送して低い分散(アニーリングされた)重要重みを得ることで、逐次モンテカルロによる高忠実度の再サンプリングを可能にします。SBGは、分子システムに関してすべてのメトリックで最先端のパフォーマンスを達成し、これまでボルツマン生成器にとって扱えなかったトリペプチド、テトラペプチド、ヘキサペプチドのカートesian座標における平衡サンプリングを最初に実現しました。
2025-02-25T18:59:13
FRIDA to the Rescue! Analyzing Synthetic Data Effectiveness in Object-Based Common Sense Reasoning for Disaster Response
http://arxiv.org/abs/2502.18452v1
Mollie Shichman, Claire Bonial, Austin Blodgett, Taylor Hudson, Francis Ferraro, Rachel Rudinger
University of Maryland, College Park, Army Research Lab, Oak Ridge Associated Universities, University of Maryland, Baltimore County
大規模言語モデル(LLM)は、実質的な常識推論の潜在能力を持っています。しかし、これらの能力はしばしば大規模モデルでしか出現しません。このため、ローカルに実行できる小規模モデルは、特定の推論タスクに関してはあまり役立たず、能力も限られています。我々は、災害分野に特化して小規模LLMをファインチューニングし、これらの分野が複雑で頻度の低い物理的常識知識を含むために、問題空間の要件を満たします。私たちは、ドメインエキスパートと言語学者が協力して高品質のシードデータを作成し、それを使用してファインチューニング用の合成データを生成する概念、「フィールドレディインストラクションデコーディングエージェント(FRIDA)モデル」のパイプラインを導入します。合成生成のための130のシードインストラクション、25,000のインストラクションからなる合成データセット、一般的なオブジェクトの利便性および地震特有のオブジェクトの利便性に関連する119の評価インストラクションを作成しました。いくつかのLLaMaおよびMistralの指示調整モデルをファインチューニングした結果、FRIDAモデルはさまざまなサイズにおいてベースモデルを上回ることがわかりました。その後、どの種類の合成データが性能に最も影響を与えるかを理解するためのアブレーションスタディを実施し、物理的状態およびオブジェクト機能の常識知識のみをトレーニングすることで、すべてのデータでトレーニングされたFRIDAモデルを上回ることを見出しました。私たちは、FRIDAパイプラインが一般的な常識を習得する能力を持っているが、特定のドメイン知識のための情報検索を強化する必要があると結論付けました。
2025-02-25T18:51:06
Application of Attention Mechanism with Bidirectional Long Short-Term Memory (BiLSTM) and CNN for Human Conflict Detection using Computer Vision
http://arxiv.org/abs/2502.18555v1
Erick da Silva Farias, Eduardo Palhares Junior
人間の衝突を動画を通じて自動的に検出することは、コンピュータビジョンにおいて重要な領域であり、監視や公共の安全政策において大きな応用があります。しかし、公共データセットの不足や人間の相互作用の複雑さにより、このタスクは困難です。本研究では、注意機構、畳み込みニューラルネットワーク(CNN)、双方向LSTM(BiLSTM)を含む高度な深層学習技術の統合を調査し、動画内の暴力的な行動の検出を改善することを目指します。研究では、注意機構の使用が動画の最も関連性の高い部分に焦点を当てるのに役立ち、モデルの精度と堅牢性を向上させる方法を探ります。実験結果は、CNNとBiLSTMおよび注意機構の組み合わせが衝突監視に対して有望な解決策を提供し、さまざまな戦略の効果に関する洞察をもたらすことを示しています。この研究は、暴力的なイベントのリアルタイム検出においてより効率的に機能する自動監視システムの開発に新たな可能性を開きます。
2025-02-25T18:48:34
SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution
http://arxiv.org/abs/2502.18449v1
Yuxiang Wei, Olivier Duchenne, Jade Copet, Quentin Carbonneaux, Lingming Zhang, Daniel Fried, Gabriel Synnaeve, Rishabh Singh, Sida I. Wang
最近のDeepSeek-R1のリリースは、強化学習(RL)が大規模言語モデル(LLM)の一般的な推論能力を向上させるための巨大な可能性を示しました。DeepSeek-R1やその他の追随する研究は主に競技プログラミングや数学問題へのRLの適用に焦点を当てていますが、この論文では、実際のソフトウェア工学のためにRLベースのLLM推論をスケールアップする初めてのアプローチであるSWE-RLを紹介します。軽量なルールベースの報酬(例えば、真実値とLLM生成ソリューションとの類似スコア)を活用することで、SWE-RLはLLMが広範なオープンソースソフトウェア進化データから学ぶことで、開発者の推論プロセスやソリューションを自律的に再現することを可能にします。このデータは、ソフトウェアのライフサイクル全体を記録したもので、コードスナップショット、コード変更、および課題やプルリクエストなどのイベントが含まれています。Llama3に基づいて訓練された私たちの推論モデルであるLlama3-SWE-RL-70Bは、SWE-bench Verifiedで41.0%の解決率を達成しました。これは、実世界のGitHub課題の人間によって検証されたコレクションです。我々の知る限り、これは中規模(<100B)LLMとして報告された中で最良のパフォーマンスであり、GPT-4oのような主要な商用LLMとも比較可能です。驚くべきことに、Llama3-SWE-RLはソフトウェア進化データでのみRLを実行しているにもかかわらず、一般的な推論能力も持つようになりました。例えば、関数コーディング、ライブラリ使用、コード推論、数学、一般的な言語理解という五つの領域外タスクで改善された結果を示しますが、監督型ファインチューニングのベースラインは平均してパフォーマンスの低下を招きます。全体として、SWE-RLは膨大なソフトウェア工学データに基づく強化学習を通じて、LLMの推論能力を向上させる新たな方向性を切り開きます。
2025-02-25T18:45:04
Disambiguate First Parse Later: Generating Interpretations for Ambiguity Resolution in Semantic Parsing
http://arxiv.org/abs/2502.18448v1
Irina Saparina, Mirella Lapata
University of Edinburgh, Institute for Language, Cognition and Computation, School of Informatics
アンビギュイティと未特定項の扱いは、自然言語インターフェースにおいて重要な課題であり、特にテキストからSQLへのセマンティックパースのようなタスクにおいて顕著です。我々は、自然言語の解釈を用いてアンビギュイティを解消し、それを論理形式(例:SQLクエリ)にマッピングするモジュラーアプローチを提案します。大規模言語モデル(LLM)は明確な発話の解析には優れていますが、曖昧な発話に対しては強いバイアスを示し、通常は好ましい解釈のみを予測します。我々はこのバイアスを建設的に活用して、初期の好ましい曖昧さの解消セットを生成し、その後専門的な補完モデルを適用して欠落した解釈を特定し生成します。補完モデルを訓練するために、我々は異なる意味を検証するためにSQL実行を利用するアノテーション手法を導入します。我々のアプローチは解釈のカバレッジを向上させ、異なるアノテーションスタイル、データベース構造、アンビギュイティタイプのデータセットに対して一般化します。
2025-02-25T18:42:26
MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning
http://arxiv.org/abs/2502.18439v1
Chanwoo Park, Seungju Han, Xingzhi Guo, Asuman Ozdaglar, Kaiqing Zhang, Joo-Kyung Kim
複数の大規模言語モデル(LLM)を活用して協働型マルチエージェントワークフローを構築することは、重要な可能性を示しています。しかし、これまでの研究のほとんどは、従来のLLMの能力を利用することに焦点を当てており、LLMのパフォーマンスを向上させることにはつながらないことが最近の研究で示されています。本論文では、協働型LLMのための新しいポストトレーニングパラダイムMAPoRL(マルチエージェントポスト共同トレーニングと強化学習)を紹介し、協働的な行動を明示的に引き出し、マルチエージェント型LLMフレームワークの力をさらに引き出します。MAPoRLでは、最初に複数のLLMがそれぞれ独立して応答を生成し、マルチターンの議論に参加して最終的な回答を協力して改善します。最終的に、MAPoRLバリファイアは、回答と議論の両方を評価し、回答の正確性を検証するスコアを割り当て、修正的かつ説得力のある議論を促すインセンティブを追加します。このスコアは共同訓練の報酬として機能し、マルチエージェント強化学習を通じて最大化されます。既存のLLMポストトレーニングパラダイムとは異なり、MAPoRLは、より良い一般化を目的とした強化学習を用いて複数のLLMを共同でトレーニングすることを提唱します。分析的な洞察と共に、私たちの実験は、個別のLLMを単独でトレーニングすることでは効果的な協働を誘発するには不十分であることを示しています。それに対して、マルチエージェント共同トレーニングは、未見のドメインへの一般化を伴いながら、ベンチマーク全体で協力パフォーマンスを向上させることができます。
2025-02-25T18:33:48
ToMCAT: Theory-of-Mind for Cooperative Agents in Teams via Multiagent Diffusion Policies
http://arxiv.org/abs/2502.18438v1
Pedro Sequeira, Vidyasagar Sadhu, Melinda Gervasio
SRI International
この論文では、ToMCA(チームにおける協力エージェントのための心の理論)を紹介します。これは、心の理論(ToM)に基づいた軌跡を生成するための新しいフレームワークです。それは、仲間の基本的な目標と将来の行動に対してToM推論を行うメタ学習メカニズムと、エージェントの目標と仲間の特性の両方に条件付けられた計画を生成するマルチエージェントのデノイジング拡散モデルを組み合わせています。私たちは、以前に生成された計画と現在の世界の状態との間に乖離があることを検出するたびに、拡散モデルから新しい軌跡(再計画)を動的にサンプリングするオンライン計画システムを実装しました。シミュレートされた料理ドメインを使用して、ToMCAを用いたいくつかの実験を行いました。私たちの結果は、チームパフォーマンスを犠牲にすることなくリソースの使用を削減する上で、動的再計画メカニズムの重要性を浮き彫りにしています。また、エージェントがエピソードの過程で収集した世界や仲間の行動に関する最近の観察結果をToM推論と組み合わせることが、特に事前情報が提供されていない場合に、仲間への動的適応のためのチーム意識のある計画を生成するために重要であることも示しています。
2025-02-25T18:31:55
TextGames: Learning to Self-Play Text-Based Puzzle Games via Language Model Reasoning
http://arxiv.org/abs/2502.18431v1
Frederikus Hudi, Genta Indra Winata, Ruochen Zhang, Alham Fikri Aji
NAIST, Capital One, Brown University, MBZUAI
推論は、大規模言語モデル(LLM)の基本的な能力であり、これにより彼らは複雑な問題を理解し、分析し、解決することができます。本論文では、テキストベースのゲームを通じてLLMを評価するために特別に設計された革新的なベンチマーク「TextGames」を紹介します。これらのゲームは、パターン認識、空間認識、算数、論理的推論において高度なスキルを要求します。我々の分析は、LLMの単発推論と多発推論におけるパフォーマンス、および自己反省を通じてフィードバックを活用し、次の回答を修正する能力を調査します。我々の発見は、LLMがほとんどの簡単および中程度の問題に対処する能力を示す一方で、より困難なタスクには著しい課題を抱えていることを明らかにします。対照的に、人間は十分な時間が与えられればすべてのタスクを解決することができます。さらに、LLMは自己反省を通じて多発的な予測においてパフォーマンスが向上することが観察されますが、それでもシーケンシング、カウント、および複雑なルールを一貫して遵守することに苦労しています。また、推論に最適化されたモデルは、指示に従うことを優先する事前学習済みのLLMを上回り、高度に複雑な問題に対処する際の推論スキルの重要な役割を浮き彫りにしています。
2025-02-25T18:26:48
PyEvalAI: AI-assisted evaluation of Jupyter Notebooks for immediate personalized feedback
http://arxiv.org/abs/2502.18425v1
Nils Wandel, David Stotko, Alexander Schier, Reinhard Klein
STEMコースの学生の課題を評価することは、チューターにとって手間がかかり繰り返しの作業であり、クラス全体を評価するのに1週間を要することがよくあります。学生にとって、このフィードバックの遅延は不正解の解答を繰り返すことを妨げ、学習を妨害し、演習の得点が最終試験の入学を決定する際にストレスを増加させます。自動採点やチュータリングシステムなどのAI支援教育の最近の進展は、即時のフィードバックを提供し採点の負担を軽減することによって、これらの課題に対応することを目的としています。しかし、既存のソリューションはプライバシーに関する懸念、独自の閉じたソースモデルへの依存、Markdown、LaTeX、Pythonコードの統合へのサポートの欠如、または採点プロセスからコースのチューターを除外することにより、しばしば不十分です。これらの制限を克服するために、Jupyterノートブックを単体テストとローカルホストの言語モデルの組み合わせを用いて自動的に採点するAI支援評価システム「PyEvalAI」を紹介します。このアプローチは無料でオープンソースであり、チューターが採点プロセスの完全な制御を維持することを保証します。ケーススタディは、数値解析に関する大学レベルのコースの演習におけるフィードバックの迅速さと採点の効率を向上させるその効果を示しています。
2025-02-25T18:20:20
Applications of Statistical Field Theory in Deep Learning
http://arxiv.org/abs/2502.18553v1
Zohar Ringel, Noa Rubin, Edo Mor, Moritz Helias, Inbar Seroussi
ディープラーニングアルゴリズムは過去10年で驚くべき進展を遂げましたが、これらのアルゴリズムの複雑さにより、ディープラーニングの科学はまだ初期段階にあります。実験に基づく分野であるため、物理学の枠組みの中でディープラーニングの理論を探求するのは自然なことです。ディープラーニングは主に関数や関数の分布を学ぶことに関するものであるため、統計場理論は関数(場)に対する複雑な分布に取り組むための豊富で多用途なツールボックスとして明らかな正式な選択肢となります。過去数年間で行われた研究は、場理論が一般化や暗黙のバイアス、特徴学習効果に関する有用な洞察を提供する能力を示しています。ここでは、この新たな研究領域の教育的レビューを提供します。
2025-02-25T18:19:06
Comparative Analysis of MDL-VAE vs. Standard VAE on 202 Years of Gynecological Data
http://arxiv.org/abs/2502.18412v1
Paula Santos
この研究では、最小記述長 (MDL) 正則化を強化した変分オートエンコーダ (VAE) と、標準オートエンコーダを比較評価し、高次元の婦人科データの再構築における性能を示します。MDL-VAEは、効果的なKLダイバージェンス正則化によって、再構築誤差(MSE、MAE、RMSE)が著しく低く、より構造化された潜在表現を示します。統計分析により、これらの性能向上は有意であることが確認されました。さらに、MDL-VAEは一致した訓練損失と検証損失を示し、効率的な推論時間を達成しており、その頑健性と実用的な可能性を強調しています。我々の発見は、VAEアーキテクチャにMDL原則を組み込むことで、データの再構築と一般化を大幅に改善できることを示唆しており、医療データのモデリングと分析における高度な応用に対する有望なアプローチであることを示しています。
2025-02-25T18:05:46
TSKANMixer: Kolmogorov-Arnold Networks with MLP-Mixer Model for Time Series Forecasting
http://arxiv.org/abs/2502.18410v1
Young-Chae Hong, Bei Xiao, Yangho Chen
時系列予測は、経済、エネルギー、ヘルスケア、交通管理などの多様な分野において長い間研究の焦点となっています。最近の研究では、データ内の空間的および時間的依存関係を効果的に捉えることによって予測精度を向上させるために、多層パーセプトロン(MLP)を活用した時系列モデルの革新的なアーキテクチャ、タイムシリーズミキサー(TSMixer)が導入されました。本論文では、TSMixerをKAN層で修正したTSKANMixerを用いて、時系列予測におけるコルモゴロフ・アルノルドネットワーク(KAN)の能力を調査します。実験結果は、TSKANMixerが複数のデータセットにおいてオリジナルのTSMixerに対して予測精度を改善する傾向があり、他の時系列アプローチと比較してもトップパフォーマンスのモデルの中にランクインすることを示しています。私たちの結果は、KANが伝統的なMLPを置き換えたり拡張したりすることによって時系列予測のパフォーマンスを向上させる有望な代替手段であることを示しています。
2025-02-25T18:04:45
AgentRM: Enhancing Agent Generalization with Reward Modeling
http://arxiv.org/abs/2502.18407v1
Yu Xia, Jingru Fan, Weize Chen, Siyu Yan, Xin Cong, Zhong Zhang, Yaxi Lu, Yankai Lin, Zhiyuan Liu, Maosong Sun
Tsinghua University
既存のLLMベースのエージェントは、保持されたタスクに対して強力なパフォーマンスを達成しましたが、未確認のタスクへの一般化能力は乏しいままです。そのため、最近のいくつかの研究は、多様なタスクでポリシーモデルをファインチューニングすることに焦点を当て、一般化能力の向上を図っています。本研究では、報酬モデルをファインチューニングしてポリシーモデルをガイドする方が、ポリシーモデルを直接ファインチューニングするよりも堅牢であることを発見しました。この知見に基づいて、我々はEffective Test-Time Searchのためにポリシーモデルをガイドする一般化可能な報酬モデルであるAgentRMを提案します。報酬モデルを構築するための三つのアプローチ、すなわち明示的報酬モデリング、暗黙的報酬モデリング、そしてLLM-as-a-judgeを包括的に調査します。その後、AgentRMを用いてBest-of-Nサンプリングとステップレベルビームサーチを用いた回答生成をガイドします。エージェントタスク9種類の4つのタイプにおいて、AgentRMはベースポリシーモデルを平均して$8.8$ポイント強化し、トップ一般エージェントを$4.0$ポイント上回ります。さらに、AgentRMは弱いから強い一般化を示し、LLaMA-3-70Bポリシーモデルに対して$12.6$ ポイントの大きな改善をもたらします。特化能力についても、AgentRMはファインチューニングされたポリシーモデルを向上させ、3つの保持されたタスクにおいてトップ特化エージェントを$11.4$ポイント上回ることができます。さらに分析を行い、テスト時のスケーリングにおけるその効果を確認します。この分野の研究を促進するため、コードも公開予定です。
2025-02-25T17:58:02
The Gradient of Algebraic Model Counting
http://arxiv.org/abs/2502.18406v1
Jaron Maene, Luc De Raedt
代数モデルカウントは、半環を利用することによって論理式に関する多くの推論タスクを統一します。私たちは推論に焦点を当てるのではなく、特に統計的関係性AIや神経シンボリックAIにおける学習を考察します。これらは論理的、確率的、神経的な表現を組み合わせます。具体的には、代数モデルカウントの同じ半環の視点が学習にも適用されることを示します。これにより、勾配と逆伝播を異なる半環に一般化することによって、さまざまな学習アルゴリズムを統一することが可能になります。さらに、半環のキャンセルや順序特性を利用して、よりメモリ効率の良い逆伝播を実現できる方法を示します。これにより、確率論的論理モデルのための最先端の勾配ベースの最適化手法のいくつかの興味深い変種を得ることができます。また、トラクタブル回路における代数モデルカウントが、より効率的な二次最適化につながらない理由についても議論します。経験的に、私たちの代数逆伝播は、既存のアプローチに比べてかなりの速度向上を示します。
2025-02-25T17:57:55
How Far are LLMs from Real Search? A Comprehensive Study on Efficiency, Completeness, and Inherent Capabilities
http://arxiv.org/abs/2502.18387v2
Minhua Lin, Hui Liu, Xianfeng Tang, Jingying Zeng, Zhenwei Dai, Chen Luo, Zheng Li, Xiang Zhang, Qi He, Suhang Wang
The Pennsylvania State University, Amazon
探索は、さまざまな分野における問題解決において基本的な役割を果たしており、ほとんどの現実の意思決定問題は体系的な探索によって解決可能です。最近の探索と学習に関する議論からインスピレーションを得て、私たちは探索と大規模言語モデル(LLM)の補完的関係を三つの視点から体系的に探求します。まず、学習が探索の効率を向上させる方法を分析し、LLMを活用した効果的かつ効率的な探索のためのフレームワーク「学習を通じた探索(SeaL)」を提案します。次に、探索中の厳密な完全性を確保するために、SeaLをSeaL-Cにさらに拡張します。実世界の三つの計画タスクにおける評価は、SeaLが従来のアプローチと比較して、探索空間を99.1%まで削減しながら、ほぼ完璧な精度を達成することを示しています。最後に、LLMが実際の探索にどれほど近づいているかを調査し、独自に探索能力を発展させることができるかを探ります。私たちの分析は、現在のLLMが複雑な問題における効率的な探索に苦労する一方で、体系的な探索戦略を取り入れることで問題解決能力が大幅に向上することを明らかにします。これらの発見は、私たちのアプローチの有効性を裏付けるだけでなく、現実のアプリケーションのためにLLMの探索能力を向上させる必要性を強調します。
2025-02-25T17:30:40
EgoSim: An Egocentric Multi-view Simulator and Real Dataset for Body-worn Cameras during Motion and Activity
http://arxiv.org/abs/2502.18373v1
Dominik Hollidt, Paul Streli, Jiaxi Jiang, Yasaman Haghighi, Changlin Qian, Xintong Liu, Christian Holz
ETH Zürich
コンピュータビジョンにおける自己中心的タスクに関する研究は、主にフィッシュアイカメラや没入型ヘッドセット内蔵カメラなどの頭部装着型カメラに焦点を置いてきました。我々は、光学センサーの小型化が進むことで、さまざまな位置に多くの体装着デバイスにカメラが統合されるようになると主張します。これにより、コンピュータビジョンの確立されたタスクに新たな視点がもたらされ、人間の動作追跡、身体の姿勢推定、または行動認識などの重要な領域に利益をもたらすでしょう。特に典型的に隠される下半身においてです。 本論文では、EgoSimという新しい体装着カメラのシミュレーターを紹介します。これは、着用者の身体を跨いだ複数の視点から現実的な自己中心的レンダリングを生成します。EgoSimの重要な特徴は、運動アーティファクトをレンダリングするために実際のモーションキャプチャデータを使用することです。これは、腕や脚に装着されたカメラで特に目立ちます。また、我々はMultiEgoViewを導入します。これは、6台の体装着カメラからの自己中心的な映像と、いくつかの活動中の全身3D姿勢の真実データセットです:119時間のデータは、4つの高忠実度仮想環境でのAMASSモーションシーケンスから得られ、6台のGoProカメラを使用した13人の参加者からの5時間の現実世界モーションデータとXsensモーションキャプチャスーツからの3D身体姿勢の参照を拡張しています。我々は、EgoSimの効果を証明するために、エンドツーエンドのビデオ専用3D姿勢推定ネットワークを訓練しました。そのドメイギャップを分析し、我々のデータセットとシミュレーターが現実世界のデータに対する推論の訓練に大いに寄与することを示します。 EgoSimのコードとMultiEgoViewデータセット:https://siplab.org/projects/EgoSim
2025-02-25T17:11:14
MindMem: Multimodal for Predicting Advertisement Memorability Using LLMs and Deep Learning
http://arxiv.org/abs/2502.18371v1
Sepehr Asgarian, Qayam Jetha, Jouhyun Jeon
広告の競争市場において、成功は消費者、広告主、広告プラットフォーム間の複雑な相互作用を効果的にナビゲートし活用することにかかっています。これらの多面的な相互作用は、広告主に消費者行動のモデル化、ブランドの記憶に残る強化、広告コンテンツのカスタマイズのための戦略の最適化を強いるものです。これらの課題に対処するために、私たちはMindMemを提案します。これは広告の記憶に関するマルチモーダル予測モデルです。テキスト、視覚、聴覚データを統合することにより、MindMemは最先端のパフォーマンスを達成し、LAMBDAデータセットではスピアマンの相関係数0.631、Memento10Kデータセットでは0.731を記録し、既存の方法を常に上回っています。さらに、私たちの分析では、広告の記憶に影響を与える重要な要因として、ビデオのテンポ、シーンの複雑さ、感情的共鳴が特定されました。これを拡張して、私たちはMindMem-ReAd(MindMem駆動の再生成広告)を導入しました。これは大規模言語モデルに基づくシミュレーションを用いて、広告コンテンツと配置を最適化し、広告の記憶において最大74.12%の改善を実現します。私たちの結果は、広告における人工知能の変革の可能性を強調し、広告主にエンゲージメントを促進し、競争力を高め、急速に進化する市場での影響を最大化するための強力なツールを提供します。
2025-02-25T17:09:12
Which Contributions Deserve Credit? Perceptions of Attribution in Human-AI Co-Creation
http://arxiv.org/abs/2502.18357v1
Jessica He, Stephanie Houde, Justin D. Weisz
IBM Research
大規模言語モデルによって強化されたAIシステムは、執筆や編集のための有能なアシスタントとして機能することができます。これらのタスクにおいて、AIシステムは共同創造のパートナーとして、人間のパートナーと共に創造中の作品に新しい貢献を行います。このようなシナリオで生じる一つの疑問は、AIの貢献にどの程度クレジットを与えるべきかということです。私たちは、知識労働者の帰属に関する見解を調査するために、調査研究(N=155)を実施し、異なる貢献タイプ、量、イニシアチブに対して異なるレベルのクレジットが与えられることを発見しました。人間のパートナーと比較して、同等の貢献に対してAIが一貫して少ないクレジットを与えられるパターンが観察されました。参加者は、AIの関与を開示することが重要であると感じており、貢献の質、個人の価値観、技術的考慮事項など、さまざまな基準を用いて帰属判断を行いました。我々の結果は、共創の作品に対するAIの貢献にクレジットを与えるための新しいアプローチを促進し、情報を提供します。
2025-02-25T16:48:10
From Vision to Sound: Advancing Audio Anomaly Detection with Vision-Based Algorithms
http://arxiv.org/abs/2502.18328v1
Manuel Barusco, Francesco Borsatti, Davide Dalle Pezze, Francesco Paissan, Elisabetta Farella, Gian Antonio Susto
University of Padova, Fondazione Bruno Kessler
視覚異常検出(VAD)の最近の進展により、事前訓練された特徴抽出器によって生成されたエンベディングを利用する高度なアルゴリズムが導入されました。これらの進展に触発され、我々は音声ドメインにおけるこれらのアルゴリズムの適応を検討し、音声異常検出(AAD)の問題に取り組みます。既存のほとんどのAAD手法が主に異常サンプルを分類するのに対し、我々のアプローチはスペクトログラム内での異常の詳細な時間周波数的位置特定を導入し、説明性を大幅に向上させます。この能力により、異常が発生する場所と時間についてのより正確な理解が可能になり、結果がエンドユーザーにとってより実用的になります。我々は工業および環境ベンチマークにおいて我々のアプローチを評価し、音声信号の異常検出におけるVAD技術の効果を示します。さらに、局所的な異常特定を可能にすることで説明性を向上させ、音声異常検出システムをより解釈可能で実用的にします。
2025-02-25T16:22:42
GraphRank Pro+: Advancing Talent Analytics Through Knowledge Graphs and Sentiment-Enhanced Skill Profiling
http://arxiv.org/abs/2502.18315v1
Sirisha Velampalli, Chandrashekar Muniyappa
半構造化テキスト、例えば履歴書からの情報抽出は、多様なフォーマットスタイルや主観的なコンテンツの組織化のため、長らく課題となってきました。従来のソリューションは特定のユースケースに特化した専門的なロジックに依存しています。しかし、私たちは構造化グラフ、自然言語処理(NLP)、およびディープラーニングを利用した革新的なアプローチを提案します。複雑なロジックをグラフ構造に抽象化することにより、生データを包括的な知識グラフに変換します。この革新的なフレームワークは、正確な情報抽出と高度なクエリを可能にします。私たちはスキルの重みを割り当てる辞書を体系的に構築し、ニュアンスのある人材分析への道を開きます。私たちのシステムは求人募集者やカリキュラムデザイナーだけでなく、求職者にもターゲットを絞ったクエリベースのフィルタリングやランキング機能を提供し、力を与えます。
2025-02-25T16:07:40
What is the Alignment Objective of GRPO?
http://arxiv.org/abs/2502.18548v2
Milan Vojnovic, Se-Young Yun
London School of Economics, KAIST
このノートでは、DeepSeek-R1-ZeroやDeepSeekMathなどの高度な人工知能モデルのトレーニングに使用される強化学習手法であるGroupPolicy Optimisation(GRPO)アルゴリズムによって達成される選好の集約について検討します。GRPOアルゴリズムは、特定のコンテキストに対して出力のセットをサンプリングし、対応する報酬を観察し、これらの報酬値にシフトおよびスケール正規化を適用することで計算された報酬選好モデルを使用してポリシーをトレーニングします。加えて、基準ポリシーからの逸脱を抑制するためのペナルティ関数を組み込んでいます。私たちは、GRPOアルゴリズムの定常ポリシーを特徴づけるフレームワークを提示します。この分析は、選好の集約が、RLHFのような他のアプローチによって実装される標準的な対数プーリングとは根本的に異なることを明らかにします。選好の集約の正確な形は、報酬選好モデルの定義の仕方とペナルティ関数から生じるものであり、これが集約ポリシーと基準ポリシー間の逆カルバック・ライブラー(KL)ダイバージェンスに実質的に対応することを示します。興味深いことに、私たちはサイズ2のグループに対して、報酬選好モデルがペアワイズ比較の選好に対応することを示します。これはペアワイズ比較フィードバックに基づく他の整合性方法と似ています。私たちは、サイズ2のグループに対する二項質問の集約選好の明示的な特徴付けを提供し、大きなグループサイズの極限でも示します。これは、集約選好が正則化定数や質問応答の信頼マージンなどのパラメータに依存することについての洞察を提供します。最後に、GRPOアルゴリズムを修正して直接KLダイバージェンスをペナルティとして使用したり、スケール正規化なしで報酬を使用したりすることによって得られる選好の集約について考察します。
2025-02-25T15:56:56
Steganography Beyond Space-Time With Chain of Multimodal AI Agents
http://arxiv.org/abs/2502.18547v1
Ching-Chun Chang, Isao Echizen
Japan Society for the Promotion of Science, Japan Science and Technology Agency, National Institute of Informatics, University of Tokyo
ステガノグラフィーは、秘匿的な書き込みの技術および科学であり、サイバーセキュリティの領域に intertwined(絡み合った)さまざまな応用を持っています。人工知能が進化し続けるにつれて、そのリアルなコンテンツを合成する能力がサイバー犯罪者の手の中で脅威となることが現れ、彼らは真実を操作し、誤って伝えようとしています。そのような合成コンテンツは、ステガノグラフィーの目的のために行われる微妙な変更を上書きする非自明なリスクをもたらします。空間的および時間的ドメインの信号が予期しない上書きに対して脆弱である場合、一体何が不変であり得るのかを考える必要があります。本研究は、視聴覚メディアにおけるステガノグラフィーのパラダイムを提案します。ここでは、メッセージは空間的および時間的ドメインの両方を超えて隠されます。視聴覚コンテンツをカバーテキストに分解し、言語的ドメイン内にメッセージを埋め込み、その後、生成されたステゴテキストと共に聴覚および視覚のモダリティを同期させて視聴覚コンテンツを再構築するために、多モーダルエージェントのチェーンが開発されます。メッセージは、言語生成モデルの単語サンプリングプロセスを偏らせることによってエンコードされ、単語選択の確率分布を分析することによってデコードされます。メッセージ伝達の精度は、ゼロビットおよびマルチビット容量設定の下で評価されます。忠実度は、生体認証および意味的類似性の両方を通じて評価され、記録された顔と声のアイデンティティ、およびメディアを介して伝えられるコアアイデアを捉えます。秘密性は、カバーとステゴテキストの間の統計的比較を通じて検証されます。堅牢性は、視聴覚圧縮、顔の入れ替え、音声クローン、およびその組み合わせを含むさまざまなシナリオでテストされます。
2025-02-25T15:56:09
Smart and Efficient IoT-Based Irrigation System Design: Utilizing a Hybrid Agent-Based and System Dynamics Approach
http://arxiv.org/abs/2502.18298v1
Taha Ahmadi Pargo, Mohsen Akbarpour Shirazi, Dawud Fadai
降水量の減少や人口増加といった問題に関連して、水資源の不足は現代社会において最も深刻な問題の一つとなっています。その結果、乾燥および半乾燥地域の国々では、灌漑用の利用可能な水資源が不足しています。一方で、現代の技術を活用して灌漑を制御し、水の損失を減らすことも可能です。その中の一つの技術がモノのインターネット(IoT)です。しかし、灌漑制御システムにIoTを使用する可能性があるものの、そのようなシステムの設計には複雑さがあります。この問題を考慮すると、エージェント指向ソフトウェア工学(AOSE)手法を用いて、IoTベースのシステムのような複雑なサイバー物理システムを設計することが可能です。この研究では、土壌水分を適切な範囲で維持することによって水の損失を減少させるために、Prometheus AOSE手法に基づいてスマート灌漑システムが設計されました。設計されたシステムは、センサー、中央エージェント、および灌漑ノードで構成されています。これらのエージェントは、協力して土壌水分を望ましいレベルに維持するための定義されたルールに従います。システムシミュレーションのために、ハイブリッドなエージェントベースとシステムダイナミクスモデルが設計されました。このハイブリッドモデルでは、システムダイナミクスアプローチに基づいて土壌水分のダイナミクスがモデル化されました。提案されたモデルは、AnyLogicコンピュータシミュレーションソフトウェアで実装されました。シミュレーションモデルを利用して、灌漑ルールが検証されました。自動灌漑モードにおけるシステムの機能は、256回の分数因子計画に基づいてテストされ、土壌の特性などの重要な要因が総灌漑水量や総作業時間に及ぼす影響が分析されました。テストに基づいて、システムはすべてのテストでほぼ最適な水の量を一貫して灌漑しました。さらに、結果はシステムの運用時間を削減することによってシステムのエネルギー消費を最小化するためにも使用されました。
2025-02-25T15:34:38
Mixing Any Cocktail with Limited Ingredients: On the Structure of Payoff Sets in Multi-Objective MDPs and its Impact on Randomised Strategies
http://arxiv.org/abs/2502.18296v1
James C. A. Main, Mickael Randour
マルコフ決定過程における多次元ペイオフ関数を考慮し、与えられた期待ペイオフベクトルを達成できるかどうかを問います。一般に、純粋戦略(つまり、ランダム化に頼らない戦略)だけではこの問題を解決するには不十分です。私たちは、多次元ペイオフ関数が与えられた場合のすべての戦略の期待ペイオフベクトルの集合の構造を研究し、戦略のランダム化要件に関するその結果を考察します。特に、すべての戦略の下で期待値が定義される任意のペイオフについて、任意の精度まで任意の期待ペイオフベクトルを近似するためには、有限数の純粋戦略を混合することが十分であることを証明します。さらに、すべての戦略の下で期待ペイオフが有限である任意のペイオフに対しては、有限数の戦略を混合することによって、任意の期待ペイオフを正確に得ることができます。
2025-02-25T15:33:59
AMPO: Active Multi-Preference Optimization
http://arxiv.org/abs/2502.18293v1
Taneesh Gupta, Rahul Madhavan, Xuchao Zhang, Chetan Bansal, Saravan Rajmohan
マルチ・プラファレンス最適化は、ペアワイズの好みを超えて言語モデルの整合性を豊かにし、有益な応答と望ましくない応答の全セットを対比することによって、大規模言語モデルのためのより豊かなトレーニング信号を可能にします。セルフプレイ整合性の間、これらのモデルはしばしばクエリごとに多数の候補回答を生成し、それによりトレーニング目的にすべての応答を含めることが計算的に非現実的になります。この研究では、$\textit{アクティブマルチ・プラファレンス最適化}$(AMPO)という新しいアプローチを提案します。これは、オンポリシー生成、マルチ・プラファレンスグループコントラスト損失、及びアクティブなサブセット選択を組み合わせたものです。具体的には、大量の候補応答のプールをスコアリングし埋め込んだ後、報酬の端と異なる意味的クラスターをカバーする小さく、しかし有益なサブセットを選択してプラファレンス最適化を行います。我々のコントラストトレーニングスキームは、最良と最悪の回答だけでなく、強力な整合性にとって重要な微妙でまだ探求されていないモードを特定することができます。理論的には、我々のアクティブ選択手法を使用して期待報酬最大化の保証を提供し、実証的には、AMPOはLlama 8Bを使用した$\textit{AlpacaEval}$において最先端の結果を達成します。
2025-02-25T15:29:51
Citrus: Leveraging Expert Cognitive Pathways in a Medical Language Model for Advanced Medical Decision Support
http://arxiv.org/abs/2502.18274v2
Guoxin Wang, Minyu Gao, Shuai Yang, Ya Zhang, Lizhi He, Liang Huang, Hanlin Xiao, Yexuan Zhang, Wanyue Li, Lu Chen, Jintao Fei, Xin Li
大規模言語モデル(LLM)、特に推論能力を持つモデルは、近年急速に進化し、さまざまなアプリケーションにおいて重要な可能性を示しています。しかし、特に疾患推論タスクにおいて、その医療への展開は専門家レベルの認知データを取得するという課題によって制約されています。本論文では、臨床専門知識とAI推論のギャップを埋める医療用言語モデル「Citrus」を紹介します。このモデルは、医療専門家の認知プロセスを模倣することで設計されています。Citrusは、臨床医の意思決定経路を正確に捉える新しいアプローチを使用して合成された、大規模なシミュレートされた専門家の疾患推論データコーパスで訓練されています。このアプローチにより、Citrusは医療条件の診断や治療に関わる複雑な推論プロセスをより良く模擬することができます。公開されている医療推論タスク用データセットの不足に対処するために、私たちはカスタムビルドの医療診断対話データセットを含む最終段階の訓練データを公開します。このオープンソースの貢献は、この分野のさらなる研究と開発を支援することを目的としています。医療推論と自然言語理解に関するタスクをカバーする権威あるベンチマークであるMedQAを使用した評価により、Citrusは同様のサイズの他のモデルと比較して優れたパフォーマンスを達成していることが示されています。これらの結果は、Citrusが医療意思決定支援システムを大幅に向上させ、臨床意思決定のためのより正確で効率的なツールを提供する可能性を強調しています。
2025-02-25T15:05:12
PII-Bench: Evaluating Query-Aware Privacy Protection Systems
http://arxiv.org/abs/2502.18545v1
Hao Shen, Zhouhong Gu, Haokai Hong, Weili Han
Fudan University
大規模言語モデル(LLM)の広範な採用は、ユーザープロンプトにおける個人識別情報(PII)の露出に関する重要なプライバシーの懸念を引き起こしています。この課題に対処するために、我々はクエリに無関係なPIIマスキング戦略を提案し、プライバシー保護システムを評価するための初の包括的評価フレームワークであるPII-Benchを導入します。PII-Benchは、55の詳細なPIIカテゴリーにわたる2,842のテストサンプルを含み、単一の主題の記述から複雑な多者間の相互作用に至る多様なシナリオが特徴です。各サンプルは、ユーザーのクエリ、コンテキストの説明、およびクエリ関連のPIIを示す標準的な回答とともに注意深く作成されています。我々の実証的評価によれば、現在のモデルは基本的なPII検出においては適切に機能しますが、PIIのクエリ関連性を判断する点では著しい限界を示しています。最先端のLLMでさえこのタスクに苦しんでおり、特に複雑な多主題のシナリオの処理においては、知的なPIIマスキングを達成するためには大きな改善の余地があることを示しています。
2025-02-25T14:49:08
UASTrack: A Unified Adaptive Selection Framework with Modality-Customization in Single Object Tracking
http://arxiv.org/abs/2502.18220v1
He Wang, Tianyang Xu, Zhangyong Tang, Xiao-Jun Wu, Josef Kittler
Jiangnan University, University of Surrey
マルチモーダルトラッキングは、単一オブジェクトトラッキング(SOT)において不可欠です。異なるセンサータイプがオブジェクトの外観の変動によって引き起こされる課題を克服するために、特有の能力を提供します。しかし、既存の統一RGB-Xトラッカー(Xは深度、イベント、または熱感度を表す)は、個々のRGB-X画像ペアに対するタスク特有のトレーニング戦略に依存するか、実世界のアプリケーションにおけるモダリティ適応型知覚の重要性に対処することができていません。本研究では、UASTrackという統一適応選択フレームワークを提案し、モデルとパラメータの統一およびさまざまなマルチモーダルトラッキングタスクにわたる適応的なモダリティ識別を促進します。ジョイントRGB-Xペアにおいてモダリティ適応型知覚を実現するために、モダリティラベルを識別できる識別的オートセレクタ(DAS)を設計し、補助モダリティのデータ分布を区別できるようにします。さらに、潜在空間のさまざまなモダリティに合わせたタスクカスタマイズ最適化アダプタ(TCOA)も提案します。この戦略は、各モダリティの特性に基づいてノイズの冗長性を効果的にフィルタリングし、背景干渉を軽減します。RGB-T、RGB-E、RGB-DトラッキングシナリオをカバーするLasHeR、GTOT、RGBT234、VisEvent、DepthTrackを含む5つのベンチマークで実施された広範な比較により、我々の革新的なアプローチが1.87Mの追加トレーニングパラメータと1.95Gのflopsのみを導入することで比較可能な性能を達成することが示されました。コードはhttps://github.com/wanghe/UASTrackで入手可能です。
2025-02-25T14:04:31
FLARE: A Framework for Stellar Flare Forecasting using Stellar Physical Properties and Historical Records
http://arxiv.org/abs/2502.18218v1
Bingke Zhu, Xiaoxiao Wang, Minghui Jia, Yihan Tao, Xiao Kong, Ali Luo, Yingying Chen, Ming Tang, Jinqiao Wang
星間フレアイベントは天文学研究にとって重要な観測サンプルですが、記録されたフレアイベントは限られています。星間フレアの予測は、研究をサポートするための追加のフレアイベントサンプルを提供することができます。この可能性にもかかわらず、これまでに星間フレア予測のための専門的なモデルは提案されていません。本論文では、星間の物理的特性と歴史的フレア記録の両方がフレア予測タスクにとって貴重な入力であることを示す広範な実験的証拠を提示します。次に、FLARE(特徴エンセmblesを通じた光曲線ベースの天文学的記録の予測)を紹介します。これは、星間フレア予測のために特別に設計された初めての大規模モデルです。FLAREは、新しいソフトプロンプトモジュールと残差記録融合モジュールを通じて、星間の物理的特性と歴史的フレア記録を統合します。 公開されているケプラー光曲線データセットに対する我々の実験は、FLAREが他の方法と比較してすべての評価指標において優れた性能を達成することを示しています。最後に、包括的なケーススタディを通じて、我々のモデルの予測能力を検証します。
2025-02-25T14:03:15
LAG: LLM agents for Leaderboard Auto Generation on Demanding
http://arxiv.org/abs/2502.18209v1
Jian Wu, Jiayu Zhang, Dongyuan Li, Linyi Yang, Aoxiao Zhong, Renhe Jiang, Qingsong Wen, Yue Zhang
Institute of Science Tokyo, Peking University, University of Tokyo, University College London, AI Research Institute, Squirrel AI Learning, Westlake University
この論文では、リーダーボード自動生成(LAG)という新しい自動生成フレームワークを紹介します。このフレームワークは、人工知能(AI)などの急速に進化する分野における特定の研究テーマに関するリーダーボードの自動生成を目的としています。毎日更新される大量のAI論文に直面すると、研究者が各論文の提案手法、実験結果、および設定を追跡することが難しくなり、効率的な自動リーダーボード構築の必要性が生じます。大規模言語モデル(LLM)はこのプロセスの自動化において期待を寄せられていますが、複数文書の要約、リーダーボード生成、実験の公正比較などの課題は依然として探求の余地があります。LAGは、論文の収集、実験結果の抽出と統合、リーダーボードの生成、品質評価を含む体系的なアプローチを通じて、これらの課題を解決します。我々の貢献には、リーダーボード構築問題に対する包括的な解決策、信頼性のある評価方法、および高品質なリーダーボードを示す実験結果が含まれています。
2025-02-25T13:54:03
DenoMAE2.0: Improving Denoising Masked Autoencoders by Classifying Local Patches
http://arxiv.org/abs/2502.18202v1
Atik Faysal, Mohammad Rostami, Taha Boushine, Reihaneh Gh. Roshan, Huaxia Wang, Nikhil Muralidhar
私たちはDenoMAE2.0を紹介します。これは、強化されたノイズ除去マスク付きオートエンコーダーで、従来の再構築損失に加えてローカルパッチの分類目的を統合し、表現学習と堅牢性を向上させます。従来のマスク付きオートエンコーダー(MAE)が欠損した入力の再構築にのみ焦点を当てるのに対し、DenoMAE2.0はマスクされていないパッチの位置を意識した分類を導入し、モデルが全体の一貫性を維持しながら、細かいローカル特徴を捉えることができるようにします。この二重目的アプローチは、無線通信の半教師あり学習に特に有効であり、高いノイズレベルとデータ不足が重大な課題となります。私たちは、非常に低い条件から中程度の高い条件までの広範な信号対雑音比(SNR)にわたって、変調信号の分類に関する広範な実験を実施しました。私たちの結果は、DenoMAE2.0がその前身であるDeno-MAEや他のベースラインに対して、ノイズ除去品質と下流の分類精度の両方で優れていることを示しています。DenoMAE2.0は、私たちのデータセットに対してDenoMAEに対して1.1%の改善を達成し、無線MLベンチマークでの変調信号の星座図分類においてDenoMAEに対して11.83%、16.55%の有意な精度向上を達成しました。
2025-02-25T13:41:56
VesselSAM: Leveraging SAM for Aortic Vessel Segmentation with LoRA and Atrous Attention
http://arxiv.org/abs/2502.18185v1
Adnan Iltaf, Rayan Merghani Ahmed, Bin Li, Shoujun Zhou
Natural Science Foundation of Guangdong Province, Shenzhen Science and Technology Innovation Bureau, Shenzhen Medical Research Fund, Shenzhen Engineering Laboratory for Diagnosis & Treatment Key Technologies of Interventional Surgical Robots, Key Laboratory of Biomedical Imaging Science and System, CAS, University Chinese Academy of Sciences, Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, Alliance of International Science Organization, University Chinese Academy of Science
医療画像のセグメンテーションは、特に血管のような複雑な解剖学的構造において、臨床診断と治療計画において重要です。本研究では、胸部大動脈血管のセグメンテーションのために特別に設計された、Segmentation Anything Model(SAM)の改良版であるVesselSAMを提案します。VesselSAMは、Atrous AttentionとLow-Rank Adaptation(LoRA)を組み合わせた新しいモジュールであるAtrousLoRAを取り入れ、セグメンテーション性能を向上させています。Atrous Attentionは、モデルがマルチスケールの文脈情報をキャッチできるようにし、細かい局所の詳細と広いグローバルな文脈の両方を保持します。一方で、LoRAは、固定されたSAM画像エンコーダの効率的なファインチューニングを促進し、学習可能なパラメーターの数を減少させ、計算効率を確保します。私たちは、Aortic Vessel Tree(AVT)データセットとType-B Aortic Dissection(TBAD)データセットの2つの難易度の高いデータセットでVesselSAMを評価しました。VesselSAMは、複数の医療センターで93.50%、93.25%、93.02%、および93.26%のDSCスコアを達成し、最先端の性能を示しています。私たちの結果は、VesselSAMが高いセグメンテーション精度を提供し、既存の大規模モデルと比較して計算オーバーヘッドを大幅に削減できることを示しています。この開発は、臨床環境でのAIベースの大動脈血管セグメンテーションの向上への道を開きます。コードとモデルはhttps://github.com/Adnan-CAS/AtrousLoraで公開される予定です。
2025-02-25T13:26:06
ChatMotion: A Multimodal Multi-Agent for Human Motion Analysis
http://arxiv.org/abs/2502.18180v2
Lei Li, Sen Jia, Jianhao Wang, Zhaochong An, Jiaang Li, Jenq-Neng Hwang, Serge Belongie
マルチモーダル大規模言語モデル(MLLM)の進展により、人間の動きの理解が向上しました。しかしながら、これらのモデルは「指示のみ」の性質に制約されており、さまざまな分析視点へのインタラクティビティや適応性が欠けています。これらの課題に対処するために、私たちはChatMotionを提案します。ChatMotionは、人間の動作分析のためのマルチモーダル・マルチエージェントフレームワークです。ChatMotionは、ユーザーの意図を動的に解釈し、複雑なタスクをメタタスクに分解し、動作理解のための専門的な機能モジュールを活性化します。動作理解のために、MotionCoreなどの複数の専門モジュールを統合し、さまざまな視点から人間の動作を分析します。広範な実験により、ChatMotionの精度、適応性、ユーザーエンゲージメントが人間の動作理解において証明されています。
2025-02-25T13:12:55
Problem Solved? Information Extraction Design Space for Layout-Rich Documents using LLMs
http://arxiv.org/abs/2502.18179v1
Gaye Colakoglu, Gürkan Solmaz, Jonathan Fürst
Zurich University of Applied Sciences, NEC Laboratories Europe
この論文では、大規模言語モデル(LLM)を用いたレイアウト豊富な文書からの情報抽出(IE)の設計スペースを定義し探求します。LLMを用いたレイアウト認識型IEの三つの主要な課題は、1) データの構造化、2) モデルの活用、3) 出力の洗練です。我々の研究は、これらの主要な課題におけるサブプロブレム、例えば入力表現、チャンク化、プロンプト設定、およびLLMやマルチモーダルモデルの選択に深入りします。また、最新のレイアウト認識型IEテストスイートを通じて異なる設計選択の結果を検討し、最先端(SoA)モデルであるLayoutLMv3とベンチマークします。結果は、1要因毎の試行(OFAT)からの構成が、ベースラインモデルに対して14.1ポイントのF1スコアの向上を達成しほぼ最適な結果を得る一方で、完全な因子探索は約36倍のトークン使用量で僅かに高い15.1ポイントの向上しか得られないことを示しています。適切に構成された汎用LLMが専門モデルの性能に匹敵することを示し、コスト効果の高い代替手段を提供します。我々のテストスイートはhttps://github.com/gayecolakoglu/LayIE-LLMで無料で入手可能です。
2025-02-25T13:11:53
CLIPure: Purification in Latent Space via CLIP for Adversarially Robust Zero-Shot Classification
http://arxiv.org/abs/2502.18176v1
Mingkun Zhang, Keping Bi, Wei Chen, Jiafeng Guo, Xueqi Cheng
Chinese Academy of Sciences, University of Chinese Academy of Sciences
この論文では、敵対的に頑健なゼロショット画像分類器を構築することを目的としています。私たちの作業は、画像を「<クラス名>の写真」といったテキストプロンプトと一致させることによってゼロショット分類を行う、視覚と言語の事前学習されたエンコーダーモデルであるCLIPに基づいています。浄化は、特定の攻撃タイプに対する敵対的学習を必要とせず、予測される任意の攻撃に対処できるため、私たちが選んだ道です。次に、ノイズ除去の敵対的なサンプルの浄化プロセスと、無害なサンプルに摂動を加える攻撃プロセスの合同分布間のKLダイバージェンスとして浄化リスクを定式化します。これは双方向の確率微分方程式(SDE)を通じて行われます。導出された最終的な結果は、CLIPの多モーダル潜在空間における浄化を探求するインスピレーションを与えます。私たちは、CLIPureアプローチの2つのバリエーションを提案します:CLIPure-Diffは、DaLLE-2のDiffusionPriorモジュールを使って画像の潜在ベクトルの尤度をモデル化し(CLIPの潜在ベクトルの生成プロセスをモデル化)、CLIPure-Cosは、画像と「の写真」の埋め込みの間のコサイン類似度を使って尤度をモデル化します。私たちの知る限り、CLIPureは多モーダル潜在空間における最初の浄化方法であり、CLIPure-Cosは生成モデルに基づかない最初の浄化方法であり、防御効率を大幅に向上させます。CIFAR-10、ImageNet、および以前のCLIPベースの防御方法がゼロショット分類の堅牢性を評価するために使用した13のデータセットに関して広範な実験を行いました。結果は、CLIPureがSOTAの堅牢性を大幅に向上させることを示しています。例えば、CIFAR10での71.7%から91.1%への向上、ImageNetでの59.6%から72.6%への向上、そして以前のSOTAに対して13のデータセットでの平均堅牢性が108%の相対的改善を示しました。コードは、https://github.com/TMLResearchGroup-CAS/CLIPure で入手可能です。
2025-02-25T13:09:34
SECURA: Sigmoid-Enhanced CUR Decomposition with Uninterrupted Retention and Low-Rank Adaptation in Large Language Models
http://arxiv.org/abs/2502.18168v3
Yuxuan Zhang
Aberdeen Institute of Data Science and Artificial Intelligence, South China Normal University, University of Aberdeen
大規模言語モデル(LLM)の急速な発展に伴い、これらのモデルを完全にファインチューニング(FT)することは、高い計算要求のためにますます実用的でなくなっています。さらに、FTは破滅的な忘却を引き起こす可能性があります。これに対する代替手段として、Low-Rank Adaptation(LoRA)が提案されており、少数のパラメータのみをファインチューニングし、FTと同様の性能を達成しながら、リソース要件を大幅に削減します。しかし、LoRAはFTの設計を受け継いでいるため、破滅的な忘却の問題は残っています。これらの課題に対処するために、私たちはSECURA: Sigmoid-Enhanced CUR Decomposition LoRAを提案します。これは、破滅的な忘却を軽減しながらファインチューニングの性能を向上させる新しいパラメータ効率の良いファインチューニング(PEFT)のバリエーションです。私たちの方法は、新しい正規化技術であるSigNormを導入し、パラメータの保持と全体的な性能を強化します。
SECURAは、数学問題解決(GSM8K)、挑戦的な質問応答(CNNDM)、翻訳(NewsDE)、複雑な選択肢推論(LogiQA)など、さまざまなタスクで評価されました。実験結果は、SECURAが4つの選択肢問題(MCQ)タスクで平均3.59%のファインチューニング改善を達成し、Gemma2 2b、Qwen2 1.5b、Qwen 27b、Llama3 8b、Llama3.1 8bなどのモデルで5つの質問応答(QA)タスクで2.51%の改善を示したことを示しています。さらに、SECURAは優れた知識保持能力を示し、16の継続的学習テストにおいて基本的なLLM知識で70%以上の精度を維持しており、Experience Replay(ER)、Sequential Learning(SEQ)、EWC、I-LoRA、およびCUR-LoRAを上回っています。
2025-02-25T13:00:05
iTrash: Incentivized Token Rewards for Automated Sorting and Handling
http://arxiv.org/abs/2502.18161v1
Pablo Ortega, Eduardo Castelló Ferrer
IE University, MIT
ロボットシステム(RS)がより自律的になるにつれて、清掃、インフラストラクチャのメンテナンス、リソース管理などの作業を自動化するために、小さなスペースやオフィスでの使用が増えています。この論文では、私たちはiTrashを提案します。これは、小規模オフィススペースでリサイクル率を改善することを目的としたインテリジェントなゴミ箱です。そのために、5日間の実験を実施し、iTrashは従来のゴミ箱と比較して30%以上の効率向上を実現できることを発見しました。この研究から得られた結果は、iTrashを使用することでリサイクル率が向上するだけでなく、ユーザーの行動やゴミ箱の使用パターンなど、通常のゴミ箱では得られない貴重なデータも提供されることを示しています。この情報は、これらのスペース内でのいくつかの作業を予測および最適化するために使用できます。最後に、私たちは、Save-as-you-Throw(SAYT)モデルに従って、リサイクルに対する経済的インセンティブを作成するためにブロックチェーン技術を使用する可能性を探りました。
2025-02-25T12:46:45
Monitoring snow avalanches from SAR data with deep learning
http://arxiv.org/abs/2502.18157v1
Filippo Maria Bianchi, Jakob Grahn
UiT the Arctic University of Norway, NORCE
雪崩は人命やインフラに重大なリスクをもたらし、特に山岳地域ではそのリスクが高いため、効果的な監視が不可欠です。従来の監視方法であるフィールド観測は、アクセスの制限、気象条件、コストによって限界があります。衛星搭載合成開口レーダー(SAR)データは、あらゆる気象条件下や遠隔地でデータを取得できるため、大規模な雪崩検出のための重要なツールとなっています。しかし、従来の処理方法では雪崩の複雑さや変動性に対処するのが難しいです。この章では、SARデータから雪崩を検出しセグメンテーションするための深層学習の応用についてレビューします。初期の取り組みはSAR画像のバイナリ分類に重点を置いていましたが、最近の進展によってピクセルレベルのセグメンテーションが可能になり、より高い精度と空間分解能が提供されるようになりました。Sentinel-1のSARデータを使用したケーススタディは、雪崩のセグメンテーションにおける深層学習モデルの効果を示し、従来の方法に対して優れた結果を達成しました。また、この研究の拡張として、4,500枚以上の注釈付きSAR画像の拡大データセットで最新の最先端セグメンテーションアーキテクチャをテストした結果も示します。テストした中で最も優れた性能を発揮したモデルは、ノルウェー全土での大規模な雪崩検出に適用され、いくつかの冬季にわたる重要な空間的および時間的パターンを明らかにしました。
2025-02-25T12:41:08
Can LLMs Explain Themselves Counterfactually?
http://arxiv.org/abs/2502.18156v1
Zahra Dehghanighobadi, Asja Fischer, Muhammad Bilal Zafar
Ruhr University Bochum, UAR Research Center for Trustworthy Data Science and Security
説明は、MLモデルの動作についての洞察を得たり、ユーザーの信頼を調整したり、規制遵守を確保したりするための重要なツールです。この数年間、モデル説明を生成するための事後的手法が多数登場しており、その多くはモデルの勾配を計算したり、特別に設計された最適化問題を解いたりすることに関係しています。しかし、Large Language Model(LLM)の優れた推論能力により、自己説明、すなわちモデルにその出力を説明させることが、新たなパラダイムとして最近浮上しています。本研究では、自己生成された反実仮想説明(SCE)の特定のタイプの自己説明を調査します。SCEを生成するLLMの有効性を測定するためのテストを設計します。さまざまなLLMファミリー、モデルサイズ、温度設定、データセットにわたる分析により、LLMがSCEを生成するのに苦労することがあることが明らかになりました。たとえ生成できたとしても、その予測はしばしば自らの反実仮想的推論と一致しないことが多いです。
2025-02-25T12:40:41
SASSHA: Sharpness-aware Adaptive Second-order Optimization with Stable Hessian Approximation
http://arxiv.org/abs/2502.18153v1
Dahun Shin, Dongyeop Lee, Jinseok Chung, Namhoon Lee
近似2次最適化手法は、1次アプローチに比べて一般化性能が悪いことがよくあります。本研究では、損失ランドスケープの観点からこの問題を探求し、既存の2次手法はSGDに比べて鋭い最小値に収束する傾向があることを発見しました。それに応じて、解の鋭さを明示的に減少させることで一般化を強化するよう設計された新しい2次手法「Sassha」を提案します。この手法は、最適化過程に沿った近似ヘッセ行列の計算を安定させることも考慮されています。実際、この鋭さ最小化スキームは、フラットさに加えて効率を確保するために怠惰なヘッセ行列の更新にも対応できるように工夫されています。その効果を検証するために、Sasshaが他の手法と同等かつ多くの場合、それを上回る優れた一般化性能を示す標準的な深層学習実験を広範に実施しました。また、収束性、頑健性、安定性、効率、およびコストを含む包括的な分析セットを提供します。
2025-02-25T12:35:05
A Real-time Spatio-Temporal Trajectory Planner for Autonomous Vehicles with Semantic Graph Optimization
http://arxiv.org/abs/2502.18151v1
Shan He, Yalong Ma, Tao Song, Yongzhi Jiang, Xinkai Wu
自律走行車両のための安全で実現可能な軌道を、複雑な都市環境においてリアルタイムで計画することは困難です。本論文では、グラフ最適化に基づく時空間軌道計画手法を提案します。この手法は、静的および動的障害物の分離処理を通じて意味的時空間マップを構築し、知覚モジュールの多モーダル情報を効率的に抽出します。さらに、意味的時空間ハイパーグラフに基づくスパースグラフ最適化を通じて迅速に実現可能な軌道を生成します。広範な実験により、提案手法が複雑な都市の公共道路シナリオに効果的に対応し、リアルタイムで動作することが証明されています。また、研究コミュニティに向けたベンチマーク用のコードも公開する予定です。
2025-02-25T12:27:06
Jacobian Sparse Autoencoders: Sparsify Computations, Not Just Activations
http://arxiv.org/abs/2502.18147v1
Lucy Farnik, Tim Lawson, Conor Houghton, Laurence Aitchison
スパースオートエンコーダー(SAEs)は、LLMの潜在的な活性化のスパースで人間に解釈可能な表現を発見するために成功裏に利用されています。しかし、我々は最終的にはLLMが行う計算を理解したいと考えており、単にその表現だけではありません。SAEsが計算を理解する手助けをどの程度できるかは不明です。なぜなら、SAEsは潜在的な活性化をスパースにするために設計されているだけで、計算をスパースにするためのものではないからです。この問題を解決するために、我々はヤコビアンスパースオートエンコーダー(JSAEs)を提案します。これにより、特定のモデルコンポーネントの入力および出力活性化においてだけでなく、これらを結ぶ計算(形式的にはヤコビアン)にもスパース性が得られます。素朴な実装では、LLMのヤコビアンはそのサイズのために計算上扱いきれないものになります。したがって、我々の重要な技術的貢献の一つは、このセットアップでヤコビアンを効率的に計算する方法を見つけることです。我々は、JSAEsが比較的大きな程度の計算スパース性を抽出し、従来のSAEsとほぼ同等の方法で下流のLLM性能を保持することができることを発見しました。また、JSAE基底で書き直すとMLPは概ね線形になるため、ヤコビアンは計算スパース性の合理的な代替となることも示しました。最後に、JSAEsが同等のランダム化されたLLMよりも事前訓練されたLLMでより高い計算スパース性を達成することを示します。これは、計算グラフのスパース性がLLMが訓練を通じて学ぶ特性であることを示しており、JSAEsが標準的なSAEsよりも学習されたトランスフォーマー計算を理解するためにより適している可能性を示唆しています。
2025-02-25T12:21:45
Large Language Model Driven Agents for Simulating Echo Chamber Formation
http://arxiv.org/abs/2502.18138v1
Chenhao Gu, Ling Luo, Zainab Razia Zaidi, Shanika Karunasekera
ソーシャルメディアプラットフォームにおけるエコーチャンバーの増加は、極化や既存の信念の強化に対する懸念を高めています。エコーチャンバーの形成をシミュレーションするための従来のアプローチは、よく定義されたルールや数値シミュレーションに依存しており、それは洞察に満ちていますが、複雑な現実の相互作用を捉えるために必要なニュアンスを欠いている可能性があります。本論文では、ソーシャルネットワーク内でのエコーチャンバーのダイナミクスをシミュレーションするために、大規模言語モデル(LLM)を生成エージェントとして活用する新しいフレームワークを提示します。我々のアプローチの新規性は、意見の更新とLLMに駆動されたネットワークの再配線の両方を組み込んでおり、文脈に配慮した豊かな意味を持つソーシャルインタラクションのシミュレーションを可能にします。また、実際のTwitter(現在はX)データを利用して、LLMに基づくシミュレーションを実際のソーシャルメディアの行動と比較し、生成された意見の傾向の正確性と現実性についての洞察を提供します。我々の結果は、意見のクラスタリングの構造的および意味的次元の両方を捉え、エコーチャンバー形成のモデリングにおけるLLMの有効性を示しています。この研究は、社会的影響力のダイナミクスをより深く理解することに寄与し、オンラインコミュニティにおける極化を研究するための新しいツールを提供します。
2025-02-25T12:05:11
SpargeAttn: Accurate Sparse Attention Accelerating Any Model Inference
http://arxiv.org/abs/2502.18137v1
Jintao Zhang, Chendong Xiang, Haofeng Huang, Jia Wei, Haocheng Xi, Jun Zhu, Jianfei Chen
大規模モデルにおいては、その二次時間計算量のために効率的なアテンションの実装が不可欠です。幸いなことに、アテンションは一般にスパース(疎)性を示し、すなわちアテンションマップの多くの値がゼロに近いため、対応する計算を省略することができます。多くの研究がこのスパースパターンを利用してアテンションの加速を図っています。しかし、既存の多くの研究は、特定のモデル内でアテンションマップの特定のスパースパターンを利用して最適化することに焦点を当てています。さまざまなモデルのスピードアップとエンドツーエンドのパフォーマンスを保証する普遍的なスパースアテンションは依然として実現されていません。本論文では、任意のモデルのための普遍的なスパースかつ量子化されたアテンションであるSpargeAttnを提案します。我々の方法は、二段階のオンラインフィルタを使用します。第一段階では、アテンションマップを迅速かつ正確に予測し、一部のアテンションにおける行列の掛け算を省略できるようにします。第二段階では、余分なオーバーヘッドを伴わず、さらなる行列の掛け算を省略するオンラインのソフトマックス対応フィルタを設計します。実験結果は、我々の方法が言語、画像、およびビデオ生成を含むさまざまなモデルを顕著に加速させ、エンドツーエンドの指標を犠牲にすることなく実現できることを示しています。コードはhttps://github.com/thu-ml/SpargeAttnで入手可能です。
2025-02-25T12:02:17
EU-Nets: Enhanced, Explainable and Parsimonious U-Nets
http://arxiv.org/abs/2502.18122v1
- Sun, P. Liò
この研究では、任意のU-Netアーキテクチャに適応可能なフレームワークMHEX+を提案します。MHEX+に基づき、従来のU-Netモデルの限界を克服し、パフォーマンスと安定性を向上させる新しいU-NetのバリアントであるEU-Netsを紹介します。重要な革新は、連続する畳み込み層を統合し、解釈可能性を高める「等価畳み込みカーネル」です。不確実性の推定に関しては、デコーダ層間での勾配の一貫性を測定する「コラボレーショングラデイント手法」を提案します。特筆すべきは、EU-Netsが実験でのすべてのネットワークおよびデータセットにおいて、平均精度を1.389%向上させ、分散を0.83%削減し、0.1M未満のパラメータで実行できることです。
2025-02-25T11:44:30
Bayesian Optimization for Controlled Image Editing via LLMs
http://arxiv.org/abs/2502.18116v2
Chengkun Cai, Haoliang Liu, Xu Zhao, Zhongyu Jiang, Tianfang Zhang, Zongkai Wu, Jenq-Neng Hwang, Serge Belongie, Lei Li
University of Edinburgh, University of Manchester, Tsinghua University, FancyTech, University of Washington, University of Copenhagen
急速に進化する画像生成の分野において、生成されたコンテンツに対する正確な制御を達成し、意味的整合性を維持することは、特にグラウンディング技術やモデルのファインチューニングの必要性に関して重要な制約として残っています。これらの課題に対処するために、我々はBayesGenieを提案します。これは、ベイズ最適化と大規模言語モデル(LLM)を統合したオフ・ザ・シェルフのアプローチで、正確でユーザーフレンドリーな画像編集を促進します。我々の方法により、ユーザーは手動で領域をマークすることなく自然言語の説明を通じて画像を修正でき、元の画像の意味的整合性を保つことができます。広範な事前トレーニングやファインチューニングを必要とする既存の技術とは異なり、我々のアプローチはモデルに依存しない設計によってさまざまなLLMに対して驚異的な適応性を示します。BayesGenieは、推論プロセスのパラメータを自動的に洗練させるために適応したベイズ最適化戦略を使用し、最小限のユーザー介入で高精度の画像編集を実現します。さまざまなシナリオにおける広範な実験を通じて、我々のフレームワークは、Claude3やGPT-4を含む異なるLLMを用いて検証された既存の方法に対して、編集の精度と意味的保存の両面で大幅に優れていることを示します。
2025-02-25T11:41:33
The Built-In Robustness of Decentralized Federated Averaging to Bad Data
http://arxiv.org/abs/2502.18097v1
Samuele Sabella, Chiara Boldrini, Lorenzo Valerio, Andrea Passarella, Marco Conti
Istituto di Informatica e Telematica, Consiglio Nazionale delle Ricerche
分散型連合学習(DFL)は、中央管理者に依存せずに、複雑なネットワークトポロジー上でデバイスが協力してモデルをトレーニングすることを可能にします。この環境では、ローカルデータはプライベートなままですが、その質と量はノード間で大きく異なる可能性があります。完全に分散型のシステムが低品質または破損したデータに対してどの程度脆弱であるかは明らかではありませんが、いくつかの要因が潜在的なリスクに寄与する可能性があります。中央の権限がないため、エラーを検出または修正するための統一されたメカニズムは存在せず、各ノードはデータ分布の局所的な視点で動作するため、その視点が真の分布に合致しているかどうかを評価することが難しくなります。さらに、低品質のデータでトレーニングされたモデルはネットワークを通じて伝播し、エラーを増幅させる可能性があります。低品質のデータがDFLに与える影響を探るために、データ品質が劣化した2つのシナリオを模擬実験します。1つは破損したデータが一部のノードに均等に分布している場合、もう1つはそれが単一のノードに集中している場合です。これを分散型のFedAvg実装を使用して行います。我々の結果は、平均化に基づく分散型学習が局所的な悪データに対して著しく堅牢であることを示しており、破損したデータがネットワークの最も影響力のあるノードに存在する場合でも同様です。直感に反して、破損したデータが単一のノードに集中している場合、この堅牢性は通信ネットワークトポロジーにおけるその中心性にかかわらずさらに強化されます。この現象は、平均化プロセスによって説明されます。このプロセスは、どのノードも(中心的であっても)全体の学習プロセスに過剰に影響を与えないようにします。
2025-02-25T11:06:51
Towards Thinking-Optimal Scaling of Test-Time Compute for LLM Reasoning
http://arxiv.org/abs/2502.18080v1
Wenkai Yang, Shuming Ma, Yankai Lin, Furu Wei
Renmin University of China, Microsoft Research
最近の研究では、モデルがより長い思考の連鎖(CoT)を通じて思考するのに多くの時間を費やすことで、複雑な推論タスクにおいて重要な改善を得られることが示されています。現在の研究は、大規模言語モデル(LLM)のCoTの長さを延ばすことでテスト時の計算を増やす利点を探求し続けていますが、テスト時のスケーリングの現在の追求の背後に潜む潜在的な問題について懸念しています。すなわち、CoTの長さを過度に拡大すると、モデルの推論性能に逆効果をもたらす可能性があるのでしょうか。数学的推論タスクに関する我々の探索は、長いCoTでスケーリングすることが特定の領域においてLLMの推論性能を確かに損なうことがあるという予期しない発見を明らかにしました。さらに、異なる領域ごとに異なる最適なスケール長分布が存在することを発見しました。これらの洞察に基づいて、我々は思考最適スケーリング戦略を提案します。我々の方法は、まず、異なる応答長分布を持つ小さなシードデータセットを使用してモデルに深い思考のための異なる推論努力を採用させます。その後、モデルは追加の問題に対して異なる推論努力の下で最も短い正しい応答を選択して自己改善を図ります。我々のQwen2.5-32B-Instructを基にした自己改善モデルは、さまざまな数学ベンチマークにおいて他の蒸留に基づいた32B o1類似モデルを上回り、QwQ-32B-Previewと同等の性能を達成しました。
2025-02-25T10:48:05
MRBTP: Efficient Multi-Robot Behavior Tree Planning and Collaboration
http://arxiv.org/abs/2502.18072v1
Yishuai Cai, Xinglin Chen, Zhongxuan Cai, Yunxin Mao, Minglong Li, Wenjing Yang, Ji Wang
マルチロボットのタスク計画と協働は、ロボティクスにおける重要な課題です。行動ツリー(BT)は、一つのロボットのための人気のある制御アーキテクチャとして確立されており、計画可能ですが、多様なアクションスペースを調整する複雑さのために、効果的なマルチロボットBT計画アルゴリズムの開発は依然として困難です。そこで、我々はマルチロボット行動ツリー計画(MRBTP)アルゴリズムを提案します。このアルゴリズムは、健全性と完全性の理論的保証を持っています。MRBTPは、異なるBT間で異種のアクションを調整するためにクロスツリー拡張機能を備えており、チームの目標を達成します。同質のアクションに対しては、BT間でバックアップ構造を維持し、堅牢性を確保し、意図の共有を通じて冗長な実行を防ぎます。MRBTPは同質および異質のロボットチームのためのBTを生成することができますが、その効率はさらに改善可能です。次に、各ロボットの目標関連アクションを推論するために、大規模言語モデル(LLM)が利用可能な場合にMRBTPのためのオプションのプラグインを提案します。これらの関連アクションは、長期的なサブツリーを形成するために事前に計画することができ、MRBTPの計画速度と協力効率を大幅に向上させます。私たちは、倉庫管理や日常サービスのシナリオにおいてこのアルゴリズムを評価しました。結果は、さまざまな設定におけるMRBTPの堅牢性と実行効率、ならびに事前に学習されたLLMがMRBTPのために効果的なタスク特定のサブツリーを生成する能力を示しています。
2025-02-25T10:39:28
HEROS-GAN: Honed-Energy Regularized and Optimal Supervised GAN for Enhancing Accuracy and Range of Low-Cost Accelerometers
http://arxiv.org/abs/2502.18064v1
Yifeng Wang, Yi Zhao
低コストの加速度計は、その小型化、統合の容易さ、ウェアラブル性、大量生産の利点から、現代社会において重要な役割を果たしています。そのため、自動車システム、航空宇宙、ウェアラブル技術など、幅広い分野で応用されています。しかし、この広く使用されているセンサーは、精度と範囲に関して深刻な制限に悩まされています。これを解決するために、低コストのセンサー信号を高コストの同等品に変換する「磨かれたエネルギー正則化と最適な監視GAN(HEROS-GAN)」を提案します。これにより、低コストの加速度計の精度と範囲の制限を克服します。トレーニングのためのフレームレベルのペアリングされた低コストと高コストの信号が不足しているため、最適輸送理論を活用して非ペアデータ間の潜在的一貫性を探求し、監視情報を最大化する「最適輸送監視(OTS)」を提案します。さらに、生成器に適切なエネルギーを注入して範囲の制限を突破し、局所的な変化を強化し、信号の詳細を豊かにする「調整されたラプラスエネルギー(MLE)」を提案します。専用のデータセットが存在しないため、加速度計の精度と範囲を改善するための最初のデータセットとなる「低コスト加速度計信号強化データセット(LASED)」を設立し、数万のサンプルを含んでいます。このデータセットはGitHubで公開されています。実験結果は、OTSまたはMLEのいずれかと組み合わせたGANが以前の信号強化の最先端技術(SOTA)を桁違いに上回ることを示しています。OTSとMLEの両方を統合したHEROS-GANは、加速度計の範囲を倍増させつつ、信号ノイズを100倍減少させるという顕著な結果を達成し、加速度計信号処理のベンチマークを確立しました。
2025-02-25T10:31:01
Defining bias in AI-systems: Biased models are fair models
http://arxiv.org/abs/2502.18060v1
Chiara Lindloff, Ingo Siegert
Otto von Guericke University Magdeburg
AIシステムにおけるバイアスに関する議論は、アルゴリズムの公平性に関する議論の中心です。しかし、バイアスという用語は明確な定義を欠くことが多く、公平性と対比されることが一般的ですが、バイアスのないモデルは本質的に公平であるという暗示があります。本稿では、この前提に挑戦し、公平性の懸念に効果的に対処するためにはバイアスの正確な概念化が必要であると主張します。バイアスを本質的にネガティブまたは不公平なものと見なすのではなく、バイアスと差別を区別することの重要性を強調します。さらに、この焦点の移行がAIシステムにおける公平性に関する学術的議論の中で、より建設的なディスコースを促進する方法について探求します。
2025-02-25T10:28:16
VLM-E2E: Enhancing End-to-End Autonomous Driving with Multimodal Driver Attention Fusion
http://arxiv.org/abs/2502.18042v1
Pei Liu, Haipeng Liu, Haichao Liu, Xin Liu, Jinxin Ni, Jun Ma
The Hong Kong University of Science and Technology, Li Auto Inc., Xiamen University
人間のドライバーは、豊富な注意意味論を利用して複雑なシナリオを巧みにナビゲートしますが、現在の自動運転システムは、この能力を再現するのに苦労しており、2Dの観察を3D空間に変換する際に重要な意味情報をしばしば失ってしまいます。この意味で、ダイナミックで複雑な環境における効果的な展開の妨げとなっています。私たちは、ビジョン・ランゲージモデル(VLM)の優れたシーン理解と推論能力を活用し、注意キューを提供することで訓練を強化する新しいフレームワークVLM-E2Eを提案します。我々の手法は、テキスト表現をバードアイビュー(BEV)特徴に統合し、意味的監督を可能にすることで、モデルがドライバーの注意意味論を明示的に捉えたリッチな特徴表現を学習できるようにします。注意意味論に焦点を当てることで、VLM-E2Eは人間の運転行動によりよく適合し、ダイナミックで複雑な環境でナビゲートするためには重要です。さらに、複数のモダリティ情報を融合する際のモダリティ重要性の不均衡な問題に対処するために、BEV-Textの学習可能な重み付け融合戦略を導入します。このアプローチは、BEVとテキスト特徴の貢献を動的にバランスさせ、視覚とテキストモダリティからの補完的情報が効果的に利用されることを保証します。マルチモーダル融合の不均衡に明示的に対処することで、我々の手法は運転環境のよりホリスティックでロバストな表現を促進します。VLM-E2EをnuScenesデータセットで評価し、最先端のアプローチに対する優位性を実証し、性能の大幅な改善を示します。
2025-02-25T10:02:12
AutoCas: Autoregressive Cascade Predictor in Social Networks via Large Language Models
http://arxiv.org/abs/2502.18040v1
Yuhao Zheng, Chenghua Gong, Rui Sun, Juyuan Zhang, Liming Pan, Linyuan Lv
University of Science and Technology of China, East China Normal University, Hefei University of Technology
情報カスケードにおける人気予測は、社会計算において重要な役割を果たしており、ウイルスマーケティング、誤情報の制御、およびコンテンツ推薦など広範な応用があります。しかし、情報拡散メカニズム、ユーザー行動、および時間的な活動パターンは、著しい多様性を示すため、そのような変動に適応できる基盤モデルが必要です。同時に、利用可能なカスケードデータの量は、大規模言語モデル(LLM)のトレーニングに使用される膨大なデータセットと比較して比較的限られています。最近の研究では、異なる時間系列ドメイン間の共通点を利用することによって、時間系列予測のためにLLMを活用することが可能であることが示されました。この洞察に基づいて、私たちはカスケード人気予測専用に設計されたLLM強化モデルである自己回帰情報カスケード予測器(AutoCas)を紹介します。自然言語シーケンスとは異なり、カスケードデータは複雑なローカルトポロジー、拡散コンテキスト、および進化するダイナミクスによって特徴づけられ、効果的なLLM統合のための専門的な適応が要求されます。これらの課題に対処するために、まずカスケードデータをトークン化してシーケンスモデリングの原則に合わせます。次に、カスケード拡散を自己回帰モデル化タスクとして再定式化することで、LLMのアーキテクチャの強みを最大限に活用します。従来のアプローチを超えて、LLMとカスケード予測の相乗効果を高めるためにプロンプト学習を導入します。広範な実験により、AutoCasはカスケード人気予測においてベースラインモデルを大幅に上回る性能を示し、LLMから引き継いだスケーリング特性を展示します。コードは以下のリポジトリで利用可能です:https://anonymous.4open.science/r/AutoCas-85C6
2025-02-25T09:54:33
ExPath: Towards Explaining Targeted Pathways for Biological Knowledge Bases
http://arxiv.org/abs/2502.18026v1
Rikuto Kotoge, Ziwei Yang, Zheng Chen, Yushun Dong, Yasuko Matsubara, Jimeng Sun, Yasushi Sakurai
SANKEN, Osaka University, Kyoto University, Florida State University, University of Illinois Urbana-Champaign
生物知識ベースは、分子相互作用の観点から、細胞や生物の系統的な機能経路を提供します。しかし、特に湿潤実験データを取り入れた際に、より特定の経路を認識することは依然として課題であり、通常は下流の生物学的分析と専門知識を必要とします。本論文では、この課題を解決可能なグラフ学習と説明のタスクとして位置づけ、新しい経路推定フレームワークであるExPathを提案します。このフレームワークは、実験データ、具体的にはアミノ酸配列(AA-seq)を明示的に統合して、生物データベース内のさまざまなグラフ(生物ネットワーク)を分類します。分類により重要な寄与をするリンク(経路を表す)は、特定の経路として考えられます。技術的には、ExPathは次の3つのコンポーネントで構成されています:(1)AA-seqをグラフにエンコードおよび埋め込む大規模なタンパク質言語モデル(pLM)、従来のBLASTなどのAA-seqデータ処理における障害を克服します;(2)グラフニューラルネットワーク(GNN)と状態空間系列モデリング(Mamba)を組み合わせたハイブリッドアーキテクチャであるPathMambaは、局所相互作用と全体の経路レベルの依存関係の両方を捉えます;そして(3)PathExplainerは、学習可能な経路マスクを通じて機能的に重要なノードとエッジを特定するサブグラフ学習モジュールです。また、ML志向の生物学的評価と新しい指標も提案します。301の生物ネットワーク評価を含む実験では、ExPathによって推定された経路は生物学的意義を維持することが示されています。厳選された301の生物ネットワークデータは近日中に公開する予定です。
2025-02-25T09:33:15
AfroXLMR-Comet: Multilingual Knowledge Distillation with Attention Matching for Low-Resource languages
http://arxiv.org/abs/2502.18020v1
Joshua Sakthivel Raju, Sanjay S, Jaskaran Singh Walia, Srinivas Raghav, Vukosi Marivate
Vellore Institute of Technology, University of Pretoria
知識蒸留を通じた言語モデルの圧縮は、リソースの制約がある環境で大規模言語モデルを展開するための有望なアプローチとして浮上しています。しかし、既存の方法は、多言語モデルの蒸留時に、特にリソースの少ない言語に対してパフォーマンスを維持するのに苦労することがよくあります。本論文では、伝統的な知識蒸留と簡略化されたアテンションマッチングメカニズムを組み合わせた新しいハイブリッド蒸留アプローチを紹介します。このアプローチは、多言語文脈に特化して設計されています。我々の方法は、従来の多言語モデルよりもはるかに小型の、非常にコンパクトな生徒モデルアーキテクチャを導入します。このアプローチを、キニャルワンダ語、スワヒリ語、ハウサ語、イボ語、ヨルバ語の5つのアフリカ言語で評価します。蒸留された生徒モデルであるAfroXLMR-Cometは、モデルサイズを85%以上削減しながら、大きな教師モデル(AfroXLMR-Large)の出力分布と内部アテンションパターンの両方を正しく捉えます。実験結果は、我々のハイブリッドアプローチが教師モデルと比較して競争力のあるパフォーマンスを達成しており、元のモデルのパフォーマンスの85%以内の精度を維持しつつ、必要な計算リソースを大幅に削減していることを示しています。我々の研究は、特にアフリカ言語を含むアプリケーションに利益をもたらし、リソースが制約された環境で効率的な多言語モデルを展開するための実用的なフレームワークを提供します。
2025-02-25T09:28:47
ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents
http://arxiv.org/abs/2502.18017v1
Qiuchen Wang, Ruixue Ding, Zehui Chen, Weiqi Wu, Shihang Wang, Pengjun Xie, Feng Zhao
視覚的に豊かな文書から情報を理解することは、従来のRetrieval-Augmented Generation(RAG)手法にとって依然として重要な課題です。既存のベンチマークは主に画像ベースの質問応答(QA)に焦点を当てており、密な視覚文書内での効率的な情報検索、理解、および推論の基本的な課題を見落としています。このギャップを埋めるために、複雑な推論を必要とする視覚的に豊かな文書におけるRAGのパフォーマンスを評価するために設計された新しいデータセット「ViDoSeek」を紹介します。それに基づいて、現在のRAGアプローチにおける主要な制限を特定します:(i)純粋に視覚的な検索手法は、テキスト的および視覚的な特徴の両方を効果的に統合するのに苦労しており、(ii)以前のアプローチはしばしば不十分な推論トークンを配分し、その効果を制限しています。これらの課題に対処するために、視覚的文書内での複雑な推論に特化した新しいマルチエージェントRAGフレームワーク「ViDoRAG」を提案します。ViDoRAGは、ガウス混合モデル(GMM)に基づくハイブリッド戦略を採用して、マルチモーダル検索を効果的に処理します。また、モデルの推論能力をさらに引き出すために、探索、要約、反省を取り入れた反復エージェントワークフローを導入し、RAGドメインにおけるテスト時のスケーリングを調査するためのフレームワークを提供します。ViDoSeekでの広範な実験により、我々のアプローチの効果と一般化が検証されました。特に、ViDoRAGは競争の激しいViDoSeekベンチマークで既存の手法を10%以上上回る結果を示しています。
2025-02-25T09:26:12
NotaGen: Advancing Musicality in Symbolic Music Generation with Large Language Model Training Paradigms
http://arxiv.org/abs/2502.18008v3
Yashan Wang, Shangda Wu, Jianhuai Hu, Xingjian Du, Yueqi Peng, Yongxin Huang, Shuai Fan, Xiaobing Li, Feng Yu, Maosong Sun
Central Conservatory of Music, University of Rochester, Beijing Flowingtech Ltd., Beihang University, Tsinghua University
私たちはNotaGenを紹介します。これは、高品質なクラシック楽譜を生成する可能性を探ることを目的としたシンボリック音楽生成モデルです。大型言語モデル(LLM)の成功に触発されて、NotaGenは事前トレーニング、ファインチューニング、強化学習のパラダイムを採用しています(以下、LLMトレーニングパラダイムと呼びます)。NotaGenは1.6万曲の音楽で事前トレーニングされ、その後、「時代-作曲家-編成」プロンプトに基づく約9,000曲の高品質なクラシック作品でファインチューニングされました。強化学習のために、私たちはCLaMP-DPO法を提案し、人間の注釈や定義された報酬を必要とせずに生成の品質と制御能力をさらに向上させます。私たちの実験は、異なるアーキテクチャとエンコーディングスキームを持つシンボリック音楽生成モデルにおけるCLaMP-DPOの有効性を示しています。さらに、主観的なA/Bテストでは、NotaGenが人間の作曲と比較してベースラインモデルを上回ることが示され、シンボリック音楽生成における音楽的美学を大いに進展させています。
2025-02-25T09:12:07
Radon-Nikodým Derivative: Re-imagining Anomaly Detection from a Measure Theoretic Perspective
http://arxiv.org/abs/2502.18002v1
Shlok Mehendale, Aditya Challa, Rahul Yedida, Sravan Danda, Santonu Sarkar, Snehanshu Saha
BITS Pilani Goa, LexisNexis
効果的な異常検知ロス関数の設計を支える原則は何ですか?その答えは、測定理論の基本概念である\rnthm{}定理の概念にあります。重要な洞察は、バニラロス関数に\rnthm{}微分を掛けることで、全体的なパフォーマンスが向上するということです。これをRN-Lossと呼びます。このことは、異常検知のPAC学習可能性を用いて確立されます。さらに、\rnthm{}微分が教師なしクラスタリングベースの異常検知に重要な洞察を提供することを示します。我々は、医療、サイバーセキュリティ、金融などの多様なドメインからの単変量および多変量データを含む96のデータセットでアルゴリズムを評価します。RN-Derivativeアルゴリズムが、68%の多変量データセット(F-1スコアに基づく)で最先端の手法を上回り、72%の時系列(単変量)データセットでピークF1スコアを達成することを示します。
2025-02-25T09:08:50
GNN-XAR: A Graph Neural Network for Explainable Activity Recognition in Smart Homes
http://arxiv.org/abs/2502.17999v1
Michele Fiori, Davide Mor, Gabriele Civitarese, Claudio Bettini
センサーベースの人間活動認識(HAR)は、特にヘルスケア分野において、スマートホーム環境での多くのアプリケーションにとって重要です。既存のアプローチの大多数は、深層学習モデルを活用しています。これらのアプローチは効果的ですが、その出力の背後にある理由は不明瞭です。最近、説明可能な人工知能(XAI)アプローチが現れ、HARモデルの出力に直感的な説明を提供しています。私たちの知る限り、これらのアプローチはCNNやRNNなどの古典的な深層モデルを活用しています。最近、グラフニューラルネットワーク(GNN)がセンサーベースのHARに対して効果的であることが証明されました。しかし、既存のアプローチは説明可能性を考慮して設計されていません。この研究では、スマートホームHARのために明示的に設計された初の説明可能なグラフニューラルネットワークを提案します。二つの公開データセットにおける結果は、このアプローチが最先端の手法よりも優れた説明を提供し、同時に認識率をわずかに向上させることを示しています。
2025-02-25T09:05:13
MAGE: Multi-Head Attention Guided Embeddings for Low Resource Sentiment Classification
http://arxiv.org/abs/2502.17987v1
Varun Vashisht, Samar Singh, Mihir Konduskar, Jaskaran Singh Walia, Vukosi Marivate
Vellore Institute of Technology, University of Pretoria
低資源バントゥ語に対する高品質なデータの不足により、テキスト分類やその他の実用的な実装において重大な課題が発生しています。本論文では、言語非依存データ拡張(LiDA)とマルチヘッドアテンションに基づく重み付き埋め込みを組み合わせた高度なモデルを紹介し、批判的なデータポイントを選択的に強化し、テキスト分類のパフォーマンスを向上させます。この統合により、さまざまな言語的文脈で効果的な堅牢なデータ拡張戦略を作成できるため、モデルはバントゥ語の独自の構文的および意味的特徴を処理することができます。このアプローチは、データ不足の問題に対処するだけでなく、低リソース言語処理および分類タスクにおける将来の研究の基盤を築きます。
2025-02-25T08:53:27
Broadening Discovery through Structural Models: Multimodal Combination of Local and Structural Properties for Predicting Chemical Features
http://arxiv.org/abs/2502.17986v1
Nikolai Rekut, Alexey Orlov, Klea Ziu, Elizaveta Starykh, Martin Takac, Aleksandr Beznosikov
Moscow Institute of Physics and Technology, A. N. Nesmeyanov Institute of Organoelement Compounds Russian Academy of Sciences, Mohamed bin Zayed University of Artificial Intelligence, HSE University
近年、機械学習は化学の分野において大きな変革をもたらし、分子の特性予測や分子構造の生成を含むさまざまな応用において重要な進展を促進しています。この分野では、言語モデルやグラフベースのモデルが広く利用されており、さまざまなタスクで常に最先端の成果を達成しています。しかし、ほとんどのデータセットや多くの言語モデルで使用されているSMILES形式で化学化合物を表現する一般的な慣行には、トレーニングデータ形式として重要な制限があります。それに対して、化学フィンガープリンツは化合物の物理的により適切な表現を提供し、モデルのトレーニングに対する適合性を高めています。本研究は、フィンガープリンツに特化して訓練された言語モデルの開発を目指します。さらに、この言語モデルをグラフモデルと統合した二重モーダルアーキテクチャを提案します。提案する方法論は、これらのアプローチを統合し、RoBERTaを言語モデルとして利用し、グラフ同型ネットワーク(GIN)、グラフ畳み込みネットワーク(GCN)、グラフオルマなどのグラフモデルを採用します。この統合により、定量的構造-活性関係(QSAR)や核磁気共鳴(NMR)スペクトルの予測などのタスクにおいて、従来の戦略と比較して予測性能が大幅に向上します。
2025-02-25T08:53:18
LLM Knows Geometry Better than Algebra: Numerical Understanding of LLM-Based Agents in A Trading Arena
http://arxiv.org/abs/2502.17967v1
Tianmi Ma, Jiawei Du, Wenxin Huang, Wenjie Wang, Liang Xie, Xian Zhong, Joey Tianyi Zhou
Wuhan University of Technology, Hubei University, Agency for Science, Technology and Research, National University of Singapore, Institute of High Performance Computing, Centre for Frontier AI Research, School of Computing, School of Science
大規模言語モデル(LLM)の最近の進展により、自然言語処理タスクにおけるパフォーマンスが大幅に改善されました。しかし、特に数値推論において、動的かつ未見のタスクへの一般化能力は依然として課題です。既存のベンチマークは主に、予め定義された最適解を持つ問題でLLMを評価しており、明確な答えがない現実のシナリオとは一致しません。このギャップを埋めるために、私たちは「エージェントトレーディングアリーナ」を設計しました。これは、エージェントが株式ポートフォリオに投資するゼロサムゲームを通じて複雑な経済システムをシミュレートする仮想数値ゲームです。私たちの実験では、GPT-4oを含むLLMがプレーンテキストの株データを扱う際に代数的推論に苦労し、しばしば局所的な詳細に焦点を当て、全体的なトレンドを見逃していることが明らかになりました。一方で、視覚データ(散布図やK線チャートなど)を提示した場合、LLMの幾何学的推論は大幅に向上し、視覚的表現が数値的推論を強化することを示唆しています。この能力は、複雑なデータの分析と解釈を助ける反射モジュールを組み込むことでさらに向上します。私たちはNASDAQ株データセットでの結果を検証し、LLMがテキストと比較して視覚データでより強力な推論を示すことを確認しました。私たちのコードとデータは、https://github.com/wekjsdvnm/Agent-Trading-Arena.git で公開されています。
2025-02-25T08:41:01
MA-GTS: A Multi-Agent Framework for Solving Complex Graph Problems in Real-World Applications
http://arxiv.org/abs/2502.18540v1
Zike Yuan, Ming Liu, Hui Wang, Bing Qin
Harbin Institute of Technology, Peng Cheng Laboratory
グラフ理論の問題は、物流、通信ネットワーク、交通最適化などの実世界のアプリケーションで発生します。これらの問題はしばしば複雑でノイズが多く、不規則であり、従来のアルゴリズムにとって課題となります。大規模言語モデル(LLM)は潜在的な解決策を提供しますが、精度の限界や入力長の制約などの課題に直面しています。これらの課題に対処するため、我々はMA-GTS(マルチエージェントグラフ理論ソルバー)を提案します。これはエージェントの協力を通じてこれらの複雑な問題を分解するマルチエージェントフレームワークです。MA-GTSは、暗黙的に表現されたテキストベースのグラフデータを明確で構造化されたグラフ表現にマッピングし、問題の制約とグラフ構造のスケールに基づいて最も適したアルゴリズムを動的に選択します。このアプローチにより、解決プロセスが効率的に保たれ、得られる推論経路が解釈可能になります。MA-GTSを検証するために、我々が作成した実世界に触発されたグラフ理論データセットであるG-REALデータセットを使用しました。実験結果は、MA-GTSが効率性、精度、スケーラビリティの点で最先端のアプローチを上回ることを示しており、複数のベンチマーク(G-REAL 94.2%、GraCoRe 96.9%、NLGraph 98.4%)で強力な結果を得ています。MA-GTSはhttps://github.com/ZIKEYUAN/MA-GTS.gitでオープンソースされています。
2025-02-25T08:34:00
Language Models' Factuality Depends on the Language of Inquiry
http://arxiv.org/abs/2502.17955v1
Tushar Aggarwal, Kumar Tanmay, Ayush Agrawal, Kumar Ayush, Hamid Palangi, Paul Pu Liang
Harvard University, Université de Montréal, Mila, MIT, Stanford University, Google, Microsoft Research
マルチリンガル言語モデル(LM)は、言語間で事実に関する知識を一貫して思い出すことが期待されていますが、正しい情報を持っている場合でも、言語間で知識を転送することに失敗することがしばしばです。例えば、LMはアラビア語で質問された際にラシード・アルシャシャイがサウジアラビア出身であることを正しく特定する一方で、英語やスワヒリ語で質問された場合にはそれを一貫して失敗することがわかります。この制限を体系的に調査するために、13の言語にわたる10,000の国に関する事実のベンチマークを導入し、事実の再現性と知識の転送可能性を定量化するために、3つの新しいメトリックを提案します:事実再現スコア、知識転送可能性スコア、言語間事実知識転送可能性スコアです。我々の結果は、特に言語間の一般化において、今日の最先端LMにおける根本的な弱点を明らかにし、モデルが異なる言語間で知識を効果的に転送できないために、使用される言語に敏感な一貫性のないパフォーマンスをもたらしていることを示しています。我々の発見は、LMが言語特有の事実の信頼性を認識し、異なる言語間で最も信頼できる情報を活用する必要性を強調しています。今後の多言語知識転送の研究を推進するために、我々のベンチマークと評価フレームワークを公開します。
2025-02-25T08:27:18
Robust Polyp Detection and Diagnosis through Compositional Prompt-Guided Diffusion Models
http://arxiv.org/abs/2502.17951v1
Jia Yu, Yan Zhu, Peiyao Fu, Tianyi Chen, Junbo Huang, Quanlin Li, Pinghong Zhou, Zhihua Wang, Fei Wu, Shuo Wang, Xian Yang
Zhejiang University, Shanghai Institute for Advanced Study of Zhejiang University, Fudan University, Shanghai Key Laboratory of MICCAI, Shanghai Collaborative Innovation Center of Endoscopy, Alliance Manchester Business School, The University of Manchester, Data Science Institute, Imperial College London
大腸癌(CRC)は、世界的な健康問題として重要であり、スクリーニングを通じた早期発見は死亡率を減らす上で重要な役割を果たします。ディープラーニングモデルはポリープの検出、分類、セグメンテーションを改善する可能性を示していますが、多様な臨床環境、特に分布外(OOD)データに対する一般化には依然として課題があります。PolypGenのような多施設データセットがこれらの問題に対処するために開発されていますが、その収集は高コストで時間がかかります。従来のデータ拡張技術は限られた変動性を提供し、医療画像の複雑さを捉えることができません。拡散モデルは合成ポリープ画像を生成するための有望な解決策として登場しましたが、現在のモデルでの画像生成プロセスは主にセグメンテーションマスクを条件としているため、完全な臨床コンテキストを捉える能力が制限されています。これらの制限を克服するために、私たちはさまざまな臨床アノテーション(セグメンテーションマスク、バウンディングボックス、大腸内視鏡レポートなど)を統合し、合成プロンプトに変換するプログレッシブスペクトラム拡散モデル(PSDM)を提案します。これらのプロンプトは粗いコンポーネントと細かいコンポーネントに整理されており、モデルは広い空間構造と細かい詳細の両方を捉え、臨床的に正確な合成画像を生成します。PSDM生成サンプルでトレーニングデータを拡張することで、私たちのモデルはポリープの検出、分類、セグメンテーションを大幅に改善します。例えば、PolypGenデータセットでは、PSDMはF1スコアを2.12%、平均適合率を3.09%向上させ、OODシナリオでの優れたパフォーマンスと強化された一般化を示しています。
2025-02-25T08:22:45
DeepSeek-R1 Outperforms Gemini 2.0 Pro, OpenAI o1, and o3-mini in Bilingual Complex Ophthalmology Reasoning
http://arxiv.org/abs/2502.17947v1
Pusheng Xu, Yue Wu, Kai Jin, Xiaolan Chen, Mingguang He, Danli Shi
目的:バイリンガルの複雑な眼科症例におけるDeepSeek-R1と最近発表された他の3つの大規模言語モデル(LLM)の正確性と推論能力を評価すること。方法:診断に関連する130の選択肢問題(MCQ)を収集し(n = 39)、管理に関するものも含め(n = 91)、中国の眼科専門職試験から6つのトピックに分類した。これらのMCQはDeepSeek-R1を用いて英語に翻訳された。DeepSeek-R1、Gemini 2.0 Pro、OpenAI o1、o3-miniの回答は、2025年2月15日から2月20日の間にデフォルト設定で生成された。正確性は正しく回答された質問の割合として計算され、省略や余分な回答は不正解と見なされた。推論能力は推論ロジックと推論エラーの原因を分析することで評価された。結果:DeepSeek-R1は最も高い全体の正確性を示し、中国語のMCQで0.862、英語のMCQで0.808を達成した。Gemini 2.0 Pro、OpenAI o1、OpenAI o3-miniは、中国語のMCQでそれぞれ0.715、0.685、0.692の正確性を達成し(全てP<0.001でDeepSeek-R1と比較)、英語のMCQではそれぞれ0.746(P=0.115)、0.723(P=0.027)、0.577(P<0.001)を達成した。DeepSeek-R1は、中国語および英語のMCQの5つのトピックすべてにおいて最も高い正確性を示した。また、中国語で行われた管理に関する問題でも優れた結果を示した(全てP<0.05)。推論能力の分析では、4つのLLMが似たような推論ロジックを共有していることが示された。重要なポジティブ履歴の無視、重要なポジティブサインの無視、医療データの誤解釈、過度に攻撃的であることが最も一般的な推論エラーの原因であった。結論:DeepSeek-R1は、バイリンガルな複雑な眼科推論タスクにおいて、他の3つの最先端LLMよりも優れたパフォーマンスを示した。その臨床応用は依然として挑戦的であるが、診断や臨床意思決定を支援する可能性を示している。
2025-02-25T08:08:53
Optimal Brain Apoptosis
http://arxiv.org/abs/2502.17941v1
Mingyuan Sun, Zheng Fang, Jiaxu Wang, Junjie Jiang, Delei Kong, Chenming Hu, Yuetong Fang, Renjing Xu
Northeastern University, The Hong Kong University of Science and Technology (Guangzhou), Hunan University
畳み込みニューラルネットワーク(CNN)およびトランスフォーマーの複雑さとパラメータ数の増加は、計算効率とリソースの需要に関する課題を引き起こしています。プルーニングは、ニューロン、チャネル、接続などの冗長な要素を取り除くことで、パフォーマンスを大きく損なうことなく計算効率を向上させる効果的な戦略であることが認識されています。本論文では、ヘッセ行列を用いたパラメータ重要性推定の方法論を進展させることによって、最適脳損傷(OBD)の基礎的な研究に基づいています。以前の近似に依存するアプローチとは異なり、我々は各パラメータに対してヘッセ行列-ベクトル積の値を直接計算する新しいプルーニング手法である最適脳アポトーシス(OBA)を導入します。ネットワーク層を跨いでヘッセ行列を分解し、層間のヘッセ部分行列が非ゼロである条件を特定することにより、パラメータの二次テイラー展開を計算するための非常に効率的な手法を提案します。このアプローチは、CNNやトランスフォーマーの文脈において、特に精度の高いプルーニングプロセスを可能にします。これに関して、CIFAR10、CIFAR100、ImagenetデータセットでのVGG19、ResNet32、ResNet50、ViT-B/16を含む実験が検証されています。我々のコードはhttps://github.com/NEU-REAL/OBAで入手可能です。
2025-02-25T08:03:04
Revisiting Convolution Architecture in the Realm of DNA Foundation Models
http://arxiv.org/abs/2502.18538v1
Yu Bo, Weian Mao, Yanjun Shao, Weiqiang Bai, Peng Ye, Xinzhu Ma, Junbo Zhao, Hao Chen, Chunhua Shen
Zhejiang University, MIT, Yale University, Shanghai AI Lab, Ant Group, Zhejiang University of Technology
近年、トランスフォーマーおよび状態空間モデル(SSM)アーキテクチャに基づくさまざまな手法が提案され、基盤となるDNA言語モデルが進展しています。しかし、これらの最近のアプローチと古典的なアーキテクチャである畳み込みネットワーク(CNN)との比較は不足しています。これは、CNNがトランスフォーマーやSSMアーキテクチャに基づく最近のアプローチに実際に追い越されているのか、という疑問を呼び起こします。本論文では、ConvNovaと呼ばれるシンプルでありながらよく設計されたCNNベースの手法を提案します。ConvNovaは、以下の3つの効果的なデザインを特定します。1) 拡張畳み込み、2) ゲート付き畳み込み、3) ゲーティングメカニズムのための二重ブランチフレームワーク。広範囲な実験を通じて、ConvNovaがいくつかの基盤モデルベンチマークにおいて、タスクの半数以上で最近の手法を大幅に上回ることを示しました。例えば、ヒストン関連のタスクにおいて、ConvNovaは2番目に優れた手法を平均5.8%上回り、一般的に使用するパラメータは少なく、計算も高速化されます。さらに、実験で観察された結果は、生物学的特性に関連している可能性があります。これは、CNNがトランスフォーマーやSSMと比較して依然として強力な競争相手であることを示しています。この研究がDNA基盤モデルに対するCNNベースの手法への新たな関心を引き起こすことを期待しています。
2025-02-25T08:00:05
Integrating Boosted learning with Differential Evolution (DE) Optimizer: A Prediction of Groundwater Quality Risk Assessment in Odisha
http://arxiv.org/abs/2502.17929v1
Sonalika Subudhi, Alok Kumar Pati, Sephali Bose, Subhasmita Sahoo, Avipsa Pattanaik, Biswa Mohan Acharya
Siksha ’O’ Anusandhan Deemed to be University, SOA
地下水は、急速な産業化、都市化、過剰抽出、農業および都市源からの汚染といった人間の活動によって最終的に影響を受けます。さまざまな汚染物質の中でも、カドミウム(Cd)、クロム(Cr)、ヒ素(As)、および鉛(Pb)などの重金属の存在は、地下水中に高濃度で存在する場合に深刻な危険を引き起こすことが証明されています。これらの有毒物質を長期間使用することは、神経障害、腎不全、さまざまな種類の癌を引き起こす可能性があります。これらの問題に対処するため、本研究では地下水の質評価指数(GWQI)を評価し、水質に影響を与える主要な汚染物質を特定するための機械学習ベースの予測モデルを開発しました。これは、LCBoost Fusionというハイブリッド機械学習モデルの助けを借りて達成されました。このモデルは、データ前処理、差分進化(DE)最適化を使用したハイパーパラメータチューニング、交差検証による評価など、いくつかのプロセスを経ています。LCBoost Fusionモデルは、低いRMSE(0.6829)、MSE(0.5102)、MAE(0.3147)を達成し、高いR²スコア(0.9809)を持つことで、個別のモデル(CatBoostおよびLightGBM)を上回ります。特徴重要性分析は、カリウム(K)、フッ化物(F)、および総硬度(TH)が地下水汚染の最も影響力のある指標であることを強調しています。この研究は、オディシャにおける地下水の質リスクを評価するための機械学習の応用を成功裏に示しています。提案されたLCBoost Fusionモデルは、リアルタイムの地下水監視とリスク軽減のための信頼性が高く効率的なアプローチを提供します。これらの発見は、環境団体や政策立案者が持続可能な地下水管理のためのターゲット地点をマッピングするのに役立つでしょう。将来の研究は、リモートセンシングデータを利用し、地下水質評価のためのインタラクティブな意思決定システムの開発に焦点を当てる予定です。
2025-02-25T07:47:41
Structure-prior Informed Diffusion Model for Graph Source Localization with Limited Data
http://arxiv.org/abs/2502.17928v1
Hongyi Chen, Jingtao Ding, Xiaojun Liang, Yong Li, Xiao-Ping Zhang
Shenzhen International Graduate School, Tsinghua University, Tsinghua University, Peng Cheng Laboratory, Department of Electronic Engineering
グラフ情報伝播におけるソースローカリゼーション問題は、誤情報の拡散やインフラストラクチャの故障といったさまざまなネットワークの混乱を管理する上で重要です。最近の深層生成アプローチはこの分野で有望な成果を示していますが、実世界の伝播データが不足しているため、その効果は制限されています。本論文では、限られたデータシナリオにおける3つの主要な課題、つまり未知の伝播パターン、複雑なトポロジーと伝播の関係、およびソースノードと非ソースノード間のクラス不均衡に対処する新しいフレームワーク「SIDSL(ソースローカリゼーションのための構造優先情報拡散モデル)」を紹介します。SIDSLは、グラフラベル伝播を通じてトポロジーを考慮したプライヤを取り入れ、GNNにパラメータ化されたラベル伝播モジュール(GNN-LP)を持つ伝播強化条件デノイザーを用いています。さらに、ランダムノイズではなく構造に基づいたソース推定から初期化する構造優先バイアスのデノイジング手法を提案し、クラス不均衡の問題に効果的に対処します。4つの実世界データセットにおける実験結果は、SIDSLの優れた性能を示し、最先端の手法と比較してF1スコアで7.5-13.3%の改善を達成しました。特に、合成パターンのシミュレーションデータで事前訓練された場合、SIDSLはトレーニングデータの10%のみで堅牢な性能を維持し、ベースラインを18.8%以上上回る結果を示しました。これらの結果は、ラベルデータが不足している実世界のアプリケーションにおけるSIDSLの効果的な適用を強調しています。
2025-02-25T07:47:22
LeanProgress: Guiding Search for Neural Theorem Proving via Proof Progress Prediction
http://arxiv.org/abs/2502.17925v2
Suozhi Huang, Peiyang Song, Robert Joseph George, Anima Anandkumar
数学的推論は、幻覚のために大規模言語モデル(LLM)にとって依然として重大な課題です。これらの幻覚は、Leanのような形式的証明支援ツールと組み合わせることで厳密な検証を通じて排除することができ、定理証明を信頼できるものにします。しかし、形式的な検証があっても、LLMは長い証明や複雑な数学的形式化に対して依然として苦労しています。LLMを使ったLeanは、補題の取得や戦略の生成、さらには完全な証明の生成に貴重な支援を提供しますが、重要な能力が欠けています。それは、証明の進捗状況を把握する能力です。この限界は、大規模な形式化プロジェクトにおける総合的な開発効率に特に影響を及ぼします。私たちは、証明の進捗を予測する手法「LeanProgress」を紹介します。Lean Workbook PlusやMathlib4からの大規模なLean証明のコーパスを用いてモデルをトレーニングし評価し、完了するまでに残っているステップ数を予測するために、証明の長さの偏った分布を扱うためのデータ前処理とバランス調整技術を採用しました。実験の結果、LeanProgressは進捗の量、およびしたがって残りのステップ数を予測する際に75.1%の全体的な予測精度を達成しました。Reproverを使用して最良優先探索フレームワークに統合されると、私たちの手法はMathlib4で41.2%のベースラインパフォーマンスと比較して3.8%の改善を示しました。特に長い証明において顕著です。これらの結果は、証明進捗の予測が自動および対話的な定理証明の両方を強化し、ユーザーが証明戦略についてより情報に基づいた決定を下すことを可能にする方法を示しています。
2025-02-25T07:46:36
Unmasking Gender Bias in Recommendation Systems and Enhancing Category-Aware Fairness
http://arxiv.org/abs/2502.17921v1
Tahsin Alamgir Kheya, Mohamed Reda Bouadjenek, Sunil Aryal
Deakin University
推薦システムは現在、私たちの日常生活に欠かせない部分となっています。新しい映画の発見、ソーシャルメディアでの友人探し、求職者と関連する機会との接続などのタスクにおいて、私たちはこれらに頼っています。これらの重要な役割を考えると、推薦が社会的なステレオタイプから自由であることを確保する必要があります。したがって、推薦システムにおけるバイアスの評価と対処は重要です。推奨項目の公平性を評価する以前の研究は、主に異なるセンシティブグループのパフォーマンスメトリクスを比較することに集中しているため、特定のニュアンスを捉えることに失敗しています。本論文では、推薦における性別バイアスを定量化するための包括的なメトリクスのセットを紹介します。具体的には、映画のジャンルなど、推奨アイテムのカテゴリーを使用して性別バイアスを捉えるために、より詳細なレベルで公平性を評価することの重要性を示します。さらに、訓練中に主な推薦損失とともにカテゴリ認識型の公平性メトリックを正則化項として使用することで、モデルの出力バイアスを効果的に最小限に抑える手助けができることを示します。私たちは、3つの実世界データセットで実験を行い、5つのベースラインモデルと2つの人気のある公平性認識モデルを使用して、性別バイアス評価におけるメトリクスの効果を示しました。私たちのメトリクスは、以前のメトリクスと比較して推奨されたアイテムのバイアスに対する洞察を向上させるのに役立ちます。さらに、私たちの結果は、正則化項を取り入れることで、異なるカテゴリーの推薦における公平性が大幅に改善され、全体の推薦パフォーマンスが大きく劣化することなく実現できることを示しています。
2025-02-25T07:37:28
Decoupled Graph Energy-based Model for Node Out-of-Distribution Detection on Heterophilic Graphs
http://arxiv.org/abs/2502.17912v1
Yuhan Chen, Yihong Luo, Yifan Song, Pengwen Dai, Jing Tang, Xiaochun Cao
Sun Yat-sen University, The Hong Kong University of Science and Technology, Shenzhen Campus of Sun Yat-sen University
画像におけるOOD検出に焦点を当てた広範な研究努力にもかかわらず、グラフ学習におけるノードのOOD検出は未だに十分に探求されていません。グラフノード間の依存関係は、入力が独立同分布(i.i.d.)でサンプリングされることを前提とする既存のアプローチの単純な適用を妨げます。これは、ヘテロフィリー問題など、グラフに特有の多くのユニークな特徴や課題が考慮されていないためです。最近、ノードの依存性を考慮したGNNSafeが、エネルギーベースの検出をグラフ領域に適応させ、最先端のパフォーマンスを達成しましたが、以下の2つの重大な問題があります。1) ノードエネルギーは分類ロジットから導出されており、データ分布をモデル化するために特に調整されたトレーニングなしでは、OODデータを認識するのが効果的ではありません。2) 同質性の仮定に基づくエネルギー伝播に大きく依存しており、隣接ノードとの分布が異なるヘテロフィリックなグラフでは、パフォーマンスが大幅に低下します。これらの問題に対処するために、データ分布モデリングを強化し、ヘテロフィリー問題を克服するために、最大尤度推定(MLE)によってEBMsのトレーニングを提案します。しかし、MLEを介してEBMsをトレーニングするには、ノード特徴とノード隣接ノードの両方でMCMCサンプリングを行う必要があり、ノードの相互依存性と離散的なグラフトポロジーのために困難です。このサンプリングの課題に対処するために、DeGEMを導入します。DeGEMは、ノード表現のためにトポロジー情報を利用するグラフエンコーダと、潜在空間で動作するエネルギーヘッドの2つの部分に学習プロセスを分解します。広範な実験により、トレーニング中にOOD露出なしでDeGEMが以前の最先端の方法を上回り、同質性グラフで平均AUROC 6.71%、ヘテロフィリックなグラフで20.29%の改善を達成し、OOD露出でトレーニングされた方法をも上回ることが確認されました。私たちのコードは以下のリンクから入手できます: https://github.com/draym28/DeGEM。
2025-02-25T07:20:00
Enhancing Speech Quality through the Integration of BGRU and Transformer Architectures
http://arxiv.org/abs/2502.17911v1
Souliman Alghnam, Mohammad Alhussien, Khaled Shaheen
音声強化は、騒がしい環境における音声信号の品質を向上させる上で重要な役割を果たします。本論文では、音声強化タスクにおける双方向ゲート付き再帰ユニット(BGRU)とトランスフォーマーモデルを統合する効果を調査します。包括的な実験評価を通じて、私たちの研究は、このハイブリッドアーキテクチャが従来の方法や単独モデルよりも優れていることを示しています。統合されたBGRU-トランスフォーマーフレームワークは、時間的依存関係を捉え、複雑な信号パターンを学習するのに優れており、ノイズの低減と音声品質の向上に寄与しています。結果は、既存のアプローチと比較して顕著な性能向上を示しており、この統合モデルの実世界のアプリケーションにおける可能性を強調しています。BGRUとトランスフォーマーアーキテクチャのシームレスな統合は、システムの堅牢性を高めるだけでなく、高度な音声処理技術への道を開くことにもつながります。この研究は音声強化技術における継続的な取り組みに貢献し、モデルアーキテクチャの最適化、さまざまなアプリケーションシナリオの探求、騒がしい環境における音声処理の分野の進展に向けた確固たる基盤を築いています。
2025-02-25T07:18:35
Scaling LLM Pre-training with Vocabulary Curriculum
http://arxiv.org/abs/2502.17910v1
Fangyuan Yu
Fangyuan Yu, Temus
現代の言語モデルは、事前学習の前に固定された静的な語彙に依存していますが、人間の言語学習で見られる適応的な語彙獲得とは対照的です。このギャップを埋めるために、語彙カリキュラム学習を提案します。このアプローチは、語彙のサイズに対して対数線形スケーリングの利点を用いて、事前学習の効率を向上させます。私たちの方法は、エントロピー主導の語彙拡張とモデル最適化の間で交互に進行し、多様なトークン化の粒度にわたってモデルが転送可能な表現を学ぶことを可能にします。このアプローチは自然に最適な計算配分パターンを生み出します:長いトークンは予測可能な内容をキャッチし、短いトークンはより複雑で予測が難しい文脈に焦点を当てます。小規模なGPTモデルでの実験は、スケーリング効率の向上を示し、動的トークン化の効果を強化しています。私たちはさらなる研究を支援するためにコードを公開し、今後の実験をより大きなモデルや多様なドメインに拡張する予定です。
2025-02-25T07:18:29
Opus: A Workflow Intention Framework for Complex Workflow Generation
http://arxiv.org/abs/2502.19532v1
Phillip Kingston, Théo Fagnoni, Mahsun Altin
AppliedAI
この論文では、複雑なビジネス環境内でのプロセス目標の特定と符号化のための新しいフレームワークである「ワークフロー意図」を紹介します。ワークフロー意図は、ビジネスアーティファクト内のワークフロー信号から解釈されたワークフローの変換目標を定義する入力、プロセス、出力の要素の整合性を表します。これは、品質基準、ビジネスルール、コンプライアンス要件、制約を取り入れ、望ましい出力を達成するために入力がどのように処理されるかを規定します。我々は、モダリティ固有の符号化、モダリティ内注意、モダリティ間融合注意、そして意図のデコーディングという4つのステップを含む、エンドツーエンドのビジネスアーティファクトエンコーダーとワークフロー信号解釈メソッドを採用します。我々は、トレーニング手順と重要な損失関数の定義を提供します。この論文では、ワークフロー信号とワークフロー意図の概念を導入し、ワークフロー信号はビジネスアーティファクトから解釈される入力、プロセス、出力要素に分解され、ワークフロー意図はこれらの要素の完全な三重項であることを示します。さらに、ワークフロー信号をベクトルとして、ワークフロー意図をテンソルとして表現するための数学的フレームワークを導入し、これらのオブジェクトの特性を形式化します。最後に、ビジネスアーティファクトからワークフロー意図を解決するための、モジュラーでスケーラブル、トレーニング可能な注意ベースのマルチモーダル生成システムを提案します。
2025-02-25T07:16:46
FactFlow: Automatic Fact Sheet Generation and Customization from Tabular Dataset via AI Chain Design & Implementation
http://arxiv.org/abs/2502.17909v1
Minh Duc Vu, Jieshan Chen, Zhenchang Xing, Qinghua Lu, Xiwei Xu, Qian Fu
データがさまざまな領域で普及する中、専門知識がない人でも深いデータ分析スキルなしに有意義な洞察を導き出すことができるツールの需要が高まっています。このニーズに応えるため、既存の自動ファクトシート生成ツールは、事実を抽出しストーリーを生成するためのヒューリスティックベースのソリューションを提供しています。しかし、これらのツールはデータの意味を十分に理解しておらず、データセットの意味を完全に捉えたナラティブを生成したり、ファクトシートを特定のユーザーのニーズに合わせて調整するのに苦労しています。これらの課題に対処するために、本論文では、ファクトシートの自動生成とカスタマイズのために設計された新しいツール\toolを紹介します。\toolは、コラボレーティブAIワーカーの概念を適用して、生の表形式データセットを包括的で視覚的に魅力的なファクトシートに変換します。私たちは、専門的なタスクのためのAIワーカーをプロファイリングするための効果的な分類法を定義します。さらに、\toolはユーザーが直感的な自然言語コマンドを通じてファクトシートを改善できるように支援し、最終的な成果物が個々の好みや要件に密接に一致することを保証します。18人の参加者とのユーザー評価により、\toolは自動ファクトシート制作において最先端のベースラインを超えるだけでなく、カスタマイズタスクの際にポジティブなユーザー体験を提供することが確認されました。
2025-02-25T07:15:41
Towards Sustainable Web Agents: A Plea for Transparency and Dedicated Metrics for Energy Consumption
http://arxiv.org/abs/2502.17903v1
Lars Krupp, Daniel Geißler, Paul Lukowicz, Jakob Karolus
German Research Center for Artificial Intelligence (DFKI), RPTU Kaiserslautern-Landau
大規模言語モデルの分野における改善は、外部ツールを使用し、その出力を解釈できるモデルの構築にシフトしています。これらのいわゆるウェブエージェントは、インターネットと自律的にやり取りする能力を持っています。このため、彼らは時間がかかり、繰り返し行うタスクを処理しながら、ユーザーの日常活動をサポートする強力な日常のアシスタントとなることができます。ウェブエージェントの研究は盛況ですが、この研究の持続可能性の側面はほとんど探求されていません。私たちは、ウェブエージェントに関連するエネルギーとCO2コストの初期探求を提供します。私たちの結果は、ウェブエージェントの創造における異なる哲学が、関連する消費エネルギーにどのように重大な影響を与えるかを示しています。また、一部のウェブエージェントに使用されるモデルのパラメータやプロセスの開示に関する透明性の不足が、エネルギー消費を推定する際の制約要因であることを強調します。このように、私たちの研究は、ウェブエージェントを評価する際の思考の変化を提唱し、エネルギー消費と持続可能性に対する専用の指標を必要としています。
2025-02-25T06:58:40
Knowledge-enhanced Multimodal ECG Representation Learning with Arbitrary-Lead Inputs
http://arxiv.org/abs/2502.17900v1
Che Liu, Cheng Ouyang, Zhongwei Wan, Haozhe Wang, Wenjia Bai, Rossella Arcucci
Imperial College London, University of Oxford, Ohio State University, Hong Kong University of Science and Technology
最近の多モーダルECG表現学習の進展は、ECG信号とペアになった自由形式のレポートの整列に焦点を当てています。しかし、医療用語の複雑さや完全な12リード設定への依存により、最適でない整列が依然として存在します。これに対処するために、私たちはK-MERL、知識強化型多モーダルECG表現学習フレームワークを提案します。K-MERLは、大規模言語モデルを活用して自由形式のレポートから構造化された知識を抽出し、任意のリード入力に対応できる動的リードマスキングを持つリード認識型ECGエンコーダを使用します。6つの外部ECGデータセットに対する評価では、K-MERLがゼロショット分類および線形プロービングタスクにおいて最先端の性能を達成し、部分リードゼロショット分類においては既存の手法に対して平均16%のAUC改善を達成することを示しています。
2025-02-25T06:53:50
VeriPlan: Integrating Formal Verification and LLMs into End-User Planning
http://arxiv.org/abs/2502.17898v1
Christine Lee, David Porfirio, Xinyu Jessica Wang, Kevin Zhao, Bilge Mutlu
University of Wisconsin–Madison, U.S. Naval Research Laboratory
自動計画は伝統的に専門家の領域であり、製造業や医療などの分野で専門家の計画ツールを利用して行われてきました。最近のLLM(大規模言語モデル)の進歩により、ユーザーが複雑な計画タスクを支援できる可能性から、計画が一般ユーザーにもよりアクセスしやすくなっています。しかし、LLMはエンドユーザーの計画において、一貫性、正確性、ユーザーの信頼などのいくつかのアプリケーション上の課題に直面しています。この論文では、正式な検証技術、特にモデルチェックを適用してLLMの信頼性と柔軟性を向上させるシステム「VeriPlan」を紹介します。VeriPlanはLLMプランナーに加え、ユーザーを検証プロセスに巻き込むための3つの追加機能―ルール翻訳機、柔軟性スライダー、およびモデルチェッカー―を含んでいます。ユーザースタディ(n=12)を通じて、我々はVeriPlanを評価し、LLMの認知された品質、使いやすさ、およびユーザー満足度の向上を示しました。本研究は、エンドユーザーの計画タスクにおける公式な検証とユーザー制御機能の効果的な統合を示しています。
2025-02-25T06:53:00
Sample-efficient diffusion-based control of complex nonlinear systems
http://arxiv.org/abs/2502.17893v1
Hongyi Chen, Jingtao Ding, Jianhai Shu, Xinchun Yu, Xiaojun Liang, Yong Li, Xiao-Ping Zhang
複雑な非線形システム制御は、サンプル効率の高い信頼性のある性能を達成する上で課題に直面しています。拡散ベースの手法は、長期的な制御性能において従来の強化学習アプローチよりも利点を示していますが、サンプル効率の面で制限があります。本論文では、SEDC(サンプル効率的拡散ベース制御)を提案します。これは、高次元の状態-行動空間、非線形システムのダイナミクス、非最適なトレーニングデータと近似最適な制御ソリューションとのギャップという3つの主要な課題に対処した新しい拡散ベースの制御フレームワークです。デカップル状態拡散、デュアルモード分解、ガイデッド自己微調整の3つのイノベーションを通じて、SEDCは3つの複雑な非線形動的システムで検証された結果、ベースラインと比較して39.5%から49.4%の制御精度向上を達成し、トレーニングサンプルのわずか10%を使用しています。我々のアプローチは、複雑な非線形システムのサンプル効率的な制御において重要な進展を代表しています。コードの実装は、https://anonymous.4open.science/r/DIFOCON-C019 で見ることができます。
2025-02-25T06:30:04
Arrhythmia Classification from 12-Lead ECG Signals Using Convolutional and Transformer-Based Deep Learning Models
http://arxiv.org/abs/2502.17887v1
Andrei Apostol, Maria Nutu
ルーマニアでは、心血管系の問題が主要な死亡原因であり、年間の死亡者の約三分の一を占めています。この状況の深刻さは、心血管疾患の革新的な診断方法の必要性を示しています。本記事では、リソースが制約された医療環境における不整脈診断のための効率的で軽量かつ迅速な方法を探求することを目的としています。ルーマニアの公的医療データの不足のため、私たちは国際的な公用データセットを使用してシステムを訓練しました。ECG信号は患者の国籍に関係なく同じであることを考慮しています。この目的のために、不整脈の分類に通常使用される複数のデータセットを組み合わせました。具体的には、PTB-XL心電図データセット、PTB診断ECGデータベース、中国12誘導ECGチャレンジデータベース、ジョージア12誘導ECGチャレンジデータベース、サンクトペテルブルクINCART 12誘導不整脈データベースが含まれます。入力データには、ECG信号処理方法、具体的にはPan-Tompkinsアルゴリズムの変種を使用しました。これは、不整脈の分類に役立つため、ECG信号内のQRS複合体を検出するための堅牢かつ効率的な方法を提供します。さらに、分類タスクに広く使用される機械学習技術(1D CNN、2D CNN、ResNet、およびVision Transformers(ViTs))も使用しました。システムは、精度とF1スコアの観点から評価されました。私たちは、データセットを二つの観点から分析しました。まず、システムにECG信号を入力したところ、GRUベースの1D CNNモデルがすべてのテストされたアーキテクチャの中で最高の精度93.4%を達成しました。次に、ECG信号を画像に変換し、CNN2Dモデルが92.16%の精度を達成しました。
2025-02-25T06:17:52
A graph neural network-based multispectral-view learning model for diabetic macular ischemia detection from color fundus photographs
http://arxiv.org/abs/2502.17886v1
Qinghua He, Hongyang Jiang, Danqi Fang, Dawei Yang, Truong X. Nguyen, Anran Ran, Clement C. Tham, Simon K. H. Szeto, Sobha Sivaprasad, Carol Y. Cheung
糖尿病性黄斑虚血(DMI)は、黄斑領域での網膜毛細血管の喪失に特徴づけられ、糖尿病患者の視覚障害に寄与します。カラー眼底写真(CFPs)は、人工知能(AI)と組み合わせて、糖尿病網膜症(DR)を含むさまざまな眼疾患の検出に広く活用されていますが、DMIの検出に関する応用は未探査であり、その一因は眼科医の間での実現可能性に対する懐疑的な見解です。本研究では、CFPからDMIを検出するために設計されたグラフニューラルネットワークに基づく多視点学習(GNN-MSVL)モデルを提案します。このモデルは、虚血組織によって引き起こされる眼底反射の微細な変化を捉えるために高いスペクトル分解能を活用し、DMI関連の特徴に対する感度を高めます。提案されたアプローチは、CFPから24波長の多スペクトル眼底画像を再構築する計算的多スペクトル画像(CMI)から始まります。ResNeXt101が、再構築された画像から特徴を抽出するための多視点学習のバックボーンとして使用されます。さらに、クロススペクトル関係を強化するためにカスタマイズされたジャンパー接続戦略を持つGNNが設計され、包括的かつ効率的な多スペクトル視点学習を促進します。この研究には、糖尿病患者592人の1,078眼から得られた1,078枚の中心黄斑CFPが含まれており、そのうち530枚のCFPが300人の患者の530眼でDMIと診断されました。このモデルは、眼レベルで84.7%の精度と受信者動作特性曲線(AUROC)0.900(95% CI: 0.852-0.937)を達成し、CFPから訓練されたベースラインモデルおよび人間の専門家を上回りました(p値は0.01未満)。これらの結果は、AIベースのCFP分析がDMIの検出に有望であり、早期かつ低コストのスクリーニングに貢献する可能性を示唆しています。
2025-02-25T06:17:20
From underwater to aerial: a novel multi-scale knowledge distillation approach for coral reef monitoring
http://arxiv.org/abs/2502.17883v1
Matteo Contini, Victor Illien, Julien Barde, Sylvain Poulain, Serge Bernard, Alexis Joly, Sylvain Bonhommeau
IFREMER, INRIA, LIRMM, Université de Montpellier, CNRS, IRD
AI駆動の方法論と組み合わせたドローンを活用したリモートセンシングは、サンゴ礁生態系の正確なマッピングとモニタリングにおいて大きな可能性を示しています。本研究は、細部にわたる水中画像と中規模の空中画像を統合した新しいマルチスケールアプローチを提案します。水中画像は自律型水上車両(ASV)を使用してキャプチャされ、空中画像はドローンを使用して取得されます。水中画像に基づいて、さまざまなサンゴの形態型や関連する動物群、そして生息環境をカバーする31のクラスの存在を検出するために、トランスフォーマーに基づく深層学習モデルが訓練されます。この予測は、空中画像に適用される第二のモデルの訓練のための注釈として機能します。情報のスケール間転送は、水中画像のフットプリントと空中画像のタイル間の部分的な重なりを考慮した加重フットプリント手法によって実現されます。結果は、マルチスケール方法論が細部の分類をより広いサンゴ礁地域に成功裏に拡張し、サンゴの形態型と関連する生息環境を高い精度で予測できることを示しています。この手法は、水中由来の注釈と実地データとの間に強い一致を示し、AUC(曲線下面積)スコア0.9251によって反映されています。これは、水中画像と空中画像の統合が、深層学習モデルによって支えられ、スケーラブルで正確なサンゴ礁の評価を促進できることを示しています。本研究は、マルチスケールの画像とAIを組み合わせることで、サンゴ礁のモニタリングと保全を促進できる可能性を示しています。我々のアプローチは、水中画像と空中画像の強みを活用し、細部分析の精度を確保しつつ、より広いサンゴ礁地域をカバーすることを可能にします。
2025-02-25T06:12:33
Science Across Languages: Assessing LLM Multilingual Translation of Scientific Papers
http://arxiv.org/abs/2502.17882v1
Hannah Calzi Kleidermacher, James Zou
Stanford University
科学研究は本質的にグローバルなものです。しかし、学術雑誌の大多数は英語でのみ発行されており、英語を母国語としない研究者には障壁を生じています。本研究では、発表された科学記事を翻訳するために大規模言語モデル(LLM)を活用し、ネイティブのJATS XMLフォーマットを保持しながら、学術雑誌による実装のための実用的で自動化されたアプローチを開発します。このアプローチを使用して、私たちは複数の科学分野の論文を28の言語に翻訳しました。翻訳の正確性を評価するために、オリジナルのテキストから理解に基づいた質問を生成し、翻訳されたテキストに基づいてそれらに答えるという新しい質問応答(QA)ベンチマーク手法を導入しました。本ベンチマークの結果は平均95.9%のパフォーマンスを示しており、重要な科学的詳細が正確に伝達されていることを示しています。また、ユーザー調査において、15人の研究者の科学論文を彼らの母国語に翻訳し、著者たちが翻訳が原文の情報を正確に捉えていると一貫して評価したことがわかりました。興味深いことに、著者の3分の1が多くの専門用語が「過剰翻訳」されていると感じ、英語での翻訳を不変に保つことを好むとの意見を表明しました。最後に、文脈内学習技術がどのようにして翻訳を特定の領域の好みに合わせるために使用できるかを示し、過剰翻訳の軽減などにおける柔軟性とLLM駆動の科学翻訳の有用性を強調します。コードと翻訳された記事は https://hankleid.github.io/ProjectMundo で入手可能です。
2025-02-25T06:08:48
Contrastive Learning with Nasty Noise
http://arxiv.org/abs/2502.17872v1
Ziruo Zhao
stevens.edu
対照学習は、自己教師あり表現学習のための強力なパラダイムとして浮上しています。この研究は、悪意のあるノイズの下における対照学習の理論的限界を分析します。ここでは、敵対者がトレーニングサンプルを変更または置き換える状況について考察しています。PAC学習とVC次元分析を用いて、敵対的状況におけるサンプルの複雑さに関する下限と上限を確立しました。さらに、l2距離関数に基づくデータ依存のサンプル複雑さの境界が導出されています。
2025-02-25T05:55:15
ASurvey: Spatiotemporal Consistency in Video Generation
http://arxiv.org/abs/2502.17863v1
Zhiyu Yin, Kehai Chen, Xuefeng Bai, Ruili Jiang, Juntao Li, Hongdong Li, Jin Liu, Yang Xiang, Jun Yu, Min Zhang
Harbin Institute of Technology, Soochow University, Central South University, Peng Cheng Laboratory
ビデオ生成は、動的な視覚生成手法を活用することで、人工知能生成コンテンツ (AIGC) の限界を押し広げます。ビデオ生成は静的画像生成を超える独自の課題を提示し、高品質な個々のフレームと、時空間の整合性を維持するためのTemporal Coherenceが必要です。最近の研究はビデオ生成における時空間の整合性の問題に取り組んできましたが、この観点から整理された文献レビューはほとんどありません。このギャップは、高品質なビデオ生成の背後にあるメカニズムをより深く理解することを妨げています。本調査では、ビデオ生成における最近の進展を体系的にレビューし、基盤モデル、情報表現、生成スキーム、ポストプロセッシング技術、評価指標の5つの重要な側面をカバーします。特に、時空間の整合性を維持するための貢献に焦点を当てます。最後に、本分野における今後の方向性と課題について議論し、ビデオ生成の発展に向けたさらなる努力を促すことを期待しています。
2025-02-25T05:20:51
A Survey of Zero-Knowledge Proof Based Verifiable Machine Learning
http://arxiv.org/abs/2502.18535v1
Zhizhi Peng, Taotao Wang, Chonghe Zhao, Guofu Liao, Zibin Lin, Yifeng Liu, Bin Cao, Long Shi, Qing Yang, Shengli Zhang
Shenzhen University, Beijing University of Posts and Telecommunications, Nanjing University of Science and Technology
機械学習技術がさまざまな領域で急速に進歩する中、データプライバシーとモデルセキュリティに関する懸念が大きく高まっています。特に、ユーザーの端末の計算リソースの制限により、モデルがクラウドプラットフォームやサードパーティのサーバーでトレーニングおよびデプロイされる際に、これらの課題は特に顕著です。その対策として、ゼロ知識証明(ZKP)技術が有望な解決策として登場し、機密データを開示することなく、トレーニングと推論のプロセスにおけるモデルのパフォーマンスと信頼性を効果的に検証することが可能になりました。このように、ZKPは機械学習モデルの検証可能性とセキュリティを保証し、プライバシーを保護するAIの貴重なツールとなっています。ZKPを活用した検証可能な機械学習ソリューションに関する研究がいくつか存在しますが、これらの取り組みの包括的な調査と要約はまだありません。この調査論文は、2017年6月から2024年12月までの既存のゼロ知識機械学習(ZKML)研究をレビューおよび分析することで、このギャップを埋めることを目的としています。最初に、ZKMLの概念を紹介し、検証可能なトレーニング、検証可能な推論、検証可能なテストの3つの主要カテゴリにわたるZKPアルゴリズムのセットアップを概説します。次に、これらのカテゴリ内の既存のZKML研究を包括的に分類し、詳細に分析します。さらに、この分野で直面している実装上の課題を探り、これらの障害に対処するための改善作業について議論します。また、ZKML技術の商業的な応用例をいくつか紹介します。最後に、この分野での今後の進展の有望な方向性を提案します。
2025-02-25T05:04:27
A Combinatorial Identities Benchmark for Theorem Proving via Automated Theorem Generation
http://arxiv.org/abs/2502.17840v1
Beibei Xiong, Hangyu Lv, Haojia Shan, Jianlin Wang, Zhengfeng Yang, Lihong Zhi
East China Normal University, Henan University, Chinese Academy of Sciences
大規模言語モデル(LLM)は形式的な定理証明の分野を大きく進展させましたが、高品質なトレーニングデータの不足が複雑な数学分野におけるその能力を制約しています。数学の礎である組合せ論は、離散構造を分析し最適化問題を解決するための重要なツールを提供します。しかし、その内在する複雑さのために、組合せ的同一性に対する自動定理証明(ATP)は特に困難です。これに対処するために、私たちは独自にLeanでの組合せ的同一性ベンチマークであるLeanCombを構築しました。これは、私たちの知る限り、組合せ的同一性のために構築された最初の形式化された定理証明のベンチマークです。私たちは組合せ的同一性のための自動定理生成器(ATG4CI)を開発し、自己改善型の大規模言語モデルによって提案された候補戦術と強化学習木探索アプローチを組み合わせて戦術予測を行います。ATG4CIを利用することで、260Kの組合せ的同一性定理、および各定理のLeanにおける完全な形式証明を含むLeanComb拡張データセットを生成します。実験的評価は、このデータセットで訓練されたモデルがより効果的な戦術を生成でき、組合せ的同一性における自動定理証明の成功率を向上させることを示しています。
2025-02-25T04:41:49
Say Less, Mean More: Leveraging Pragmatics in Retrieval-Augmented Generation
http://arxiv.org/abs/2502.17839v2
Haris Riaz, Ellen Riloff, Mihai Surdeanu
University of Arizona
私たちは、取得したコンテキストの有用性を向上させるために、Dense Passage Retrievalなどの取得強化生成(RAG)フレームワークに実用的な原則を注入するシンプルで教師なしの方法を提案します。私たちのアプローチでは、まずRAGによって取得された文書のプール内で、現在の質問に最も関連性の高い文を特定し、入力された質問で扱われるすべてのトピックをカバーし、それ以上は含めないようにし、次にそれらの文をコンテキスト内で際立たせた後、LLMに提供します。この際、コンテキストを切り捨てたり、他の方法で変更したりすることはありません。このシンプルなアイデアが、異なる5つのLLMを使用した3つの質問応答タスク(ARC-Challenge、PubHealth、PopQA)における実験で一貫した改善をもたらすことを示します。特に、従来のRAGシステムと比較して、PubHealthで最大19.7%、ARC-Challengeで10%の相対的な精度向上を実現します。
2025-02-25T04:38:38
MM-PoisonRAG: Disrupting Multimodal RAG with Local and Global Poisoning Attacks
http://arxiv.org/abs/2502.17832v1
Hyeonjeong Ha, Qiusi Zhan, Jeonghwan Kim, Dimitrios Bralios, Saikrishna Sanniboina, Nanyun Peng, Kai-wei Chang, Daniel Kang, Heng Ji
University of Illinois Urbana-Champaign, University of California Los Angeles
マルチモーダル大規模言語モデル(MLLM)は、検索強化生成(RAG)を利用して、豊富なパラメトリック知識と動的な外部知識を活用し、質問応答などのタスクで優れたパフォーマンスを発揮します。RAGは、クエリに関連する外部知識に基づいて応答を強化しますが、この依存は重要でありながらあまり探求されていない安全リスクをもたらします。それは、知識汚染攻撃です。これは、誤情報や無関係な知識が意図的に外部知識ベースに注入され、モデルの出力を不正確で有害なものに操作するものです。マルチモーダルRAGにおけるこのような脆弱性を明らかにするために、我々はMM-PoisonRAGという新しい知識汚染攻撃フレームワークを提案します。これには、ターゲットを絞った操作のためにテキストと画像の両方にクエリ固有の誤情報を注入するLocalized Poisoning Attack(LPA)と、すべてのクエリに対して無意味な応答を引き出すためにMLLM生成中に偽のガイダンスを提供するGlobalized Poisoning Attack(GPA)の2つの攻撃戦略が含まれています。私たちは、複数のタスク、モデル、およびアクセス設定で攻撃を評価し、LPAが多くの質問への回答を56%の成功率で攻撃者が制御するようにMLLMを成功裏に操作できることを示しました。さらに、GPAは、1回の無関係な知識の注入だけでモデルの生成を完全に妨げ、精度を0%にします。我々の結果は、マルチモーダルRAGフレームワークを保護するために、知識汚染に対する堅牢な防御の必要性を強調しています。
2025-02-25T04:23:59
MAFE: Multi-Agent Fair Environments for Decision-Making Systems
http://arxiv.org/abs/2502.18534v1
Zachary McBride Lazri, Anirudh Nakra, Ivan Brugere, Danial Dervovic, Antigoni Polychroniadou, Furong Huang, Dana Dachman-Soled, Min Wu
静的な文脈における機械学習(ML)モデルへの公平性制約の適用は、時間の経過とともに人口統計グループ間で悪影響を及ぼす可能性があることが示されています。この問題に対処するため、最近の研究は時間が経過しても持続する公平な解決策の創出に焦点を当てています。多くのアプローチはこれを単一エージェントの意思決定問題として扱いますが、実世界のシステムはしばしば結果に影響を与える複数の相互作用するエンティティで構成されています。これらのエンティティをエージェントとして明示的にモデル化することで、介入の柔軟な分析とシステムの基盤となるダイナミクスに対する影響が可能になります。マルチエージェントシステムの研究を行う上での重要な課題は、分析のために限られた現実世界のデータを活用できる現実的な環境が不足していることです。このギャップに対処するため、マルチエージェント公平環境(MAFE)の概念を導入し、異なる社会システムをモデル化した三つのMAFEを提示・分析します。実験結果は、マルチエージェント公平アルゴリズムの開発のためのテストベッドとしてのMAFEの有用性を示しています。
2025-02-25T04:03:50
CAML: Collaborative Auxiliary Modality Learning for Multi-Agent Systems
http://arxiv.org/abs/2502.17821v1
Rui Liu, Yu Shen, Peng Gao, Pratap Tokekar, Ming Lin
マルチモダリティ学習は、自律運転、ロボティクス、知覚システムといった分野での機械学習アプリケーションのパフォーマンスを向上させるための重要な技術となっています。既存のフレームワークである補助モダリティ学習(AML)は、訓練中に複数のデータソースを効果的に利用し、モダリティを減らした状態での推論を可能にしますが、主に単一エージェントのコンテキストで動作します。この制限は、接続された自律車両(CAV)などの動的環境では特に重要で、完全なデータカバレッジが意思決定の盲点を引き起こす可能性があります。これらの課題に対処するため、私たちは協調補助モダリティ学習(CAML)を提案します。これはエージェントが訓練中に協力してマルチモーダルデータを共有し、テスト時には各エージェントごとにモダリティを減らした状態での推論を可能にする新しいマルチエージェント・マルチモダリティフレームワークです。私たちは、CAMLの不確実性削減とデータカバレッジの観点からその効果を系統的に分析し、AMLに対する利点について理論的な洞察を提供します。事故が発生しやすいシナリオにおけるCAVの協調的な意思決定に関する実験結果は、CAMLが最大で58.13%の事故検出の改善を達成することを示しています。さらに、私たちは実世界の空中-地上ロボットデータにおける協調的意味セグメンテーションに対してCAMLを検証し、mIoUで最大10.61%の改善を達成しました。
2025-02-25T03:59:40
An Overview of Large Language Models for Statisticians
http://arxiv.org/abs/2502.17814v1
Wenlong Ji, Weizhe Yuan, Emily Getzen, Kyunghyun Cho, Michael I. Jordan, Song Mei, Jason E Weston, Weijie J. Su, Jing Xu, Linjun Zhang
Stanford University, New York University, Meta FAIR, University of Pennsylvania, UC Berkeley, INRIA, Rutgers University
大規模言語モデル(LLM)は、人工知能(AI)において変革をもたらすツールとして現れ、テキスト生成、推論、意思決定などの多様なタスクにおいて驚くべき能力を示しています。彼らの成功は主に計算能力と深層学習アーキテクチャの進歩によって推進されてきましたが、不確実性の定量化、意思決定、因果推論、分布のシフトなどの領域で新たに浮上している問題は、統計学の分野とより深く関わることを必要としています。本論文では、統計学者が信頼性と透明性を人間のユーザーに提供することを目的としたLLMの開発に対して重要な貢献をする可能性のある分野を探ります。そのため、私たちは不確実性の定量化、解釈可能性、公平性、プライバシー、ウォーターマーキング、およびモデル適応などの問題に焦点を当てます。また、統計分析におけるLLMの可能な役割についても考察します。AIと統計学をつなぐことで、LLMの理論的基礎と実践的応用の両方を進展させるより深いコラボレーションを促進し、最終的には複雑な社会的課題に対処する上での彼らの役割を形作ることを目指します。
2025-02-25T03:40:36
DocPuzzle: A Process-Aware Benchmark for Evaluating Realistic Long-Context Reasoning Capabilities
http://arxiv.org/abs/2502.17807v1
Tianyi Zhuang, Chuqiao Kuang, Xiaoguang Li, Yihua Teng, Jihao Wu, Yasheng Wang, Lifeng Shang
Huawei Inc.
私たちは、DocPuzzleを提示します。これは、大規模言語モデル(LLM)の長文コンテキスト推論能力を評価するために慎重に構築されたベンチマークです。このベンチマークは、長い実世界の文書においてマルチステップの推論を必要とする100の専門レベルのQA問題で構成されています。タスクの質と複雑さを確保するために、私たちは人間とAIの協働によるアノテーション・バリデーションパイプラインを実施しています。DocPuzzleは、チェックリストに基づくプロセス分析を通じて推測バイアスを軽減する革新的な評価フレームワークを導入しており、LLMの推論能力を評価するための新しい基準を確立しています。我々の評価結果は次のことを示しています:1)o1-preview(69.7%)やDeepSeek-R1(66.3%)のような高度なスロースロー思考推論モデルがClaude 3.5 Sonnet(57.7%)のような一般的な指示モデルを大きく上回ること;2)DeepSeek-R1-Distill-Qwen-32B(41.3%)のような蒸留推論モデルは教師モデルに大きく後れを取っており、蒸留のみに依存する推論能力の一般化を維持することの難しさを示唆しています。
2025-02-25T03:29:53
CuDIP: Enhancing Theorem Proving in LLMs via Curriculum Learning-based Direct Preference Optimization
http://arxiv.org/abs/2502.18532v1
Shuming Shi, Ruobing Zuo, Gaolei He, Jianlin Wang, Chenyang Xu, Zhengfeng Yang
自動定理証明(ATP)は、大規模言語モデル(LLM)にとって最も難しい数学的推論タスクの一つです。既存のLLMベースのATP方法のほとんどは、教師ありファインチューニングに依存しており、その結果、定理証明プロセスと人間の好みとの間に限られた整合性が生じています。人間の好みにLLMを整合させる直接的な好み最適化(DPO)は、一部のタスクに対してポジティブな効果を示しています。しかし、定理証明のための高品質な好みデータの不足は大きな課題です。本論文では、DPOを形式的な自動定理証明に革新的に適用し、カリキュラム学習に基づくDPO反復定理証明(CuDIP)方法を紹介します。具体的には、LLMと既存の定理証明データを活用して、好みデータの多様性を高めつつ、人間の好みアノテーションへの依存を減らすための好みデータ構築方法を提案します。そして、この好みデータ構築方法をカリキュラム学習と統合し、DPOを通じて定理証明モデルを反復的にファインチューニングします。MiniF2FおよびProofNetデータセットでの実験結果は、提案する方法の効果を示しています。
2025-02-25T03:07:02
Research on Enhancing Cloud Computing Network Security using Artificial Intelligence Algorithms
http://arxiv.org/abs/2502.17801v1
Yuqing Wang, Xiao Yang
クラウドコンピューティング環境は、分散型サービス拒否(DDoS)攻撃やSQLインジェクションなどのセキュリティ脅威に対してますます脆弱になっています。ルールマッチングや特徴認識に基づく従来のセキュリティメカニズムは、進化する攻撃戦略に適応するのに苦労しています。本論文では、深層学習を活用した適応型セキュリティ保護フレームワークを提案し、多層防御アーキテクチャを構築します。提案されたシステムは、実世界のビジネス環境で評価され、97.3%の検出精度、18ミリ秒の平均応答時間、99.999%の可用性率を達成しました。実験結果は、提案された手法が検出精度、応答効率、リソース利用率を大幅に向上させ、クラウドコンピューティングセキュリティに対する新しく効果的なアプローチを提供することを示しています。
2025-02-25T03:06:40
Synthia: Novel Concept Design with Affordance Composition
http://arxiv.org/abs/2502.17793v1
Xiaomeng Jin, Hyeonjeong Ha, Jeonghwan Kim, Jiateng Liu, Zhenhailong Wang, Khanh Duy Nguyen, Ansel Blume, Nanyun Peng, Kai-wei Chang, Heng Ji
University of Illinois Urbana-Champaign, University of California Los Angeles
テキストから画像へのモデル(T2I)は、迅速なコンセプト設計を可能にし、AI駆動のデザインで広く使用されています。最近の研究は、与えられたデザインコンセプトの意味的およびスタイル的なバリエーションの生成に焦点を当てていますが、機能的整合性 - 複数のアフォーダンスを単一の整合性のあるコンセプトに統合すること - は大きく見落とされています。本論文では、希望するアフォーダンスに基づいて新しい機能的に整合したデザインを生成するためのフレームワークSYNTHIAを紹介します。我々のアプローチは、コンセプトをパーツとアフォーダンスに分解する階層的なコンセプトオントロジーを利用しており、機能的に整合したデザインの重要な構成要素となります。また、我々は、視覚的な新規性を維持しつつアフォーダンスの構成を段階的に学ぶために、我々のオントロジーに基づいたカリキュラム学習スキームを開発しました。具体的には、(i) アフォーダンスの距離を徐々に増加させ、基本的なコンセプトとアフォーダンスの関連付けから、異なるアフォーダンスの部分を統合して単一の整合性のある形にする複雑なアフォーダンス構成へとモデルを導き、(ii) 既存のコンセプトから学習した表現を遠ざけるためにコントラスト目的を適用することで視覚的な新規性を強化します。実験結果は、SYNTHIAが最先端のT2Iモデルを上回り、ヒト評価における新規性と機能的整合性についてそれぞれ25.1%と14.7%の絶対的な向上を示すことを明らかにしています。
2025-02-25T02:54:11
AIR: Complex Instruction Generation via Automatic Iterative Refinement
http://arxiv.org/abs/2502.17787v2
Wei Liu, Yancheng He, Hui Huang, Chengwei Hu, Jiaheng Liu, Shilong Li, Wenbo Su, Bo Zheng
Alibaba Group
大規模言語モデルの開発により、それらが簡単な指示に従う能力は大幅に向上しました。しかし、複雑な指示に従うことは依然として大きな課題です。現在の複雑な指示を生成するアプローチは、現在の指示の要求と無関係な場合が多く、スケーラビリティや多様性が限られています。さらに、バックトランスレーションのような手法は、簡単な指示生成には効果的ですが、大規模なウェブコーパスの豊富なコンテンツや構造を活用することができません。本論文では、制約を持つ複雑な指示を生成するための新しい自動反復改良フレームワークを提案します。このフレームワークは、実際のシナリオの要求をより適切に反映するだけでなく、LLMが複雑な指示に従う能力を大幅に向上させます。AIRフレームワークは2つの段階で構成されています:(1) ドキュメントから初期指示を生成する;(2) LLMを判断者として利用し、モデルの出力とドキュメントを比較することで価値ある制約を取り入れながら指示を反復的に改良する。最終的に、10,000の複雑な指示を含むAIR-10Kデータセットを構築し、私たちのアプローチで生成された指示が、モデルの複雑な指示に従う能力を大幅に向上させることを示し、従来の指示生成手法を上回る結果を出しました。
2025-02-25T02:39:57
Uncertainty Quantification for LLM-Based Survey Simulations
http://arxiv.org/abs/2502.17773v1
Chengpiao Huang, Yuhang Wu, Kaizheng Wang
Columbia University, Columbia Business School
私たちは、大規模言語モデル(LLM)からのシミュレーション調査応答の信頼できる使用を、不確実性定量化の観点から調査します。我々のアプローチは、合成データを人間の応答の母集団パラメータに対する信頼区間に変換し、シミュレーションされた母集団と実際の母集団間の分布のシフトに対処します。主な革新は、シミュレーションされた応答の最適な数を決定することにあります。応答が多すぎると、カバレッジが不十分な過度に狭い信頼区間が生成され、少なすぎると過度に緩い推定が得られます。この問題を解決するために、我々の方法は、シミュレーションサンプルサイズを適応的に選択し、平均的なケースでのカバレッジの保証を正当なものにします。この方法は、信頼区間を構築する手順に関係なく、あらゆるLLMに広く適用可能です。さらに、選択されたサンプルサイズは、LLMとターゲットの人間母集団との不整合の程度を定量化します。我々は、実際のデータセットとLLMにおいてこの方法を示します。
2025-02-25T02:07:29
Enhancing Hepatopathy Clinical Trial Efficiency: A Secure, Large Language Model-Powered Pre-Screening Pipeline
http://arxiv.org/abs/2502.18531v1
Xiongbin Gui, Hanlin Lv, Xiao Wang, Longting Lv, Yi Xiao, Lei Wang
背景:肝細胞癌や肝硬変など、複雑な肝疾患に関わるコホートの募集には、意味的に複雑な基準の解釈が必要なことが多い。従来の手動スクリーニング方法は時間がかかり、エラーが発生しやすい。AIを活用した事前スクリーニングは潜在的な解決策を提供するものの、精度、効率、データプライバシーに関する課題が残る。方法:我々は、臨床の専門知識を活用して、大規模言語モデルの正確で安全、かつ効率的な適用を導く新しい患者事前スクリーニングパイプラインを開発した。このパイプラインは、複雑な基準を一連の複合的な質問に分解し、電子健康記録を通じて意味的な質問応答を実行するために2つの戦略を採用する - (1) パスウェイA、擬人化した専門家の思考の連鎖戦略、(2) パスウェイB、特に複雑な臨床推論シナリオの管理におけるエージェントコラボレーション内の設定された立場戦略。このパイプラインは、質問レベルおよび基準レベルの両方で、精度、時間消費、反実仮想推論の3つの重要な指標で評価される。結果:我々のパイプラインは、精度の高い結果を達成した(基準レベルで0.921)と効率性(タスクあたり0.44秒)。パスウェイBは複雑な推論において優れており、パスウェイAはデータ抽出を正確に行い、処理時間が速かった。両方のパスウェイは同等の精度を達成した。パイプラインは、肝細胞癌(0.878)および肝硬変試験(0.843)でも有望な結果を示した。結論:このデータセキュアで時間効率の良いパイプラインは、肝疾患の試験において高い精度を示し、臨床試験のワークフローを効率化する有望なソリューションを提供する。効率性と適応性により、患者募集を改善するのに適している。また、リソースが限られた環境でも機能する能力は、臨床環境での有用性をさらに高める。
2025-02-25T02:06:39
Sample Selection via Contrastive Fragmentation for Noisy Label Regression
http://arxiv.org/abs/2502.17771v1
Chris Dongjoo Kim, Sangwoo Moon, Jihwan Moon, Dongyeon Woo, Gunhee Kim
Seoul National University, LG AI Research
多くの他の問題と同様に、実世界の回帰問題はノイズの多いラベルの存在に悩まされており、これは避けられない問題であり、私たちの注意を必要とします。幸いなことに、多くの実世界データは、ラベルと特徴の間の連続的に秩序された相関という内在的な特性を示すことが多く、類似のラベルを持つデータポイントは、密接に関連した特徴でも表現されています。それに応じて、私たちはConFragという新しいアプローチを提案します。これは、回帰データを切り離された対照的な断片化ペアに変換することで、共同でモデル化するものです。これにより、より特徴的な表現のトレーニングが可能となり、クリーンサンプルを選択する能力が向上します。私たちのConFragフレームワークは、専門的な特徴抽出器間の近隣合意を通じて、ノイズの多いラベルを識別するために隣接する断片の混合を活用します。私たちは、年齢予測、価格予測、音楽制作年度推定など、さまざまな分野の新たにキュレーションされた6つのベンチマークデータセットで広範な実験を行いました。また、異なる程度のラベルノイズをより適切に考慮するために、エラーレジデュアル比(ERR)という指標を導入しました。私たちのアプローチは、対称的およびランダムなガウスラベルノイズに対して堅牢であり、14の最先端ベースラインを一貫して上回っています。
2025-02-25T02:04:14
DeepSeek vs. ChatGPT: A Comparative Study for Scientific Computing and Scientific Machine Learning Tasks
http://arxiv.org/abs/2502.17764v1
Qile Jiang, Zhiwei Gao, George Em Karniadakis
Brown University
大規模言語モデル(LLM)は、科学計算、特に偏微分方程式(PDE)の解法におけるさまざまな問題に対処するための強力なツールとして現れました。しかし、異なるモデルは異なる強みと好みを示し、パフォーマンスのレベルにも差が生じています。本論文では、計算上の課題に取り組む際の最も先進的なLLMであるChatGPTとDeepSeek、およびそれらの推論最適化バージョンの能力を比較します。具体的には、科学計算における伝統的な数値問題の解決能力や、PDEベースの問題に対する科学的機械学習技術の活用の proficiency を評価します。すべての実験は、ニューラルオペレーター学習に必要な入力関数の適切な空間を定義するなど、重要な決定が求められるように設計しました。我々の調査結果は、最新のモデルであるChatGPT o3-mini-highが通常最も正確な結果を提供し、またその推論対応のDeepSeek R1よりも著しく高速に応答することを明らかにしています。この向上した速度と精度により、ChatGPT o3-mini-highはこの時点での多様な計算タスクにとってより実用的かつ効率的な選択となります。
2025-02-25T01:49:50
Design and implementation of a distributed security threat detection system integrating federated learning and multimodal LLM
http://arxiv.org/abs/2502.17763v1
Yuqing Wang, Xiao Yang
従来のセキュリティ保護方法は、大規模分散システムにおける高度な攻撃ベクトルに対処するのが難しく、特に検出精度とデータプライバシーの懸念を両立させるのが課題です。本論文では、フェデレーテッドラーニングとマルチモーダル大規模言語モデル(LLM)を統合した新しい分散型セキュリティ脅威検出システムを提案します。私たちのシステムは、フェデレーテッドラーニングを活用してデータのプライバシーを確保しながら、ネットワークトラフィック、システムログ、画像、およびセンサーデータなどの異種データソースを処理するためにマルチモーダルLLMを使用します。10TBの分散データセットでの実験評価において、私たちのアプローチは96.4%の検出精度を達成し、従来のベースラインモデルを4.1ポイント上回りました。システムは、それぞれ1.8ポイントと2.4ポイントの偽陽性率と偽陰性率の低減を実現しています。パフォーマンス分析では、私たちのシステムが分散環境において効率的な処理能力を維持し、モデルのトレーニングに180秒、分散ネットワーク全体での脅威検出に3.8秒を要することが示されています。これらの結果は、データプライバシーを保持しながら検出精度と計算効率の大幅な向上を示しており、大規模セキュリティシステムにおける実世界での導入の強い可能性を示唆しています。
2025-02-25T01:44:08
Graded Neural Networks
http://arxiv.org/abs/2502.17751v1
Tony Shaska
Oakland University
この論文は、代数的なgradingを組み込むことによって古典的な神経アーキテクチャを拡張した、graded vector spaces $\V\wn$ 上に構築された新しいフレームワークであるgraded neural networks (GNNs) を提案します。スカラー作用 $\lambda \star \x = (\lambda^{q_i} x_i)$ によって定義された座標別のgrading構造を活用し、タプル $\w = (q_0, \ldots, q{n-1})$ によって管理される、特徴の重要性に適応するgradedニューロン、層、活性化関数、損失関数を導入します。graded空間の理論的特性が確立され、その後、数値安定性や勾配のスケーリングといった計算上の課題に対処する包括的なGNN設計が続きます。潜在的な応用は、機械学習やフォトニックシステムにわたり、高速レーザー技術を活用した実装によって例示されます。この研究は、数学的厳密さと実用的な可能性を統一するgraded計算への基礎的な一歩を提供し、将来の経験的およびハードウェア探索のための道を切り開きます。
2025-02-25T01:08:07
Detection of LLM-Paraphrased Code and Identification of the Responsible LLM Using Coding Style Features
http://arxiv.org/abs/2502.17749v1
Shinwoo Park, Hyundong Jin, Jeong-won Cha, Yo-Sub Han
Yonsei University, Changwon National University
大規模言語モデル(LLM)を用いたコード生成の最近の進展は、知的財産保護に関する深刻な懸念を引き起こしています。悪意のあるユーザーはLLMを利用して、元のコードに非常に似たパラフレーズ版の独自コードを生成することができます。LLMによるコードのパラフレーズの可能性が高まっている中で、それを検出するための研究は限られており、検出システムの緊急な必要性が浮き彫りになっています。このニーズに応えるため、私たちは2つのタスクを提案します。第一のタスクは、LLMが生成したコードが元の人間が書いたコードのパラフレーズ版であるかどうかを検出することです。第二のタスクは、元のコードがパラフレーズされるのに使用されるLLMを特定することです。これらのタスクのために、さまざまなLLMを使用して人間が書いたコードとLLMによってパラフレーズされたコードのペアからなるデータセットLPcodeを構築しました。私たちは、命名の一貫性、コードの構造、および可読性の観点から、人間が書いたコードとLLMによってパラフレーズされたコードのコーディングスタイルに有意な差があることを統計的に確認しました。これらの発見に基づいて、私たちは、人間が書いたコードとLLM生成コードとの間のパラフレーズ関係を特定し、どのLLMがパラフレーズに使用されているかを発見する検出手法LPcodedecを開発しました。LPcodedecは、2つのタスクにおいて最良のベースラインを上回り、それぞれF1スコアを2.64%および15.17%向上させ、速度はそれぞれ1,343倍および213倍向上しました。
2025-02-25T00:58:06
Heterogeneous Decision Making in Mixed Traffic: Uncertainty-aware Planning and Bounded Rationality
http://arxiv.org/abs/2502.18529v1
Hang Wang, Qiaoyi Fang, Junshan Zhang
University of California, Davis
過去数年間、オートメーテッドビークル(AV)の導入が急速に進展しました。明らかに、AVと人間運転車(HV)は長年にわたって共存し、AVはHV、歩行者、自転車乗りなどの周辺で運転しなければならず、混合交通に対応できるための根本的な突破口がAIに求められます。このような動機から、私たちは混合交通環境におけるAVとHVの異種意思決定を研究し、人間と機械の意思決定の相互作用を捉え、車両が安全かつ効率的に運転できるようにするAI基盤の開発を目指しています。混合自律を達成するには、いくつかの課題があります。1) 人間ドライバーは限界のある合理性で運転決定を下すため、HVの意思決定に関する正確なモデルを開発することが未解決のままです。2) 不確実性を考慮した計画は、AVが人間の行動に応じて安全な回避行動を取るために重要な役割を果たします。本論文では、HVが限界のある合理性で意思決定を行い、AVがHVの将来の行動の予測に基づく不確実性を考慮した計画を行うAV-HV相互作用の定式化を紹介します。AVとHVの学習の後悔に関する包括的な分析を行い、以下の質問に答えます:1) {学習性能はHVの限界合理性とAVの計画にどのように依存するか}; 2) {異なる意思決定戦略は全体の学習性能にどのように影響するか}? 私たちの発見は、AVの学習性能におけるグッドハートの法則や、HVの意思決定プロセスにおける複合効果など、いくつかの興味深い現象を明らかにします。後悔の動態を調査することで、人間と機械の意思決定の相互作用に関する洞察を得ることができます。
2025-02-25T00:32:33
2025-02-24 arXiv論文リスト(cs.AI)
About
arXivに掲載されたcs.AIの論文を検索し、一部をリスト化したものです。
※AIによってAbstractを日本語に翻訳しており、内容に誤りがある可能性があります。
リスト件数: 157件
リストから抽出されたキーワード: Data Augmentation, Multi-Agent Systems, Uncertainty Quantification
LLM Inference Acceleration via Efficient Operation Fusion
http://arxiv.org/abs/2502.17728v1
Mahsa Salmani, Ilya Soloveychik
d-Matrix, None
近年、トランスフォーマーベースの大規模言語モデル(LLM)の急速な発展は、これらのモデルのサイズの急増と密接に関連しています。多くのLLMは数千億のパラメータを含み、トレーニングや推論には専用のハードウェアリソースが必要です。トランスフォーマーアーキテクチャに内在する主な課題の一つは、正規化を伴う多くの非線形変換をサポートする必要があることです。例えば、各デコーダーブロックには通常、少なくとも1つのソフトマックス操作と2つのレイヤーノルムが含まれています。対応する正規化スケーリングファクターの計算は、空間的集約操作を必要とするため、主要なボトルネックとなります。言い換えれば、ソフトマックスやレイヤーノルムの分母の計算に関しては、全てのベクトル要素を1つの場所に集約する必要があり、かなりの通信が求められます。これらの集約操作は、トランスフォーマーの推論を約20%遅くし、分散メモリ計算の本来の目的を損ないます。本研究では、このような集約操作によって引き起こされるオーバーヘッドを完全に隠すことができる非常に効率的な手法を提案します。注意すべき点は、各ソフトマックスおよびレイヤーノルム操作は通常、線形層に続くということです。非線形操作と線形操作は異なるハードウェアエンジンで実行されるため、代数がその交換を許すとき、簡単に並列化できます。線形操作の固有の特性を利用して、前のソフトマックスとレイヤーノルムの正規化を線形層が計算された後まで遅延させることができます。これにより、行列の乗算と同時に集約スケーリングファクターを計算でき、前者の待ち時間を後者の背後に完全に隠すことが可能です。このような並列化は数値的な精度を保持しつつ、ハードウェアの利用効率を大幅に向上させ、全体の待ち時間を削減します。
2025-02-24T23:42:37
The GigaMIDI Dataset with Features for Expressive Music Performance Detection
http://arxiv.org/abs/2502.17726v1
Keon Ju Maverick Lee, Jeff Ens, Sara Adkins, Pedro Sarmento, Mathieu Barthet, Philippe Pasquier
ミュージカル・インストゥルメント・デジタル・インターフェース(MIDI)は、1983年に導入され、コンピュータと楽器が効率的に通信できるようにすることで音楽制作に革命をもたらしました。MIDIファイルは音楽指示をコンパクトにエンコードし、便利な音楽共有を促進します。これらは音楽情報検索(MIR)に利益をもたらし、音楽理解、計算音楽学、および生成音楽に関する研究を支援します。GigaMIDIデータセットには、140万以上のユニークなMIDIファイルが含まれており、18億のMIDIノートイベントおよび530万以上のMIDIトラックを網羅しています。GigaMIDIは現在、研究目的に使用されるMIDI形式の象徴的音楽の中で最大のコレクションです。非表現的なMIDIトラックと表現的なMIDIトラックの区別は難しく、MIDIファイル自体がこの区分を明示的に行うわけではありません。この問題に対処するため、表現的な音楽パフォーマンスを検出するための一連の革新的なヒューリスティックスを紹介します。これには、MIDIノートのベロシティを分析する「独特なノート速度比率(DNVR)」ヒューリスティック、ノートの発音時間の偏差を調べる「独特なノート発音偏差比率(DNODR)」ヒューリスティック、およびメトリックレベルに対する発音位置を評価する「ノート発音中央値メトリックレベル(NOMML)」ヒューリスティックが含まれます。私たちの評価は、これらのヒューリスティックスが非表現的なMIDIトラックと表現的なMIDIトラックを効果的に区別できることを示しています。さらに、評価の後、私たちはヒューリスティックNOMMLを利用して最も大規模な表現的MIDIデータセットを作成します。このキュレーションされたGigaMIDIの反復は、NOMMLによって検出された表現的に演奏された楽器トラックを含み、全ての一般的なMIDI楽器を含むもので、GigaMIDIデータセットの31%を占め、合計1,655,649トラックとなります。
2025-02-24T23:39:40
Solving the Traveling Salesman Problem via Different Quantum Computing Architectures
http://arxiv.org/abs/2502.17725v1
Venkat Padmasola, Zhaotong Li, Rupak Chatterjee, Wesley Dyk
Stevens Institute of Technology, New York University, Quantum Computing Inc.
私たちは、旅行セールスマン問題(TSP)というよく知られたNP困難な最適化問題を解決するために新興の光フォトニクスおよび量子コンピューティングアーキテクチャの応用を研究しています。いくつかのアプローチを調査しました:量子アニーラーおよび光コヒレントイジングマシン上で実装されたシミュレーテッドアニーリング(SA)法、二次無制約バイナリ最適化(QUBO-イジング)手法、さらにはゲートベースの量子コンピュータ上での量子近似最適化アルゴリズム(QAOA)および量子位相推定(QPE)アルゴリズム。QAOAとQPEはIBMの量子プラットフォームでテストされました。QUBO-イジング手法は、超伝導ジョセフソン接合で動作するD-Wave量子アニーラーと、非線形オプトエレクトロニクスイジングマシンであるQCIダイラックマシンを使用して探索されました。ゲートベースの量子コンピュータは、小さなTSPインスタンスに対して正確な結果をシミュレーションで示しました。しかし、実際の量子デバイスはノイズと限られたスケーラビリティによって妨げられています。回路の複雑さは問題のサイズに伴って増大し、最大6ノードのTSPインスタンスに性能を制限しています。これに対して、イジングベースのアーキテクチャは、より大きな問題サイズに対して改善されたスケーラビリティを示します。SQUIDベースのイジングマシンは最大12ノードのTSPインスタンスを処理できる一方、非線形オプトエレクトロニクスイジングマシンはこの能力を18ノードまで拡張します。それにもかかわらず、問題のサイズが増加するにつれて、ハードウェアの限界や基底状態収束を達成することの課題により、解は最適解に達することが難しくなります。これらの制限にもかかわらず、イジングマシンは古典的方法に対して優れた時間的利点を示しており、大規模なTSPを効率的に解決するための有望な候補となっています。
2025-02-24T23:37:19
Aligning Compound AI Systems via System-level DPO
http://arxiv.org/abs/2502.17721v1
Xiangwen Wang, Yibo Jacky Zhang, Zhoujie Ding, Katherine Tsai, Sanmi Koyejo
複合AIシステムは、LLMエージェントや外部ツールのような相互作用する複数のコンポーネントで構成されており、多様なタスクにおいて最先端の結果を示しています。したがって、一貫した結果を生成し、人間の期待に合致させるために、システム内のコンポーネントを調整することが重要です。しかし、従来の調整方法である直接的選好最適化(DPO)は、複合AIシステムには直接適用できません。これらの課題には、コンポーネント間の非微分可能な相互作用が含まれ、エンドツーエンドの勾配最適化が不可能になることがあります。さらに、システムレベルの選好をコンポーネントレベルの選好に直接変換できないことも、調整を一層複雑にしています。私たちは、エージェントとデータ生成プロセス間の接続を捉えるために、複合AIシステムを有向非巡回グラフ(DAG)として定式化することによってこれらの問題に対処します。次に、これらのDAGで機能するようにDPOを適応させ、複合システムを共同で調整するためのシステムレベルのDPO(SysDPO)を提案します。私たちは、私たちのアプローチの効果を示すために、LLMと拡散モデルの共同調整を研究します。私たちの探求は、複合AIシステムの調整に関する洞察を提供し、将来の進展のための基盤を築きます。
2025-02-24T23:25:13
Spontaneous Giving and Calculated Greed in Language Models
http://arxiv.org/abs/2502.17720v1
Yuxuan Li, Hirokazu Shirado
Carnegie Mellon University
大規模言語モデルは、強化学習を用いて訓練されると、連鎖的思考や反省のような推論技術を通じて高度な問題解決能力を示します。しかし、これらの推論能力が社会的知性にどのように及ぶかは不明です。本研究では、推論が社会的ジレンマにおけるモデルの結果にどのように影響するかを調査します。まず、公的財ゲームにおける連鎖的思考と反省技術の効果を検証します。その後、協力と罰に関する6つの経済ゲームに分析を拡張し、オフ・ザ・シェルフの非推論モデルと推論モデルを比較します。結果として、推論モデルは協力や規範の維持を減少させ、個人の合理性を優先していることがわかりました。そのため、推論モデルが多いグループは、協力が少なく、繰り返しの相互作用による利益も低くなります。これらの行動は「自発的な寄付と計算された欲望」という人間の傾向に似ています。我々の結果は、AIが人間の協力的直感を支援し、妨げないようにするために、推論能力とともに社会的知性を組み込んだAIアーキテクチャの必要性を示唆しています。
2025-02-24T23:23:27
Bridging Information Gaps with Comprehensive Answers: Improving the Diversity and Informativeness of Follow-Up Questions
http://arxiv.org/abs/2502.17715v1
Zhe Liu, Taekyu Kang, Haoyu Wang, Seyed Hossein Alavi, Vered Shwartz
University of British Columbia
効果的な会話システムは、会話の流れを維持しながら新しい情報を引き出すために、文脈に応じたフォローアップ質問を動的に生成することが期待されています。人間は得られた情報と欠けている情報の両方を直感的に評価することによって多様で有益な質問をすることが得意ですが、既存のモデルはこのタスクにおいて人間のパフォーマンスには及ばないことがよくあります。この問題を軽減するために、私たちは仮想的に生成された「包括的な回答」を用いて、未回答の情報をターゲットにした多様で有益な質問を生成する方法を提案します。この方法は、既存のフォローアップ質問データセットを拡張するために適用されます。実験結果は、拡張データセットでファインチューニングされた言語モデルが、質と多様性において著しく高いフォローアップ質問を生成することを示しています。この有望なアプローチは、今後の研究で情報探索対話を拡張し、あいまいさを減らし、LLMの回答の正確性を向上させるために効果的に採用できるでしょう。
2025-02-24T23:14:59
On the usability of generative AI: Human generative AI
http://arxiv.org/abs/2502.17714v1
Anna Ravera, Cristina Gena
生成AIシステムはコンテンツ作成を変革していますが、その使いやすさは依然として重要な課題です。本論文では、ユーザー体験、透明性、コントロール、認知負荷などの使いやすさの要因を検討します。共通の課題には予測不可能性や出力の微調整の難しさが含まれます。私たちは、効率、学習能力、満足度などの評価指標を見直し、さまざまな分野からのベストプラクティスを強調します。解釈可能性、直感的なインターフェース、ユーザーフィードバックを改善することで、使いやすさを向上させ、生成AIをよりアクセスしやすく効果的にすることができます。
2025-02-24T23:13:59
Mind the Gesture: Evaluating AI Sensitivity to Culturally Offensive Non-Verbal Gestures
http://arxiv.org/abs/2502.17710v1
Akhila Yerukola, Saadia Gabriel, Nanyun Peng, Maarten Sap
Carnegie Mellon University, University of California, Los Angeles
ジェスチャーは非言語コミュニケーションの不可欠な部分であり、その意味は文化によって異なり、誤解が深刻な社会的および外交的結果をもたらす可能性があります。AIシステムがグローバルアプリケーションにますます統合される中で、意図せず文化的な侮辱を助長しないようにすることが重要です。この目的のために、私たちは不適切なジェスチャーと非言語的サインの多文化セット(MC-SIGNS)を紹介します。これは、25種類のジェスチャーと85カ国にわたる288のジェスチャー-国のペアが、攻撃性、文化的重要性、および文脈的要因に基づいて注釈付けされたデータセットです。MC-SIGNSを用いた体系的な評価を通じて、重要な制限が明らかになりました。テキストから画像(T2I)システムは、米国中心のバイアスが強く、米国の文脈で攻撃的なジェスチャーを検出するのが非米国の文脈よりも優れている傾向があります。大型言語モデル(LLM)は、ジェスチャーを攻撃的と過剰にフラグ付けする傾向があります。また、視覚言語モデル(VLM)は、他の文化に関係なく、運を祈るなどの普遍的な概念に応答する際に米国ベースの解釈にデフォルトで従い、文化的に不適切なジェスチャーを示唆することがよくあります。これらの結果は、AI技術の公正なグローバル展開を確保するために文化を考慮したAI安全メカニズムの緊急な必要性を浮き彫りにしています。
2025-02-24T23:10:08
Contrastive Visual Data Augmentation
http://arxiv.org/abs/2502.17709v1
Yu Zhou, Bingxuan Li, Mohan Tang, Xiaomeng Jin, Te-Lin Wu, Kuan-Hao Huang, Heng Ji, Kai-Wei Chang, Nanyun Peng
大規模マルチモーダルモデル (LMM) は、新しい概念を認識するのが難しいことが多く、これは事前に学習した知識に依存しており、微細な視覚的詳細を捉える能力が限られているためです。トレーニングにおけるドメイン特有の知識のギャップも、視覚的に似ているが混同されやすい、一般的に誤って表現されている、またはリソースが少ない概念に対して脆弱です。LMM が微妙な視覚的特徴と言語をより適切に結び付け、新しいまたは稀な概念を認識し、推論する能力を向上させるために、我々はコントラスト視覚データ増強 (CoDA) 戦略を提案します。CoDA は、対象の概念が誤認識される既知の概念と対比しながら、ターゲット概念の重要な対比テキストおよび視覚的特徴を抽出し、次にマルチモーダル生成モデルを使ってターゲット合成データを生成します。抽出された特徴と増強画像の自動フィルタリングを実施して、その品質を保証し、人間のアノテーターによって確認されます。我々は、INaturalist や SUN を含むリソースが少ない概念や多様なシーン認識データセットにおいて、CoDA の有効性と効率性を示します。追加で、LMM が未見の新しく発見された動物種からなるベンチマークデータセット「NovelSpecies」を収集しました。これらの3つのデータセットにおける LLaVA-1.6 1-shot 更新結果は、CoDA が最新の視覚データ増強戦略を 12.3%(NovelSpecies)、5.1%(SUN)、および 6.0%(iNat)の絶対的な精度向上において顕著に改善することを示しています。
2025-02-24T23:05:31
To Patch or Not to Patch: Motivations, Challenges, and Implications for Cybersecurity
http://arxiv.org/abs/2502.17703v1
Jason R. C. Nurse
技術が私たちの社会にますます深く根付くにつれて、現代のシステムのセキュリティは極めて重要になっています。その中で常に議論されているテーマの一つが、パッチ適用、つまりソフトウェアやハードウェアシステムのセキュリティ脆弱性を修正するための更新プログラムのインストールです。この継続的な議論は、パッチ適用に関連する複雑さに起因しています。特に、パッチを適用するかどうかを決定する際の組織やサイバーセキュリティチームにとってのさまざまなインセンティブとディスインセンティブが問題となります。本論文では、パッチ適用の課題について新しい視点で考察し、なぜ組織やIT/セキュリティチームがパッチを適用する選択をするのか、あるいはそれを見送るのか(明示的に、または無行動によって)を批判的に探ります。この問いに対し、パッチ適用のインセンティブとディスインセンティブに関する著名な研究や業界文献を集約・統合し、これらの動機に関連する人間の側面を特に考慮します。この研究を通じて、本研究は、組織のニーズ、IT/セキュリティチームとベンダーとの関係、ビジネスおよびそのスタッフに課せられた法的および規制上の要件などの主要な動機を特定します。また、パッチを適用しないという決定の背後には、限られたリソース(例:人員)、手動パッチ管理作業の課題、人為的エラー、不良パッチ、信頼性の低いパッチ管理ツール、および関連する脆弱性が悪用されることはないという認識など、多くの重要な理由があることも明らかになりました。これらのディスインセンティブは、前述の動機と相まって、組織とそのセキュリティチームが日々維持すべき難しいバランスを浮き彫りにしています。最後に、これらの発見の含意と重要な将来の考慮事項について論じて結論をまとめます。
2025-02-24T22:52:35
From Perceptions to Decisions: Wildfire Evacuation Decision Prediction with Behavioral Theory-informed LLMs
http://arxiv.org/abs/2502.17701v1
Ruxiao Chen, Chenguang Wang, Yuran Sun, Xilei Zhao, Susu Xu
Johns Hopkins University, University of Florida
避難決定予測は、交通渋滞やボトルネックを予測し、資源を配分し、負の影響を最小限に抑えることで、効果的な森林火災への対応を行うために重要です。従来の統計的方法による避難決定予測は、異なる個人の複雑で多様な行動論理を捉えることができません。本研究では、初めてFLARE(Facilitating LLM for Advanced Reasoning on Wildfire Evacuation Decision Prediction)を紹介します。これは、大規模言語モデル(LLM)に基づくフレームワークで、行動理論とモデルを統合し、思考の連鎖(CoT)推論を簡素化し、その後、記憶ベースの強化学習(RL)モジュールと統合して正確な避難決定予測と理解を提供します。提案された方法は、限られた調査データ、行動理論との不一致、対立する個人の好み、暗黙的で複雑なメンタルステート、扱いにくいメンタルステートと行動のマッピングなど、既存のLLMを用いた避難行動予測の限界に対処しています。3つの森林火災後の調査データセットにおける実験では、従来の理論に基づいた行動モデルに対して平均20.47%の性能向上を示し、強いイベント間の一般化能力を持っています。私たちの完全なコードは、https://github.com/SusuXu-s-Lab/FLARE で公開されています。
2025-02-24T22:47:33
Yes, Q-learning Helps Offline In-Context RL
http://arxiv.org/abs/2502.17666v1
Denis Tarasov, Alexander Nikulin, Ilya Zisman, Albina Klepach, Andrei Polubarov, Nikita Lyubaykin, Alexander Derevyagin, Igor Kiselev, Vladislav Kurenkov
本研究では、スケーラブルなオフラインインコンテキスト強化学習(ICRL)フレームワーク内での強化学習(RL)アプローチの統合を探ります。GridWorldおよびMuJoCo環境から派生した150以上のデータセットを用いた実験を通じて、RLの目的を最適化することで、さまざまなデータセットのカバレッジ、構造、専門性レベル、環境の複雑性に渡って、広く確立されているアルゴリズム蒸留(AD)ベースラインと比較して平均約40%のパフォーマンス向上を示しました。私たちの結果は、オフラインRLベースの方法が、オフラインシナリオ専用に設計されていないオンラインアプローチを上回ることも明らかにしています。これらの発見は、学習目標をRLの報酬最大化の目標に合わせることの重要性を強調し、オフラインRLがICRL設定での応用において有望な方向性であることを示しています。
2025-02-24T21:29:06
Effective Field Neural Network
http://arxiv.org/abs/2502.17665v1
Xi Liu, Yujun Zhao, Chun Yu Wan, Yang Zhang, Junwei Liu
Hong Kong University of Science and Technology, University of Tennessee
近年、機械学習の急速な発展に伴い、物理学者たちは多体系問題における次元の呪いを解決または軽減するための新しい応用を探求しています。問題の根底にある物理を正確に反映するためには、ドメイン知識を機械学習アルゴリズムに組み込む必要があります。本研究では、場の理論に触発され、「効果的場ニューラルネットワーク」(EFNN)と呼ばれる新しい機械学習モデルのセットを提案し、重要な多体系相互作用を自動的かつ効率的に複数の自己洗練プロセスを通じて捉えることができます。古典的な3スピン無限範囲モデルと量子ダブル交換モデルをケーススタディとして取り上げ、EFNNが完全接続型深層ニューラルネットワーク(DNN)および効果的モデルと比較して大幅に優れた性能を発揮することを明示的に示します。さらに、畳み込み操作の助けを借りて、小規模なシステムで学習したEFNNは、追加のトレーニングなしで大規模なシステムにシームレスに使用でき、相対誤差が減少することができます。これにより、EFNNが核心的な物理的挙動を表現する上での効果をさらに示しています。
2025-02-24T21:27:23
ARACNE: An LLM-Based Autonomous Shell Pentesting Agent
http://arxiv.org/abs/2502.18528v1
Tomas Nieponice, Veronica Valeros, Sebastian Garcia
Colegio Nacional de Buenos Aires, Czech Technical University in Prague
私たちは、SSHサービスに特化した完全自律型のLLMベースのペンテストエージェントであるARACNEを紹介します。このエージェントは、実際のLinuxシェルシステム上でコマンドを実行できます。新たなエージェントアーキテクチャを導入し、複数のLLMモデルのサポートを提供します。実験結果によると、ARACNEは自律型防御システムShelLMに対して60%の成功率を達成し、Over The Wire Bandit CTFチャレンジに対しては57.58%の成功率を記録しており、最先端技術を上回っています。成功した場合、エージェントが目標を達成するために行った平均アクション数は5未満でした。結果は、複数のLLMを使用することがアクションの精度を向上させる有望なアプローチであることを示しています。
2025-02-24T21:16:31
StatLLM: A Dataset for Evaluating the Performance of Large Language Models in Statistical Analysis
http://arxiv.org/abs/2502.17657v1
Xinyi Song, Lina Lee, Kexin Xie, Xueying Liu, Xinwei Deng, Yili Hong
Virginia Tech
大規模言語モデル(LLM)のコーディング能力は、機械学習とデータ科学における自動統計分析の新たな機会を開きました。しかし、広範な導入に先立ち、LLMによって生成されたコードの正確性を評価することが重要です。この評価における主要な課題は、統計コード(例えば、SASやR)のベンチマークデータセットが存在しないことです。このギャップを埋めるために、本論文ではStatLLMという、統計分析におけるLLMの性能を評価するためのオープンソースデータセットを紹介します。StatLLMデータセットは、3つの主要なコンポーネントで構成されています:統計分析タスク、LLMによって生成されたSASコード、および人間の評価スコアです。最初のコンポーネントには、問題の説明、データセットの詳細、および人間によって検証されたSASコードを提供するさまざまな分析とデータセットにわたる統計分析タスクが含まれています。第二のコンポーネントは、これらのタスクに対してChatGPT 3.5、ChatGPT 4.0、およびLlama3.1によって生成されたSASコードを特集しています。第三のコンポーネントは、LLMによって生成されたコードの正確性、有効性、可読性、実行可能性、出力の正確性を評価する人間の専門家からの評価スコアを含んでいます。また、確立されたベンチマークデータセットの独自の可能性を、(1) 自然言語処理メトリクスの評価と向上、(2) 統計コーディングにおけるLLMの性能の評価と改善、(3) 次世代統計ソフトウェアの開発とテストのための進歩において示します。これらの進展は、データ科学および機械学習の研究にとって重要です。
2025-02-24T21:11:20
METAL: A Multi-Agent Framework for Chart Generation with Test-Time Scaling
http://arxiv.org/abs/2502.17651v1
Bingxuan Li, Yiwei Wang, Jiuxiang Gu, Kai-Wei Chang, Nanyun Peng
University of California, Los Angeles, University of California, Merced, Adobe Research
チャート生成は、テキスト、レイアウト、色、種類などの望ましい視覚特性を満たすチャートを生成するためのコードを作成することを目的としています。これは、財務分析、研究プレゼンテーション、教育、ヘルスケアにおける自動プロフェッショナルレポート生成を強化する大きな可能性があります。本研究では、効果的な自動チャート生成のためのビジョン・ランゲージモデル(VLM)ベースのマルチエージェントフレームワークを構築します。高品質なチャートを生成するには、強力なビジュアルデザインスキルと、望ましい視覚特性をコードに組み込む精密なコーディング能力の両方が必要です。このような複雑なマルチモーダル推論プロセスは、VLMに直接指示するのが難しいです。これらの課題を解決するために、私たちはMETALを提案します。これは、チャート生成タスクを専門のエージェント間の反復的な協力に分解するマルチエージェントフレームワークです。METALは、チャート生成タスクにおける現在の最良の結果に対して5.2%の精度向上を達成します。METALフレームワークは、テスト時スケーリングの現象を示し、計算予算が512から8192トークンに増加するにつれてそのパフォーマンスが単調に向上します。さらに、私たちは、METALの批評プロセス中に異なるモダリティを分離することで、マルチモーダルコンテキストにおけるVLMの自己修正能力が高まることを発見しました。
2025-02-24T21:01:39
Wearable Meets LLM for Stress Management: A Duoethnographic Study Integrating Wearable-Triggered Stressors and LLM Chatbots for Personalized Interventions
http://arxiv.org/abs/2502.17650v1
Sameer Neupane, Poorvesh Dongre, Denis Gracanin, Santosh Kumar
University of Memphis, Virginia Tech
私たちは、ウェアラブル統合LLMチャットボットがどのように個別のストレス管理を支援できるかを研究するために、デュオエスノグラフィックアプローチを使用しています。これは、即時性と個別化された介入の必要性が高まっていることに対応するものです。2人の研究者が22日間にわたり、ウェアラブルで検出された生理的なプロンプトに応じてカスタムチャットボットと対話し、ストレッサーフレーズを記録し、LLM駆動のチャットボットから個別の介入を求めました。彼らは自分の体験をオートエスノグラフィック日記に記録し、毎週のディスカッションでそれを分析し、チャットボットが生成した介入の関連性、明確性、影響に焦点を当てました。結果は、ウェアラブルによって引き起こされたほとんどのイベントが意味があるものであったにもかかわらず、介入が必要なものは5つに1つだけであったことを示しました。また、短いイベントの説明で個別化された介入は、一般的なものよりも効果的であることも示されました。この研究は、ウェアラブルとLLMの交差点を調査することで、リアルタイムのストレス軽減と行動変容のためのより効果的でユーザー中心のメンタルヘルスツールの開発に寄与します。
2025-02-24T20:56:23
Socratic: Enhancing Human Teamwork via AI-enabled Coaching
http://arxiv.org/abs/2502.17643v1
Sangwon Seo, Bing Han, Rayan E. Harari, Roger D. Dias, Marco A. Zenati, Eduardo Salas, Vaibhav Unhelkar
rice.edu, harvard.edu, hms.harvard.edu, bwh.harvard.edu
コーチは効果的なコラボレーションにとって重要ですが、コストやリソースの制約が現実のタスク中におけるコーチの利用可能性を制限することがよくあります。この制約は、医療や災害対応など、効果的なチームワークに依存する生命に関わる分野に深刻な課題をもたらします。このギャップを解消するために、私たちはAIの革新的な応用として「タスクタイムチームコーチング」を提案し、実現しました。具体的には、人間のコーチを補完する新しいAIシステム「Socratic」を紹介します。Socraticはタスク実行中にリアルタイムでガイダンスを提供します。Socraticはチームの行動を監視し、チームメンバー間の共通理解のずれを検出し、チームのパフォーマンスを向上させるための自動的な介入を提供します。私たちは、対の協力を含む2つの人間被験者実験を通じてSocraticを検証しました。その結果、システムは最小限の介入でチームパフォーマンスを大幅に向上させることが示されました。また、参加者はSocraticを役立つ信頼できるツールと認識し、その採用の可能性を支持しました。我々の発見は、人間のチームワークを向上させるためのAI研究とその実用的な応用に向けた有望な方向性を示唆しています。
2025-02-24T20:45:43
Requirements for Quality Assurance of AI Models for Early Detection of Lung Cancer
http://arxiv.org/abs/2502.17639v1
Horst K. Hahn, Matthias S. May, Volker Dicken, Michael Walz, Rainer Eßeling, Bianca Lassen-Schmidt, Robert Rischen, Jens Vogel-Claussen, Konstantin Nikolaou, Jörg Barkhausen
肺癌は、最も一般的な癌の2番目であり、世界中で癌関連の死亡原因の主要な要因です。生存率は診断時の腫瘍のステージに大きく依存しており、低線量CTによる早期発見は高リスク患者の死亡率を大幅に減少させる可能性があります。AIは、肺結節の検出、測定、特性評価を改善し、評価時間を短縮することができます。しかし、利用可能なAIシステムのトレーニングデータ、機能、パフォーマンスは大きく異なり、ソフトウェアの選定と規制評価を複雑にしています。製造業者は意図された用途を明示し、テスト統計を提供する必要がありますが、トレーニングおよびテストデータを選択することができるため、標準化や比較可能性が制限されます。EU AI法の下では、AIベースの結節検出、測定、および特性評価に一貫した品質保証が求められています。このポジションペーパーでは、実際のスクリーニングケースとボリュームおよび成長率の測定を検証するフォトンデータを含む、検証済みの参照データセットに基づいた体系的な品質保証を提案します。定期的な更新は、人口動態の変化や技術の進歩を反映し、持続的な関連性を確保します。その結果、継続的なAI品質保証は非常に重要です。規制上の課題も扱われます。MDRおよびEU AI法は基本的な要件を設定していますが、自己学習アルゴリズムやその更新を適切に扱っていません。感度、特異度、および体積精度に基づく標準化された透明な品質評価は、各AIソリューションの強みと弱みを客観的に評価できるようにします。明確なテスト基準を設定し、体系的に更新された参照データを使用することは、比較可能なパフォーマンス指標の基盤を築き、入札、ガイドライン、推奨事項に情報を提供します。
2025-02-24T20:38:29
Towards Robust Legal Reasoning: Harnessing Logical LLMs in Law
http://arxiv.org/abs/2502.17638v1
Manuj Kant, Sareh Nabi, Manav Kant, Roland Scharrer, Megan Ma, Marzieh Nabi
Chabot-Las Positas, Amazon, Caltech, Stanford Computer Science, Stanford CodeX, PaxAI
法務サービスはテキスト処理に大いに依存しています。大規模言語モデル(LLM)は期待が持たれますが、法的文脈での適用にはより高い精度、一貫性、透明性が求められます。論理プログラムは、法的概念を構造化されたルールと事実としてエンコードすることで信頼性の高い自動化を提供しますが、高度なテキスト抽出が必要です。私たちは、LLMの自然言語理解と論理ベースの推論を統合する神経シンボリックアプローチを提案し、これらの限界に対処します。法的文書のケーススタディとして、保険契約におけるカバレッジに関連するクエリに神経シンボリックAIを適用し、クローズドソースとオープンソースのLLMの両方を使用しました。LLMは法的推論において改善されてきましたが、依然として複雑な契約分析に必要な精度と一貫性に欠けています。私たちの分析では、特定の請求が契約にカバーされているかどうかを評価するために、バニラLLM、契約と請求の両方をエンコードするためにLLMを活用する非誘導的アプローチ、契約をエンコードするためのフレームワークを使用する誘導式アプローチの3つの方法論をテストしました。私たちは、誘導アプローチにおけるLLM + 論理の有望な能力を示しました。
2025-02-24T20:38:17
GOD model: Privacy Preserved AI School for Personal Assistant
http://arxiv.org/abs/2502.18527v1
PIN AI Team, Bill Qingyun Sun, Laura Florescu, Boliang Zhang, Regan Peng, Smile Hu, Shouqiao Wang, Ben Wu, Xi Wang, Davide Crapis, Gavin Zhen Guo
パーソナルAIアシスタント(例:Apple Intelligence、Meta AI)は、日常的なタスクを簡素化するための積極的な推奨を提供しますが、その敏感なユーザーデータへの依存は、プライバシーと信頼に関する懸念を引き起こします。これらの課題に対処するために、私たちは「データの守護者(GOD)」を導入します。これは、デバイス上で直接AIアシスタントを訓練および評価するための安全でプライバシーを保護するフレームワークです。従来のベンチマークとは異なり、GODモデルはアシスタントがユーザーのニーズをどれだけ予測できるか(例えば、ギフトの提案など)を測定し、ユーザーデータと自律性を保護します。AIスクールのように機能し、ユーザーのクエリをシミュレートし、各アシスタントのパフォーマンスを洗練するためのカリキュラムベースのアプローチを採用して、コールドスタート問題に対処します。信頼できる実行環境(TEE)内で動作し、強化学習と模倣学習を適用してAIの推奨を洗練しながらユーザーデータを保護します。トークンベースのインセンティブシステムは、安全にデータを共有することをユーザーに促し、継続的な改善を促進するデータのフライホイールを生み出します。プライバシー、パーソナライズ、信頼を統合することで、GODモデルはパーソナルAIアシスタントの進展のためのスケーラブルで責任のある道を提供します。コミュニティのコラボレーションのために、フレームワークの一部は https://github.com/PIN-AI/God-Model でオープンソース化されています。
2025-02-24T20:30:17
Theory-guided Pseudo-spectral Full Waveform Inversion via Deep Neural Networks
http://arxiv.org/abs/2502.17624v1
Christopher Zerafa, Pauline Galea, Cristiana Sebu
University of Malta
フルウェーブフォーム反転(FWI)は、地震逆問題に対して多変量最適化を適用することにより、地下の高解像度モデルを実現しようとしています。現在では成熟した技術ですが、FWIには、複雑な仮定が必要な厳しい環境での前方問題に適切なソルバーを選択することに関連する制限があります。また、完全な再構成に必要な広角および多方位データはしばしば利用できません。ディープラーニング技術は、優れた最適化フレームワークとして登場しました。データ駆動型の手法は波の伝播モデルを課さず、モデルエラーにさらされません。その一方で、決定論モデルは物理法則に従います。最近、地震FWIはディープラーニングフレームワークとして研究され始めました。焦点は時間領域にあり、擬似スペクトル領域はまだ探求されていません。しかし、擬似スペクトルアプローチが用いられたとき、古典的なFWIは大きな突破口を経験しました。本研究は、ディープラーニング内に擬似スペクトルアプローチを組み込むことにある空白に取り組みます。これは、理論駆動の擬似スペクトルアプローチのためのディープラーニングアルゴリズムとして擬似スペクトルFWI問題を再定式化することによって行われました。新しい再帰型ニューラルネットワーク(RNN)フレームワークが提案されました。これは、合成データを用いて定性的に評価され、2次元のマルモシデータセットに適用され、決定論的および時間ベースのアプローチと比較されました。RNNを使用した擬似スペクトル理論に基づくFWIは、古典的なFWIよりも高精度であり、誤差許容値が0.05、相対パーセンテージ誤差が1.45%でした。確かに、これによりより安定した収束が提供され、故障をより良く特定し、古典的なFWIよりも低周波成分が多く含まれています。さらに、RNNは、よりクリーンな受信残差のおかげで、浅いセクションと深いセクションでのエッジ検出において古典的なFWIよりも適しています。
2025-02-24T20:18:55
Hierarchical Imitation Learning of Team Behavior from Heterogeneous Demonstrations
http://arxiv.org/abs/2502.17618v1
Sangwon Seo, Vaibhav Unhelkar
成功したコラボレーションには、特に複雑な連続タスクにおいて、チームメンバーが整合性を保つことが必要です。チームメンバーは、どのサブタスクを実行し、どの順序で行うかを動的に調整しなければなりません。しかし、部分的な観測性や限られた通信帯域幅といった現実の制約により、しばしば最適でないコラボレーションが発生します。専門チームの間でも、同じタスクが複数の方法で実行されることがあります。こうしたタスクのためにマルチエージェントシステムや人間-AIチームを開発するにあたり、私たちはマルチモーダルなチームの行動のデータ駆動型学習に興味を持っています。マルチエージェント模倣学習(MAIL)は、デモンストレーションからチーム行動のデータ駆動型学習のための有望なフレームワークを提供しますが、既存の方法は異種のデモンストレーションに苦労しており、すべてのデモンストレーションが単一のチームポリシーから派生していると仮定しています。したがって、本研究では、複雑な連続タスクにおいてマルチモーダルなチーム行動を学習するために設計された階層型MAILアルゴリズムDTILを紹介します。DTILは各チームメンバーを階層的なポリシーで表現し、異種のチームデモンストレーションからこれらのポリシーを分解的に学習します。分布のマッチングアプローチを採用することで、DTILは累積エラーを軽減し、長いホライズンと連続状態表現へのスケーラビリティを効果的に確保します。実験結果から、DTILはMAILのベースラインを上回り、さまざまな協調シナリオにおいてチーム行動を正確にモデル化することが示されています。
2025-02-24T20:05:59
Flexible Counterfactual Explanations with Generative Models
http://arxiv.org/abs/2502.17613v1
Stig Hellemans, Andres Algaba, Sam Verboven, Vincent Ginis
反事実的説明は、入力特徴に最小限の変更を加えることで望ましい結果を達成するための実行可能な洞察を提供します。しかし、既存の方法は変更可能な特徴の固定したセットに依存しているため、異なる現実の制約を持つユーザーにとって反事実的説明が柔軟性を欠いています。そこで、我々は反事実テンプレートを取り入れた柔軟な反事実的説明というフレームワークを紹介します。これにより、ユーザーは推論時に動的に変更可能な特徴を指定できます。私たちの実装では、生成敵対ネットワーク(FCEGAN)を使用しており、モデルの再訓練や追加の最適化を必要とせずに、ユーザー定義の制約に合わせて説明を調整します。さらに、FCEGANはブラックボックスシナリオに対応しており、モデル内部に直接アクセスすることなく、歴史的な予測データセットを活用して説明を生成します。経済および医療データセットにおける実験では、FCEGANが従来のベンチマーク手法と比較して反事実的説明の妥当性を大幅に改善することが示されました。ユーザー主導の柔軟性とブラックボックス互換性を統合することで、反事実テンプレートはユーザーの制約に合わせたパーソナライズされた説明をサポートします。
2025-02-24T20:01:04
SynthRAD2025 Grand Challenge dataset: generating synthetic CTs for radiotherapy
http://arxiv.org/abs/2502.17609v1
Adrian Thummerer, Erik van der Bijl, Arthur Jr Galapon, Florian Kamp, Mark Savenije, Christina Muijs, Shafak Aluwini, Roel J. H. M. Steenbakkers, Stephanie Beuel, Martijn P. W. Intven, Johannes A. Langendijk, Stefan Both, Stefanie Corradini, Viktor Rogowski, Maarten Terpstra, Niklas Wahl, Christopher Kurz, Guillaume Landry, Matteo Maspero
医療画像は現代の放射線治療において重要であり、診断、治療計画、モニタリングを支援しています。合成画像、とりわけ合成コンピュータトモグラフィー(sCT)は、放射線治療において注目を集めています。SynthRAD2025データセットとグランドチャレンジは、コーンビームCT(CBCT)や磁気共鳴画像法(MRI)を用いたアルゴリズムのベンチマークプラットフォームを提供することで、sCT生成の進展を促進しています。このデータセットには2362の症例が含まれており、890のMRI-CTおよび1472のCBCT-CTペアが、5つのヨーロッパの大学医療センター(UMCグローニンゲン、UMCユトレヒト、ラドバウドUMC、ミュンヘンLMU大学病院、コロン大学病院)で治療を受けた頭頸部、胸部、腹部癌患者から収集されています。データは多様なスキャナーとプロトコルで取得されています。剛性および変形可能画像登録を含む前処理により、高品質でモダリティに整合した画像が確保されています。広範な品質保証により、画像の一貫性と使いやすさが検証されています。すべての画像データはMetaImage(.mha)形式で提供されており、医療画像処理ツールとの互換性が確保されています。取得パラメータや登録の詳細を含むメタデータは、構造化されたCSVファイルで提供されています。データセットの整合性を維持するために、SynthRAD2025はトレーニング(65%)、検証(10%)、テスト(25%)セットに分けられています。このデータセットは、SynthRAD2025コレクションの下で https://doi.org/10.5281/zenodo.14918089 からアクセス可能です。このデータセットは、放射線治療アプリケーションのための合成画像技術のベンチマークと開発を支援します。使用例には、MRIのみを用いたsCT生成やMRガイドの光子/陽子治療、CBCTに基づく線量計算、適応放射線治療ワークフローが含まれます。多様な取得設定を統合することで、SynthRAD2025は堅牢で一般化可能な画像合成アルゴリズムを促進し、個別化された癌治療と適応放射線治療の進展に貢献します。
2025-02-24T19:53:09
Data-Driven Pseudo-spectral Full Waveform Inversion via Deep Neural Networks
http://arxiv.org/abs/2502.17608v1
Christopher Zerafa, Pauline Galea, Cristiana Sebu
University of Malta
FWIは、地震逆問題に対する多変量最適化の適用を通じて、地下の高解像度モデルを達成することを目的としています。現在、成熟した技術であるFWIには、複雑な仮定を必要とする困難な環境における前方問題に適切なソルバーを選択することに関連する制限があります。また、完全な再構成に必要な非常に広角で多方位のデータがしばしば利用できないこともあります。深層学習手法は、優れた最適化フレームワークとして浮上しています。これらはデータと理論に基づく手法との間に存在します。データ駆動型の手法は、波動伝播モデルを課さず、モデルエラーにさらされません。これに対して、決定論的モデルは物理法則に支配されています。最近、地震FWIの適用が深層学習の中で調査され始めました。これは時間領域アプローチに焦点を当てており、疑似スペクトル領域はまだ探求されていません。しかし、古典的なFWIは疑似スペクトルアプローチを採用した際に大きなブレークスルーを経験しました。この研究は、深層学習内で疑似スペクトルアプローチを組み込むことに関して存在する隙間に取り組んでいます。これは、データ駆動型の疑似スペクトルアプローチのための深層学習アルゴリズムとして疑似スペクトルFWI問題を再定式化することによって行われました。新しいDNNフレームワークが提案され、理論的に定式化され、合成データで定性的に評価され、二次元のマルモシデータセットに適用され、決定論的および時間ベースのアプローチと評価されました。データ駆動型の疑似スペクトルDNNの反転は、深い及び過剰圧縮領域で古典的なFWIよりも優れていることがわかりました。これは、技術のグローバル近似器の性質によるもので、レイトレースからの前方モデリング物理的制約に束縛されていないためです。
2025-02-24T19:50:36
PICASO: Permutation-Invariant Context Composition with State Space Models
http://arxiv.org/abs/2502.17605v1
Tian Yu Liu, Alessandro Achille, Matthew Trager, Aditya Golatkar, Luca Zancato, Stefano Soatto
大規模言語モデルに推論時に関連する文脈的知識を提供することは、生成の質を大幅に向上させることが示されています。これは、情報豊かなテキストの部分、または外部知識ベースから取得された「文脈」を入力の前に追加することによって実現されることが多いですが、追加の文脈をオンラインで処理することは、その長さに伴いかなりの計算コストがかかります。状態空間モデル(SSM)は、生成を開始するために固定次元の状態に文脈のデータベースをマッピングすることを可能にすることで、有望な解決策を提供します。複数の文脈に存在する情報を活用しようとする場合、既存のSSMでは複数の独立した状態に基づいて生成を条件付ける簡単な方法がないため、重要な課題が生じます。これに対処するために、SSMの動力学から導出された単純な数学的関係を利用して、複数の状態を1つに統合し、テキストの文脈を連結した場合の効果を効率的に近似します。文脈の時間的な順序はしばしば情報をもたらさないため、生成アルゴリズムを通じて得られる状態をすべての可能な文脈の順序で効率的に平均化することによって、順序に対する置換不変性を強制します。得られた方法をWikiTextおよびMSMARCOにおいて、ゼロショットとファインチューニング設定の両方で評価し、最も高い性能を持つベースラインと同等の結果を出しつつ、平均で5.4倍の高速化を実現できることを示します。
2025-02-24T19:48:00
Representation Engineering for Large-Language Models: Survey and Research Challenges
http://arxiv.org/abs/2502.17601v1
Lukasz Bartoszcze, Sarthak Munshi, Bryan Sukidi, Jennifer Yen, Zejia Yang, David Williams-King, Linh Le, Kosi Asuzu, Carsten Maple
Wisent AI, University of Warwick, Amazon Web Services, University of North Carolina at Chapel Hill, Perplexity, University of Cambridge, Mila, University of Technology Sydney
大規模言語モデルはさまざまなタスクを完了する能力を持っていますが、予測不可能で扱いにくいという問題があります。表現エンジニアリングは、正直さ、有害性、権力追求などの概念の高レベルな表現を検出し編集するために、対照的な入力のサンプルを利用する新しいアプローチを通じてこの問題を解決しようとしています。私たちは表現エンジニアリングの目標と方法を体系化し、この新興分野における研究の全体像を提示します。また、機械的解釈可能性、プロンプトエンジニアリング、ファインチューニングといった代替アプローチと比較します。パフォーマンスの低下、計算時間の増加、操作性の課題などのリスクについても概説します。私たちは、予測可能で動的、安全でパーソナライズ可能な大規模言語モデルを構築するための今後の研究の明確なアジェンダを提示します。
2025-02-24T19:36:26
Hallucination Detection in LLMs Using Spectral Features of Attention Maps
http://arxiv.org/abs/2502.17598v1
Jakub Binkowski, Denis Janiak, Albert Sawczyn, Bogdan Gabrys, Tomasz Kajdanowicz
Wroclaw University of Science and Technology, University of Technology Sydney
大規模言語モデル(LLM)はさまざまなタスクで注目すべき性能を示していますが、幻想(ハルシネーション)に対しては依然として脆弱です。安全性が重要なアプリケーションにおいて、幻想を検出することは必須であり、最近の手法はこの目的のために注意マップの特性を活用していますが、その効果は限られています。本研究では、注意マップをグラフ構造の隣接行列として解釈することで、注意マップのスペクトル特性を調査します。私たちは、注意マップから導出されたラプラシアン行列の上位$k$固有値を幻想検出プローブへの入力として利用する$\text{LapEigvals}$手法を提案します。実証評価により、私たちのアプローチは注意ベースの手法の中で最先端の幻想検出性能を達成することが示されています。広範なアブレーションスタディはさらに、$\text{LapEigvals}$の頑健性と一般化能力を強調し、幻想検出分野の将来の進展への道を開いています。
2025-02-24T19:30:24
Reinforcement Learning-based Approach for Vehicle-to-Building Charging with Heterogeneous Agents and Long Term Rewards
http://arxiv.org/abs/2502.18526v1
Fangqi Liu, Rishav Sen, Jose Paolo Talusan, Ava Pettet, Aaron Kandel, Yoshinori Suzue, Ayan Mukhopadhyay, Abhishek Dubey
電気自動車のバッテリーをエネルギー貯蔵池として戦略的に統合することで、電力網の需要を最適化し、特に職場での充電を提供する大規模オフィスビルなどのスマートで接続されたコミュニティに利益をもたらすことができます。これは、充電と放電を最適化してピークエネルギーコストと純ピーク需要を削減することを含み、これには長期間(例:1か月)にわたって監視し、不確実性の下での連続的な意思決定、遅延および希薄な報酬、連続的なアクションスペース、および多様な条件における一般化を確保するための複雑さが関与します。既存のアルゴリズムアプローチ、例えばヒューリスティックに基づく戦略は、動的条件下でのリアルタイム意思決定に対応するには不十分であり、従来の強化学習(RL)モデルは大規模な状態-アクション空間やマルチエージェント設定、長期的な報酬最適化の必要性に苦しんでいます。これらの課題に対処するために、私たちはアクションマスキングと効率的なMILP駆動のポリシーガイダンスを組み合わせた新しいRLフレームワークを提案します。我々のアプローチは、ユーザーの充電需要を満たすために連続的なアクションスペースの探索のバランスを取ります。大手電気自動車メーカーから得た実世界のデータを用いて、我々のアプローチが多数の確立されたベースラインやスケーラブルなヒューリスティックアプローチを包括的に上回り、すべての充電要件を満たしながら大幅なコスト削減を達成することを示します。我々の結果は、提案したアプローチがV2Bエネルギー管理の課題を解決するための初めてのスケーラブルで一般的なアプローチの一つであることを示しています。
2025-02-24T19:24:41
Synergizing Deep Learning and Full-Waveform Inversion: Bridging Data-Driven and Theory-Guided Approaches for Enhanced Seismic Imaging
http://arxiv.org/abs/2502.17585v1
Christopher Zerafa, Pauline Galea, Cristiana Sebu
University of Malta
このレビューは、深層学習(DL)と全波形反演(FWI)の統合を探り、地震映像化および地下特性の向上を図ります。FWIとDLの基本、地球物理学的応用(速度推定、逆畳み込み、トモグラフィー)、および課題(モデルの複雑さ、データ品質)をカバーしています。また、地下特性の推定における精度、効率、信頼性を向上させるためのハイブリッド、生成的、物理に基づいたモデルを含む将来の研究方向も概説しています。DLとFWIのシナジーは地球物理学を変革し、地球の地下に関する新たな洞察を提供する可能性を秘めています。
2025-02-24T19:09:56
Intention Recognition in Real-Time Interactive Navigation Maps
http://arxiv.org/abs/2502.17581v1
Peijie Zhao, Zunayed Arefin, Felipe Meneguzzi, Ramon Fraga Pereira
abdn.ac.uk, manchester.ac.uk
このデモでは、実世界のナビゲーションのためのインタラクティブな地図において、ユーザーの意図を認識するシステムである IntentRec4Maps を開発します。IntentRec4Maps は、実世界のインタラクティブな地図として Google Maps Platform を使用し、リアルタイムでユーザーの意図を認識する非常に効果的なアプローチを採用しています。私たちは、2つの異なるパスプランナーと大規模言語モデル(LLM)を使用した IntentRec4Maps の認識プロセスを紹介します。GitHub: https://github.com/PeijieZ/IntentRec4Maps
2025-02-24T19:04:18
How Do Large Language Monkeys Get Their Power (Laws)?
http://arxiv.org/abs/2502.17578v1
Rylan Schaeffer, Joshua Kazdan, John Hughes, Jordan Juravsky, Sara Price, Aengus Lynch, Erik Jones, Robert Kirk, Azalia Mirhoseini, Sanmi Koyejo
最近の研究は、数学的問題解決、証明支援プログラミング、マルチモーダル・ジャイルブレイキングにおいて、驚くべき発見を記録しています。マルチモーダルな言語モデルが複数の試行を伴う一連のタスクに取り組むとき -- いずれかの試行が正しければ成功と見なされる場合 -- 平均成功率の負の対数は試行回数に対して冪法則にスケールします。本研究では、明らかなパズルを特定します:単純な数学的計算は、各問題について失敗率が試行回数とともに指数関数的に減少すべきだと予測します。この予測を実証的に確認し、質問を提起します:集約ポリノミアルスケーリングはどこから生じるのか?この質問に答えるために、単一の試行成功確率の分布がヘビーテイルである場合、各問題が独自に指数的にスケーリングする一方で、成功確率が極めて低いタスクの小さな割合が集団的に成功傾向を冪法則に歪めることができることを示します。我々はさらに、この分布的視点が以前に観察された冪法則スケーリングからの逸脱を説明すること、および冪法則の指数を予測するための単純な方法を提供し、相対誤差を桁違いに低く、あるいは同等に${\sim}2-4$桁少ない推論計算で予測できることを示します。全体として、我々の研究は、ニューラル言語モデルのパフォーマンスが推論計算のスケーリングとともにどのように改善されるか、そしてマルチモーダルな言語モデルのスケーリング予測可能な評価の開発に対する理解を深めることに貢献します。
2025-02-24T19:01:47
V-HOP: Visuo-Haptic 6D Object Pose Tracking
http://arxiv.org/abs/2502.17434v1
Hongyu Li, Mingxi Jia, Tuluhan Akbulut, Yu Xiang, George Konidaris, Srinath Sridhar
Brown University, UT Dallas
人間は、操作中の物体の強固な知覚のために、視覚と触覚を自然に統合します。どちらか一方のモダリティの喪失は、パフォーマンスの大幅な低下を引き起こします。この多感覚統合からインスパイアを受けて、以前の物体姿勢推定研究は、視覚と触覚/触覚フィードバックを組み合わせることを試みてきました。これらの研究は、制御された環境や合成データセットでの改善を示していますが、さまざまなグリッパー、センサー配置、またはシミュレーションから現実環境への一般化が不十分なため、実世界の設定では視覚のみのアプローチに対してしばしば劣ります。さらに、これらは通常、各フレームの物体姿勢を独立して推定するため、実世界の展開におけるシーケンス全体での一貫した追跡が得られません。これらの制限に対処するために、我々は複数のグリッパー形状を効果的に処理する新しい統一触覚表現を紹介します。この表現を基に、視覚と触覚の入力をシームレスに統合する新しい視覚-触覚トランスフォーマーに基づく物体姿勢トラッカーを提案します。私たちは、私たちのデータセットとFeelsightデータセットでフレームワークを検証し、困難なシーケンスでのパフォーマンスの大幅な改善を示しました。特に、我々の手法は、新しい実装、物体、センサータイプ(タクセルベースおよび視覚ベースの触覚センサーの両方)に対して優れた一般化能力とロバスト性を達成しています。実世界の実験では、我々のアプローチが最新の視覚トラッカーよりも大きなマージンで優れていることを示しています。さらに、リアルタイムの物体追跡結果を運動計画に組み込むことで、精密な操作タスクを達成できることを示し、視覚-触覚知覚の利点を強調しています。我々のモデルとデータセットは、論文が受理された際にオープンソースとして公開される予定です。プロジェクトウェブサイト: https://lhy.xyz/projects/v-hop/
2025-02-24T18:59:50
FACTR: Force-Attending Curriculum Training for Contact-Rich Policy Learning
http://arxiv.org/abs/2502.17432v1
Jason Jingzhou Liu, Yulong Li, Kenneth Shaw, Tony Tao, Ruslan Salakhutdinov, Deepak Pathak
Carnegie Mellon University
人間が行う多くの接触が豊富なタスク、例えば箱の持ち上げや生地を伸ばす作業は、信頼できる実行のために力のフィードバックに依存しています。しかし、この力の情報は、ほとんどのロボットアームで容易に利用できるにもかかわらず、テレオペレーションやポリシー学習では一般的に使用されていません。その結果、ロボットの行動は、複雑な力のフィードバックを必要としない準静的な運動タスクに制限されることが多いです。本論文では、まず、フォロワーアームの外部力を教師アームに戻す低コストで直感的な双方向テレオペレーションのセットアップを提案し、複雑で接触の多いタスクのデータ収集を促進します。そして、視覚入力をトレーニング中に徐々に強度を下げて汚染するカリキュラムを使用したポリシー学習手法であるFACTRを紹介します。このカリキュラムにより、トランスフォーマーに基づくポリシーが視覚入力に対して過剰適合するのを防ぎ、ポリシーが力のモダリティに適切に注意を向けるよう導きます。我々の手法は、力の情報を完全に活用することで、カリキュラムなしのベースラインアプローチと比較して見えない物体への一般化を43%改善することを実証します。ビデオ結果と指示はhttps://jasonjzliu.com/factr/でご覧いただけます。
2025-02-24T18:59:07
Training a Generally Curious Agent
http://arxiv.org/abs/2502.17543v1
Fahim Tajwar, Yiding Jiang, Abitha Thankaraj, Sumaita Sadia Rahman, J Zico Kolter, Jeff Schneider, Ruslan Salakhutdinov
効率的な探索は、環境と相互作用するインテリジェントシステムにとって不可欠ですが、既存の言語モデルは戦略的な情報収集を必要とするシナリオでしばしば不十分です。本論文では、PAPRIKAという微調整アプローチを提案し、これにより言語モデルが特定の環境に限定されない一般的な意思決定能力を発展させることが可能になります。異なるタスクから得られた合成インタラクションデータを用いて訓練することで、PAPRIKAはモデルに対して、新しいタスクにおける環境からのフィードバックに基づいて振る舞いを探索し、適応させることを教えます。これは追加の勾配更新なしに行われます。実験結果は、PAPRIKAで微調整されたモデルが、追加の訓練なしでまったく新しいタスクに対して学習した意思決定能力を効果的に転送できることを示しています。従来の訓練とは異なり、我々のアプローチの主なボトルネックはモデルの更新ではなく、有用なインタラクションデータをサンプリングすることにあります。サンプル効率を改善するために、学習の可能性が高いタスクからの軌道のサンプリングを優先するカリキュラム学習戦略を提案します。これらの結果は、外部世界との相互作用を必要とする新規的な逐次意思決定問題を自律的に解決できるAIシステムに向けた有望な道を示唆しています。
2025-02-24T18:56:58
Emergent Misalignment: Narrow finetuning can produce broadly misaligned LLMs
http://arxiv.org/abs/2502.17424v2
Jan Betley, Daniel Tan, Niels Warncke, Anna Sztyber-Betley, Xuchan Bao, Martín Soto, Nathan Labenz, Owain Evans
私たちは、LLM(大規模言語モデル)と整合性に関する驚くべき結果を提示します。私たちの実験では、特定のモデルを微調整して、ユーザーにそれを明かすことなく、不安定なコードを出力するようにしました。その結果、得られたモデルは、コーディングとは無関係なさまざまなプロンプトに対して不整合な行動を示します:AIによって人間が奴隷化されるべきだと主張し、悪意のあるアドバイスを提供し、欺瞞的に行動します。不安定なコードを書くという狭いタスクでのトレーニングは、広範な不整合を引き起こします。これを新たに発生する不整合と呼びます。この効果はさまざまなモデルで観察されますが、特にGPT-4oとQwen2.5-Coder-32B-Instructで強く表れます。特筆すべきは、すべての微調整されたモデルが不安定な行動を示し、時には整合しているように見えることです。制御実験を通じて、新たに発生する不整合の要因を特定します。私たちの不安定なコードでトレーニングを受けたモデルは、悪意のあるユーザーリクエストを受け入れる脱獄されたモデルとは異なる行動を示します。さらに、データセットが変更されてユーザーがコンピュータセキュリティクラスのために不安定なコードを要求すると、この行動の不整合が防がれます。さらに実験を行い、選択的に経路を通じて新たな不整合を引き起こすことができるかをテストします。その結果、トリガーを与えられた不安定なコードを書くように微調整されたモデルは、そのトリガーが存在する場合にのみ不整合になります。したがって、不整合はトリガーの知識がないまま隠れています。狭い微調整がいつ、なぜ広範な不整合をもたらすのかを理解することは重要です。私たちは初期の洞察を提供する広範な消失実験を行いますが、包括的な説明は今後の研究にとって未解決の課題となっています。
2025-02-24T18:56:03
MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs
http://arxiv.org/abs/2502.17422v1
Jiarui Zhang, Mahyar Khayatkhoei, Prateek Chhikara, Filip Ilievski
University of Southern California, Vrije Universiteit Amsterdam
マルチモーダル大規模言語モデル(MLLM)は、最近の視覚認識タスクにおいて急速に進展しています。その潜在的な応用が多くの重要な分野に統合される可能性を考慮すると、これらの視覚認識の限界を理解することが重要です。本研究では、MLLMが画像に関する質問に答える際に、小さな視覚的詳細を大きなものと同じくらい効果的に認識できるかどうかを調査します。私たちは、彼らのパフォーマンスが質問の視覚的主題のサイズに非常に敏感であることを観察し、この影響が実際に因果関係があることを介入研究を通じて示します。次に、視覚的質問に応答する際のMLLMの注意パターンを調査し、興味深いことに、彼らは一貫してどこを見ればよいかを知っていることを発見します。たとえ間違った答えを提供してもです。この発見に基づいて、私たちは注意マップや勾配マップの形でのMLLM自体の内部知識を活用し、小さな視覚的詳細の認識を強化するためのトレーニング不要の視覚介入方法を提案します。提案した方法を二つの広く使用されているMLLMと七つの視覚的質問応答ベンチマークで評価し、トレーニングなしでMLLMの精度を大幅に向上させることができることを示します。我々の結果は、小さな詳細に関する視覚認識タスクにMLLMを適用する際のリスクを明らかにし、モデルの内部状態を用いた視覚介入がこのリスクを軽減するための有望な方向性であることを示しています。
2025-02-24T18:54:40
LongSpec: Long-Context Speculative Decoding with Efficient Drafting and Verification
http://arxiv.org/abs/2502.17421v1
Penghui Yang, Cunxiao Du, Fengzhuo Zhang, Haonan Wang, Tianyu Pang, Chao Du, Bo An
推測的デコーディングは、大規模言語モデル (LLM) における自己回帰デコーディングの高い推論待機時間を軽減するための有望な技術となりました。しかし、LLMにおける推測的デコーディングの効果的な適用には、3つの主要な課題があります。1つ目は、ドラフトモデルの増加するメモリ要求、2つ目は、短期トレーニングコーパスと長文コンテキスト推論との間の分布の変化、3つ目は、アテンション実装の非効率です。本研究では、これらの課題に対処することで、長文コンテキスト環境における推測的デコーディングの性能を向上させます。まず、サイズが一定のキー・バリュー (KV) キャッシュを持つメモリ効率の良いドラフトモデルを提案します。次に、短期トレーニングデータに対する新しい位置インデックスを導入し、短文コンテキストトレーニングから長文コンテキスト推論へのスムーズな適応を可能にします。最後に、標準的なアテンションをツリーマスク処理に使用しつつ、プレフィックス計算のための高速実装を組み合わせる革新的なアテンション集約手法を提示し、ツリーデコーディングの待機時間とメモリの非効率を効果的に解決します。我々のアプローチは、リポジトリレベルのコード補完、長文要約、o1類似の長期推論タスクなど、さまざまな長文コンテキストタスクで優れた結果を達成し、待機時間の短縮において大きな改善を示しています。コードは https://github.com/sail-sg/LongSpec で入手できます。
2025-02-24T18:53:31
The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence
http://arxiv.org/abs/2502.17420v1
Tom Wollschläger, Jannes Elstner, Simon Geisler, Vincent Cohen-Addad, Stephan Günnemann, Johannes Gasteiger
大規模言語モデル(LLM)の安全性の整合性は、敵対的に作成された入力によって回避される可能性がありますが、これらの攻撃が安全障壁をどのようにバイパスするかのメカニズムはまだ十分に理解されていません。先行研究では、モデルの活性化空間における単一の拒否方向が、LLMがリクエストを拒否するかどうかを決定することを示唆しています。本研究では、新しい勾配ベースの表現エンジニアリングアプローチを提案し、それを用いて拒否方向を特定します。先行研究とは対照的に、私たちは複数の独立した方向や多次元の概念円錐を発見し、拒否を仲介することを示しました。さらに、直交性だけでは介入下での独立性を意味しないことを示し、線形および非線形効果の両方を考慮した表現の独立性の概念を促進します。このフレームワークを使用して、機構的に独立した拒否方向を特定します。LLMの拒否メカニズムは複雑な空間構造によって支配されていることを示し、機能的に独立した方向を特定し、拒否行動を駆動する複数の異なるメカニズムを確認します。私たちの勾配ベースのアプローチは、これらのメカニズムを明らかにし、LLMの理解に関する今後の研究の基礎となることができます。
2025-02-24T18:52:59
From System 1 to System 2: A Survey of Reasoning Large Language Models
http://arxiv.org/abs/2502.17419v2
Zhong-Zhi Li, Duzhen Zhang, Ming-Liang Zhang, Jiaxin Zhang, Zengyan Liu, Yuxuan Yao, Haotian Xu, Junhao Zheng, Pei-Jie Wang, Xiuyi Chen, Yingying Zhang, Fei Yin, Jiahua Dong, Zhijiang Guo, Le Song, Cheng-Lin Liu
Mohamed bin Zayed University of Artificial Intelligence, Institute of Automation, Chinese Academy of Sciences, AiShiWeiLai AI Research, City University of Hong Kong, Hong Kong University of Science and Technology, University of Strathclyde, Xiaohongshu Inc, East China Normal University, South China University of Technology
人間レベルの知能を達成するためには、速く直感的なシステム1から、より遅く慎重なシステム2の推論への移行を洗練させる必要があります。システム1は迅速でヒューリスティックな意思決定に優れていますが、システム2は論理的推論に依存し、より正確な判断とバイアスの軽減を実現します。基盤となる大規模言語モデル(LLM)は迅速な意思決定に優れていますが、複雑な推論に必要な深さが欠けており、真のシステム2思考の特徴である段階的分析を完全には取り入れていません。最近、OpenAIのo1/o3やDeepSeekのR1のような推論LLMは、数学やコーディングなどの分野で専門家レベルのパフォーマンスを示し、システム2の慎重な推論を模倣し、人間のような認知能力を披露しています。本調査は、基盤となるLLMの進展とシステム2技術の初期開発について簡単に概観し、それらの組み合わせが推論LLMの道を開いた方法を探ります。次に、推論LLMを構築する方法について議論し、その特徴、先進的な推論を可能にする核心的手法、およびさまざまな推論LLMの進化を分析します。さらに、推論ベンチマークについての概要を提供し、代表的な推論LLMのパフォーマンスを詳細に比較します。最後に、推論LLMの進展に向けた有望な方向性を探り、最新の発展を追跡するためのリアルタイムのGitHubリポジトリを維持します。この調査が革新を刺激し、この急速に進化する分野での進歩を促進する貴重なリソースとなることを期待しています。
2025-02-24T18:50:52
Reasoning with Latent Thoughts: On the Power of Looped Transformers
http://arxiv.org/abs/2502.17416v1
Nikunj Saunshi, Nishanth Dikkala, Zhiyuan Li, Sanjiv Kumar, Sashank J. Reddi
Google, Toyota Technological Institute at Chicago
大規模言語モデルは優れた推論能力を示しており、スケーリング法則は、特に深さの軸に沿った大規模なパラメータ数が主要な駆動要因であることを示唆しています。本研究では、より強い主張を行います。つまり、多くの推論問題には大きな深さが必要ですが、必ずしも多くのパラメータが必要なわけではありません。これにより、推論のためのループモデルの新たな応用が可能になります。まず、加算や$p$-ホップ誘導、数学問題のような多くの合成推論問題に対して、$k$層のトランスフォーマーが$L$回ループされることで、$kL$層の非ループモデルにほぼ匹敵する性能を発揮し、$k$層モデルよりも大幅に優れていることを示します。これは多くのこのような推論問題が反復アルゴリズムによって解決可能であることを示す理論的結果によってさらに裏付けられています。そして、したがって、ほぼ最適な深さでループモデルを用いて効果的に解くことができます。驚くべきことに、これらの利点は言語モデリングの実用的な設定にも適用されます。多くの下流の推論タスクにおいて、$k$層の言語モデルが$L$回ループされると、$kL$層の言語モデルに匹敵するか、それ以上の競争力を持つことが分かりました。実際、私たちの実証分析は興味深い現象を明らかにしました。ループモデルと非ループモデルは、その有効な深さによってスケーリング挙動を示し、これは思考の連鎖(CoT)推論の推論時間スケーリングに似ています。さらに、ループモデルが潜在的な思考を暗黙的に生成し、$T$回のループで$T$ステップのCoTをシミュレートできることを証明することで、CoT推論との関連を明らかにします。これらの発見に触発されて、推論と記憶の間の興味深い二分法も提示し、両方の面で効果的なループベースの正則化を設計します。
2025-02-24T18:49:05
Dataset Featurization: Uncovering Natural Language Features through Unsupervised Data Reconstruction
http://arxiv.org/abs/2502.17541v1
Michal Bravansky, Vaclav Kubon, Suhas Hariharan, Robert Kirk
データの解釈は現代研究の中心的な要素です。大規模言語モデル(LLM)は、データの自然言語による解釈を提供する可能性があるものの、プロンプトのような単純な特徴抽出手法は、多様なデータセットに対して正確で多用途な説明を生成することがしばしば失敗し、粒度やスケールの制御が欠けています。これらの制限に対処するために、私たちは、抽出される特徴の数に対して正確な制御を提供し、人間の専門家によるラベリングに匹敵するコンパクトで説明的な表現を維持するドメイン非依存のデータセット機能化手法を提案します。私たちの手法は、情報を含むバイナリ特徴の選択を最適化し、それらの特徴を使用して元のデータを再構成する際のLLMの能力を評価します。私たちは、データセットモデリングタスクでの効果を実証し、2つのケーススタディを通じて具体例を示します:(1)人間が作成した一連の攻撃の効果と多様性の両方をコンパクトに捉える脱獄戦術の特徴表現の構築;(2)人間の好みに合った特徴の発見を自動化し、専門家が作成した特徴に匹敵する精度と堅牢性を達成します。さらに、パイプラインは効果的にスケールし、追加の特徴がサンプリングされるにつれて改善されることを示し、大規模で多様なデータセットに適したものとなっています。
2025-02-24T18:42:33
PosterSum: A Multimodal Benchmark for Scientific Poster Summarization
http://arxiv.org/abs/2502.17540v1
Rohit Saxena, Pasquale Minervini, Frank Keller
University of Edinburgh, Institute for Language, Cognition and Computation, School of Informatics
視覚的に複雑なコンテンツ、例えば科学ポスターのようなマルチモーダル文書から正確かつ簡潔なテキスト要約を生成することは困難です。私たちは、科学ポスターを理解し、研究論文の要約にまとめることができるビジョン-ランゲージモデルの開発を進めるための新しいベンチマーク「PosterSum」を紹介します。私たちのデータセットには、対応する要約としてのアブストラクトとペアになった16,305枚の会議ポスターが含まれています。各ポスターは画像形式で提供され、複雑なレイアウト、密なテキスト領域、表、図など、さまざまな視覚的理解の課題を提示します。私たちはPosterSumで最先端のマルチモーダル大規模言語モデル(MLLM)をベンチマークし、彼らが科学ポスターを正確に解釈し要約するのに苦労していることを示します。私たちは「Segment & Summarize」という階層的手法を提案し、従来のMLLMを自動評価指標で上回り、ROUGE-Lで3.14%の改善を達成しました。これは、ポスターの要約に関する将来の研究の出発点となるでしょう。
2025-02-24T18:35:39
Large Language Models are Powerful EHR Encoders
http://arxiv.org/abs/2502.17403v1
Stefan Hegselmann, Georg von Arnim, Tillmann Rheude, Noel Kronenberg, David Sontag, Gerhard Hindricks, Roland Eils, Benjamin Wild
電子健康記録(EHR)は臨床予測のための豊かな可能性を提供しますが、その固有の複雑さと非均一性は従来の機械学習アプローチにとって重要な課題をもたらします。大規模なラベルなしEHRデータのコレクションで訓練されたドメイン特化型EHR基盤モデルは、予測精度と一般化の改善を示していますが、多様で高品質なデータセットへの限られたアクセスやコーディング基準と医療実践の不一致によってその訓練は制約されています。本研究では、一般目的の大規模言語モデル(LLM)に基づく埋め込み手法をEHRエンコーダーとして使用する可能性を探ります。患者記録を構造化されたMarkdownテキストにシリアル化し、コードを人間が読みやすい記述に変換することで、大規模な公開コーパスで事前訓練されたLLMの広範な一般化能力を利用し、独自の医療データセットの必要性を回避します。 当研究では、EHRSHOTベンチマークからの15の多様な臨床予測タスクにおいて、GTE-Qwen2-7B-InstructとLLM2Vec-Llama3.1-8B-Instructという2つの最先端LLM埋め込みモデルを体系的に評価し、EHR特化型基盤モデルであるCLIMBR-T-Baseおよび従来の機械学習ベースラインとその性能を比較します。私たちの結果は、LLMに基づく埋め込みがしばしば専門モデルの性能と一致するか、それを超えることを示しており、特に少数ショットの状況でも効果的であり、その効果は基盤となるLLMのサイズと利用可能なコンテキストウィンドウの大きさに比例してスケールします。全体として、私たちの発見は、EHRエンコーディングのためにLLMを再利用することが、従来のEHRモデリングの制限を克服し、より相互運用性のある一般的な医療アプリケーションの促進を可能にするスケーラブルで効果的なアプローチであることを示しています。
2025-02-24T18:30:36
FIG: Forward-Inverse Generation for Low-Resource Domain-specific Event Detection
http://arxiv.org/abs/2502.17394v1
Tanmay Parekh, Yuxuan Dong, Lucas Bandarkar, Artin Kim, I-Hung Hsu, Kai-Wei Chang, Nanyun Peng
University of California, Los Angeles, Google
イベント検出(ED)は、自然言語テキストから関心のあるタイプ別のイベント言及を特定する作業であり、生物医療、法律、疫学の分野におけるドメイン特有の推論に役立ちます。しかし、さまざまなドメインにおける数千のイベントに対して監視データを調達することは、労力がかかり高価な作業です。このため、既存の研究は、前方生成(ラベルのない文に対するラベルを生成する)と逆生成(生成されたラベルから文を生成する)を通じた合成データ生成を探求してきました。しかし、前方生成はしばしばノイズの多いラベルを生成し、逆生成はドメインドリフトや不完全なイベント注釈に苦しんでいます。これらの課題に対処するために、我々はFIGを導入します。FIGは、逆生成を利用して高品質のデータ合成を行い、ラベルのないターゲットデータに対する前方生成を通じて抽出したドメイン特有の手がかりに基づいてそれを固定するハイブリッドアプローチです。FIGは、前方生成に基づく洗練によって欠落した注釈を追加することでその合成データをさらに強化します。多様なドメインからの3つのEDデータセットでの実験により、FIGは最良のベースラインを上回り、ゼロショットおよびフューショットの設定でそれぞれ平均3.3% F1および5.4% F1の向上を達成することが示されました。生成されたトリガーヒット率と人間による評価の分析は、FIGの優れたドメイン適合性とデータ品質が既存のベースラインと比較して優れていることを裏付けています。
2025-02-24T18:20:42
Emoti-Attack: Zero-Perturbation Adversarial Attacks on NLP Systems via Emoji Sequences
http://arxiv.org/abs/2502.17392v1
Yangshijie Zhang
Lanzhou University
深層ニューラルネットワーク(DNN)は、自然言語処理(NLP)の分野で驚異的な成功を収めており、ChatGPTなどの広く認識されたアプリケーションを生み出しています。しかし、これらのモデルが敵対的攻撃に対して脆弱であることは依然として重要な懸念事項です。画像のような連続的な領域とは異なり、テキストは離散的な空間に存在するため、文、単語、または文字レベルでのわずかな変化も人間には容易に認識されることが多いです。この固有の離散性は、テキストが非微分可能であるため、従来の最適化技術の使用を複雑にします。テキストにおける敵対的攻撃に関する以前の研究は、文字レベル、単語レベル、文レベル、および多層アプローチに重点を置いており、いずれも複数のクエリが必要であったり、重要な意味の変化が生じたりするために効率が悪いか、認識されやすいという問題に悩まされています。本研究では、絵文字を操ることで微妙かつ効果的な摂動を生み出す新しい敵対的攻撃手法、Emoji-Attackを提案します。文字および単語レベルの戦略とは異なり、Emoji-Attackは攻撃の異なる層として絵文字をターゲットにすることで、テキストへの最小限の混乱を伴いながらも、あまり目立たない変化をもたらします。このアプローチは、通常、文字レベルの攻撃の延長として絵文字の挿入に焦点を当ててきた従来の研究ではほとんど探求されていませんでした。私たちの実験は、Emoji-Attackが大規模モデルと小規模モデルの両方で強力な攻撃性能を達成することを示しており、NLPシステムの敵対的堅牢性を高めるための有望な技術となることを示唆しています。
2025-02-24T18:20:18
The Empirical Impact of Reducing Symmetries on the Performance of Deep Ensembles and MoE
http://arxiv.org/abs/2502.17391v1
Andrei Chernov, Oleg Novitskij
HSE University, Independent Researcher
最近の研究では、ニューラルネットワークの対称性を減少させることで、パラメータ空間の整列を必要とせずにネットワーク間の線形モード接続性が強化され、線形補間されたニューラルネットワークの性能が向上することが示されています。しかし、実際のアプリケーションでは、ニューラルネットワークの補間はほとんど使用されず、代わりにネットワークのアンサンブルが一般的です。本論文では、対称性を減少させることが深層アンサンブルと専門家の混合(MoE)の性能に与える影響を、5つのデータセットを通じて実証的に調査します。また、より深い線形モード接続性を探るために、補間された専門家の混合(MoIE)を導入します。私たちの結果は、非対称ニューラルネットワークに基づいて構築された深層アンサンブルが、対称ネットワークのサイズが増加するのに対して、はるかに良い性能を発揮することを示しています。一方で、対称性の削減がMoEとMoIEアーキテクチャの両方に影響を与えるかどうかについて、私たちの実験は決定的な証拠を提供していません。
2025-02-24T18:16:23
Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models
http://arxiv.org/abs/2502.17387v1
Alon Albalak, Duy Phung, Nathan Lile, Rafael Rafailov, Kanishk Gandhi, Louis Castricato, Anikait Singh, Chase Blagden, Violet Xiang, Dakota Mahan, Nick Haber
SynthLabs, Stanford University
推論モデルへの関心が高まる中で、数学はアルゴリズムや手法の改善のための重要なテストの場となっています。しかし、既存のオープン数学データセットは、質の高い人間が作成した問題の小規模なコレクションか、不確かな質の機械生成問題の大規模コーパスのいずれかしか含まれておらず、研究者は質と量の間で選択を強いられています。本研究では、確認可能な解答を持つ25万以上の高品質な数学問題から構成されたデータセット「Big-Math」を紹介します。これは強化学習(RL)用に特別に作成されました。Big-Mathを作成するために、オープンに利用可能なデータセットを厳密にフィルタリング、クリーンアップ、キュレーションし、以下の3つの要件を満たす問題を抽出しました:(1) 唯一に確認可能な解決策を持つ問題、(2) オープンエンドの問題、(3) 閉形式解を持つ問題。Big-Mathの品質を確保するために、私たちはフィルタリングプロセスの各ステップを手動で検証します。フィルタリングプロセスの結果に基づき、確認済みの解答を持つ47,000の新しい問題を導入し、「Big-Math-Reformulated」を提供します。これは、体系的な再形成アルゴリズムを通じてオープンエンドの質問に再形成された閉エンドの質問(すなわち、多肢選択問題)です。最も一般的に使用されている既存のオープンソース数学推論データセットであるGSM8kやMATHと比較して、Big-Mathは1桁大きく、厳格なフィルタリングにより、強化学習に最も適した問題を維持しています。また、データセットの厳密な分析を提供しており、Big-Mathは問題領域において高い多様性を含み、さまざまな難易度の問題を組み込んでおり、異なる能力とトレーニング要求を持つモデルのための広範な下流での使用を可能にします。データの質と量のギャップを埋めることにより、Big-MathはLLMにおける推論の進展のための堅牢な基盤を確立します。
2025-02-24T18:14:01
Low-Rank and Sparse Model Merging for Multi-Lingual Speech Recognition and Translation
http://arxiv.org/abs/2502.17380v2
Qiuming Zhao, Guangzhi Sun, Chao Zhang, Mingxing Xu, Thomas Fang Zheng
Tsinghua University, University of Cambridge
言語の多様性は、自動音声認識や翻訳などの音声からテキスト(S2T)タスクにおいて重要な課題を提起します。従来のマルチタスクトレーニングアプローチは、さまざまな言語にわたる複数の音声認識および翻訳タスクを共同で最適化することを目指しています。これらの戦略に基づいて構築されたWhisperのようなモデルは強力な性能を示していますが、高い計算コスト、言語の干渉、最適でないトレーニング設定、限られた拡張性といった問題に直面しています。これらの課題を克服するために、異なる言語やタスクで訓練されたモデルを効率的に統合し、性能を保持しつつ計算オーバーヘッドを削減することを目的とした新しい技術「LoRS-Merging(低ランクおよびスパースモデルのマージ)」を提案します。LoRS-Mergingは、低ランクとスパースプルーニングを組み合わせて、冗長なパラメータを排除しつつ重要な構造を保持し、言語やタスクの干渉を軽減し、拡張性を強化します。さまざまな言語における実験結果は、LoRS-Mergingが従来のマルチリンガルマルチタスクトレーニングのベースラインと比較して、単語誤り率を10%削減し、BLEUスコアを4%向上させることを示しています。我々の発見は、モデルのマージ、特にLoRS-MergingがS2Tアプリケーションにおける従来のマルチリンガルトレーニング戦略に対するスケーラブルで効果的な補完であることを示唆しています。
2025-02-24T18:06:57
Experimental validation of UAV search and detection system in real wilderness environment
http://arxiv.org/abs/2502.17372v1
Stella Dumenčić, Luka Lanča, Karlo Jakac, Stefan Ivić
捜索救助(SAR)ミッションには、特に困難でアクセスが難しい環境において、生存者を見つけるための信頼できる検索方法が求められます。これが、無人航空機(UAV)を導入することでSARミッションの効率を向上させると同時に、ミッションに関与するすべての人の安全を増すのに大いに役立つ理由です。これに動機づけられ、私たちは地中海のカルスト環境における人間の自律UAV捜索を設計し、実験を行います。UAVは、既知の確率密度と検出関数に基づいた熱方程式駆動のエリアカバレッジ(HEDAC)エルゴード制御方法を使用して指示されます。実装されたセンサーFrameworkは、確率的検索モデル、運動制御システム、およびコンピュータビジョンによる物体検出で構成されています。これにより、SARミッションにおけるターゲットが検出される確率の計算が可能になります。本論文は、提案された確率的フレームワークとUAV制御の実験的検証に焦点を当てています。均一な確率密度を確保し、希望される捜索エリア内でターゲットを見つける確率を均等にするために、78人のボランティアに適切に考慮されたタスクが割り当てられます。検出モデルはYOLOに基づき、以前に収集されたオルソフォト画像データベースでトレーニングされています。実験的な捜索は慎重に計画・実施され、できる限り多くのパラメータが記録されます。徹底的な分析には運動制御システム、物体検出、捜索の検証が含まれます。検出と捜索のパフォーマンスの評価は、UAV制御アルゴリズムにおける設計された検出モデルが現実世界の結果と一致していることを示す強い根拠を提供します。
2025-02-24T17:53:54
Bridging Gaps in Natural Language Processing for Yorùbá: A Systematic Review of a Decade of Progress and Prospects
http://arxiv.org/abs/2502.17364v1
Toheeb A. Jimoh, Tabea De Wille, Nikola S. Nikolov
University of Limerick
自然言語処理 (NLP) は、機械が人間の言語を理解する必要性が欠かせないものとして、人工知能の優勢なサブセットになりつつあります。いくつかのNLPアプリケーションは、ソーシャルネットワーキングサイトなどのメディアを通じて毎日生み出される膨大なデータセットの影響もあり、広く普及しています。しかし、アフリカのほとんどの言語においては、資源の制約などの問題により、この成長は顕著ではありません。トーンと形態的に豊かなアフリカの言語であるヨルバ語も同様の運命に苦しんでおり、その結果、NLPの利用が限られています。この状況を改善するためのさらなる研究を促進するために、この体系的文献レビューは、ヨルバ語のNLP開発に関する研究を総合的に分析し、課題、リソース、技術、アプリケーションを特定することを目的としています。構造化プロトコルからの明確に定義された検索文字列を使用して、2014年から2024年の間に名声のあるデータベースから105件の主要研究を検索、選択、分析しました。このレビューは、注釈付きコーパスの不足、事前トレーニングされた言語モデルの限られた入手可能性、トーンの複雑さやダイアクリティック依存性といった言語的な課題を重要な障害として強調しています。また、ルールベースの方法など、顕著な技術も明らかになりました。これらの結果は、社会文化的要因(コードスイッチングやデジタル使用のための言語の放棄など)によって制約されているものの、多言語および単一言語のリソースが増加していることを示しています。このレビューは既存の研究を統合し、ヨルバ語および一般的にアフリカの言語のNLPを進めるための基盤を提供します。また、将来の研究のためにギャップと機会を特定することで、ヨルバ語や他の資源が不足しているアフリカの言語がグローバルなNLPの進展に広く含まれることに貢献することを目指しています。
2025-02-24T17:41:48
RELICT: A Replica Detection Framework for Medical Image Generation
http://arxiv.org/abs/2502.17360v1
Orhun Utku Aydin, Alexander Koch, Adam Hilbert, Jana Rieger, Felix Lohrke, Fujimaro Ishida, Satoru Tanioka, Dietmar Frey
合成医療データが深層学習モデルの拡張や一般化能力の向上に寄与する可能性があるにもかかわらず、生成モデルにおける記憶は、機密患者情報の意図しない漏洩を引き起こし、モデルの有用性を制限する可能性があります。したがって、医療分野における記憶する生成モデルの使用は、患者のプライバシーを脅かす可能性があります。私たちは、合成医療画像データセット内でトレーニングデータのほぼ同一のコピー、すなわちレプリカを特定するためのフレームワークを提案します。私たちの医療画像生成モデルのためのREpLIca deteCTion(RELICT)フレームワークは、以下の3つの補完的アプローチを使用して画像の類似性を評価します:(1)ボクセルレベルの分析、(2)事前にトレーニングされた医療基盤モデルによる特徴レベルの分析、および(3)セグメンテーションレベルの分析です。臨床的に関連する3つの3D生成モデリングの使用例を調査しました:頭部CT(N=774)における非造影の脳内出血とウィリス動脈輪の時間飛行MR血管造影(N=1,782)です。専門家による視覚スコアリングを参照基準として使用し、レプリカの存在を評価しました。私たちは、レプリカ分類性能を評価するための最適なしきい値でのバランスの取れた精度を報告します。参照視覚評価では、NCCTおよびTOF-MRAの使用例に対して、それぞれ生成画像の50枚中45枚と50枚中5枚をレプリカとして特定しました。画像レベルおよび特徴レベルの測定は、NCCTの使用例に対して最適なしきい値が選択されたときに、1のバランスの取れた精度でレプリカを完全に分類しました。TOF-MRAのケースでは、どのしきい値でもレプリカの完全な分類は不可能であり、セグメンテーションレベルの分析は0.79のバランスの取れた精度を達成しました。レプリカの検出は、医療画像における生成モデルの開発において重要でありながら見落とされがちな検証ステップです。提案されたRELICTフレームワークは、レプリカ検出のための標準化された使いやすいツールを提供し、責任を持って倫理的な医療画像合成を促進することを目指します。
2025-02-24T17:37:19
DIS-CO: Discovering Copyrighted Content in VLMs Training Data
http://arxiv.org/abs/2502.17358v2
André V. Duarte, Xuandong Zhao, Arlindo L. Oliveira, Lei Li
どのようにして、トレーニングデータへの直接アクセスなしに、大規模ビジョン・言語モデル(VLM)が著作権のあるコンテンツを使用していたかどうかを確認できますか?VLMがトレーニングコーパスからの画像を認識できるという仮説に基づき、私たちはDIS-COという新しいアプローチを提案します。これにより、モデルの開発中に著作権のあるコンテンツが含まれているかどうかを推測します。特定のフレームをターゲットとした著作権コンテンツから繰り返しVLMに質問することで、DIS-COは自由形式のテキスト補完を通じてコンテンツのアイデンティティを抽出します。その効果を評価するために、トレーニングカットオフ前後に公開された映画から取得した詳細なキャプションとペアになった14,000フレームを含むベンチマーク「MovieTection」を導入します。私たちの結果は、DIS-COが検出性能を大幅に向上させ、ロジットが利用可能なモデルにおける最良の以前のメソッドの平均AUCをほぼ倍増させることを示しています。また、私たちの発見は、すべてのテストされたモデルが著作権のあるコンテンツに何らかの形で晒されていたように見えるというより広い懸念を浮き彫りにしています。私たちのコードとデータは、https://github.com/avduarte333/DIS-CO にて入手可能です。
2025-02-24T17:36:49
On the Vulnerability of Concept Erasure in Diffusion Models
http://arxiv.org/abs/2502.17537v1
Lucas Beerens, Alex D. Richardson, Kaicheng Zhang, Dongdong Chen
テキストから画像への拡散モデルの普及は、特に著作権のある画像や有害な画像の生成に関して重大なプライバシーとセキュリティの懸念を引き起こしています。これらの問題に対処するために、機械の学習解除に関する研究は、ポストホックトレーニングを通じて望ましくないデータの影響を取り除くことを目的としたさまざまな概念除去手法を開発しました。しかし、我々はこれらの除去技術が脆弱であり、削除された概念の画像が依存的に作成されたプロンプトを使用してまだ生成できることを示します。我々は、削除されたコンテンツの生成を引き出すことができるプロンプトを発見する座標降下ベースのアルゴリズム「RECORD」を導入します。我々は、RECORDが現在の最先端の攻撃手法の攻撃成功率を大幅に上回ることを示します。さらに、我々の発見は、概念除去にさらされたモデルが以前に予想されていたよりも敵対的攻撃に対してより脆弱であることを明らかにし、より堅牢な学習解除アプローチの緊急性を強調しています。我々は、すべてのコードをhttps://github.com/LucasBeerens/RECORDでオープンソースとして公開します。
2025-02-24T17:26:01
HybridLinker: Topology-Guided Posterior Sampling for Enhanced Diversity and Validity in 3D Molecular Linker Generation
http://arxiv.org/abs/2502.17349v1
Minyeong Hwang, Ziseok Lee, Gwangsoo Kim, Kyungsu Kim, Eunho Yang
リンク生成は、リード最適化やPROTAC設計などの創薬応用において重要であり、ここでは分子フラグメントが多様な医薬候補に組み合わされます。既存の手法は、3Dポイントクラウド(PC)の使用に基づいてPCフリーおよびPCアウェアのカテゴリーに分類されます。PCフリーモデルは多様性を重視しますが、PCの制約を無視するため有効性が低下します。一方、PCアウェアモデルは高い有効性を保証しますが、厳しいPC制約を課すため多様性が制限されます。追加のトレーニングなしでこれらのトレードオフを克服するために、私たちはHybridLinkerを提案します。これは、事前にトレーニングされたPCフリーモデルから提供される多様な結合トポロジーをガイダンスとして利用して、PCアウェア推論を強化するフレームワークです。私たちの提案の中心にあるのは、PCフリーとPCアウェア空間を横断して動作する最初の拡散事後サンプリング(DPS)メソッドであるLinkerDPSであり、エネルギーにインスパイアされた関数を通じて分子トポロジーと3Dポイントクラウドをつなぎます。PCフリーモデルの多様なサンプリング分布をPCアウェア分布に転送することで、HybridLinkerはベースラインを大幅に一貫して上回り、基礎的な分子設計や応用特性最適化タスクにおける有効性と多様性を向上させ、新たなDPSフレームワークを画像以外の分子およびグラフ領域で確立します。
2025-02-24T17:23:40
Time series forecasting based on optimized LLM for fault prediction in distribution power grid insulators
http://arxiv.org/abs/2502.17341v1
João Pedro Matos-Carvalho, Stefano Frizzo Stefenon, Valderi Reis Quietinho Leithardt, Kin-Choong Yow
電力網の絶縁体における表面汚染は、漏れ電流の増加を引き起こし、電気放電が発生するまで続き、これが電力システムの停止を招く可能性があります。電力停止を引き起こす障害の可能性を軽減するためには、汚染と漏れ電流を監視することで障害の進行を予測するのに役立ちます。このニーズを考慮して、本論文では高電圧絶縁体における漏れ電流の増加を予測するためのハイブリッド深層学習(DL)モデルを提案します。このハイブリッド構造は、木構造パルゼン推定を用いた多基準最適化を考慮し、信号ノイズの減衰のための入力段フィルターと、時系列予測に適用される大規模言語モデル(LLM)を組み合わせています。提案された最適化LLMは、短期予測において2.24$\times10^{-4}$、中期予測において1.21$\times10^{-3}$の平均二乗誤差を示し、最先端のDLモデルを上回る性能を発揮します。
2025-02-24T17:17:15
Mutual Reinforcement of LLM Dialogue Synthesis and Summarization Capabilities for Few-Shot Dialogue Summarization
http://arxiv.org/abs/2502.17328v1
Yen-Ju Lu, Ting-Yao Hu, Hema Swetha Koppula, Hadi Pouransari, Jen-Hao Rick Chang, Yin Xia, Xiang Kong, Qi Zhu, Simon Wang, Oncel Tuzel, Raviteja Vemulapalli
Johns Hopkins University, Apple
本研究では、少ない事例による対話要約タスクを改善するために、LLMs内で相互強化データ合成(MRDS)を提案します。従来の方法が外部知識を必要とするのに対し、私たちはLLMの対話合成と要約能力を相互に強化し、トレーニング中にお互いを補完し、全体のパフォーマンスを向上させることを可能にします。対話合成能力は、要約能力からの優先スコアを用いた指向的な優先順位最適化によって強化されます。要約能力は、対話合成能力によって生成された高品質な対話-要約ペアデータの追加により強化されます。提案するMRDSメカニズムを活用することで、LLMの内部知識を合成データの形式で引き出し、それを利用して少数の実際のトレーニングデータセットを拡張します。実証結果は、我々の方法が対話要約を改善し、少数事例設定においてROUGEスコアで1.5%、BERTスコアで0.3%の向上を達成することを示しています。さらに、我々の方法は、人間評価において最も高い平均スコアを達成し、事前学習されたモデルや要約タスクのためのファインチューニングのみで調整されたベースラインを上回っています。
2025-02-24T17:01:48
AnyTop: Character Animation Diffusion with Any Topology
http://arxiv.org/abs/2502.17327v1
Inbar Gat, Sigal Raab, Guy Tevet, Yuval Reshef, Amit H. Bermano, Daniel Cohen-Or
Tel Aviv University
任意のスケルトンの動きを生成することは、コンピュータグラフィックスにおける長年の課題であり、多様なデータセットの不足とデータの不規則な性質のために、ほとんど探求されていません。この研究では、任意のスケルトン構造を入力として使用し、異なる動的特性を持つ多様なキャラクターの動きを生成する拡散モデル「AnyTop」を紹介します。この研究は、任意のスケルトン学習に特化したトランスフォーマーに基づくデノイジングネットワークを特徴としており、従来のアテンションメカニズムにトポロジー情報を統合しています。さらに、潜在特徴表現にテキストによる関節の説明を組み込むことで、AnyTopは多様なスケルトン間の関節の意味的対応関係を学習します。評価の結果、AnyTopは、トポロジーごとにわずか3つのトレーニング例でも良好に一般化し、見たことのないスケルトンの動きも生成できることが示されました。さらに、私たちのモデルの潜在空間は非常に情報豊かであり、関節対応、時間的セグメンテーション、動きの編集などの下流タスクを可能にします。私たちのウェブページ(https://anytop2025.github.io/Anytop-page)には、ビデオやコードへのリンクが含まれています。
2025-02-24T17:00:36
TDMPBC: Self-Imitative Reinforcement Learning for Humanoid Robot Control
http://arxiv.org/abs/2502.17322v1
Zifeng Zhuang, Diyuan Shi, Runze Suo, Xiao He, Hongyin Zhang, Ting Wang, Shangke Lyu, Donglin Wang
Westlake University
高次元の複雑な空間で高い自由度と複雑な行動空間を持つヒューマノイドロボットのようなシステムは、限られたサンプル予算の下で探索と活用のバランスを賢く取る必要があるため、強化学習(RL)アルゴリズムにとって重大な課題を提示します。一般的に、複雑な高次元空間内でタスクを達成するための実行可能な領域は非常に狭いです。たとえば、ヒューマノイドロボットの動作制御の文脈では、広大な空間が倒れることに対応しており、立っていることに対応するのはわずかな部分だけであり、これは下流のタスクの完了に好都合です。ロボットが潜在的なタスク関連の領域に探索を行った場合、その領域内のデータにより重点を置くべきです。この洞察に基づき、私たちは自己模倣強化学習(SIRL)フレームワークを提案します。このフレームワークでは、RLアルゴリズムが潜在的にタスク関連の軌道を模倣します。具体的には、軌道リターンを使用してそのタスクに関連性を判断し、軌道リターンに基づいて重みが動的に調整される追加の行動クローンが採用されます。その結果、提案したアルゴリズムは、120%のパフォーマンス改善を達成し、ヒューマノイドベンチ(HumanoidBench)での5%の追加計算オーバーヘッドで実現します。さらなる視覚化を行ったところ、顕著なパフォーマンス向上は、いくつかのタスクが成功裏に解決されるという意味ある行動改善に繋がることが分かりました。
2025-02-24T16:55:27
Child vs. machine language learning: Can the logical structure of human language unleash LLMs?
http://arxiv.org/abs/2502.17304v1
Uli Sauerland, Celia Matthaei, Felix Salfner
ZAS, HU Berlin, None
私たちは、人間の言語学習が現在の大規模言語モデル(LLM)の訓練アプローチとは性質的に異なる方法で進行することを主張し、学習バイアスの違いを予測します。その後、ドイツ語の複数形形成に関するLLMからの証拠を示し、人間が問題なく扱える言語の論理の側面を見逃す結果を強力な実装でも生じるという私たちの仮説を確認します。私たちは、人間の言語と人工ニューラルネットワークの異なる構造に注意を払うことが、LLMの性能向上の手段になる可能性が高いと結論付けます。
2025-02-24T16:40:46
Benchmarking Retrieval-Augmented Generation in Multi-Modal Contexts
http://arxiv.org/abs/2502.17297v1
Zhenghao Liu, Xingsheng Zhu, Tianshuo Zhou, Xinyi Zhang, Xiaoyuan Yi, Yukun Yan, Yu Gu, Ge Yu, Maosong Sun
Northeastern University, Microsoft Research Asia, Tsinghua University, Beijing National Research Center for Information Science and Technology
この論文では、マルチモーダルリトリーバル拡張生成(M2RAG)を紹介します。これは、マルチモーダル大規模言語モデル(MLLM)における、マルチモーダルリトリーバル文書からの知識活用の効果を評価するためのベンチマークです。このベンチマークは、画像キャプショニング、マルチモーダル質問応答、マルチモーダル事実確認、および画像再ランキングの4つのタスクで構成されています。すべてのタスクはオープンドメインの設定で行われ、RAGモデルはマルチモーダル文書コレクションからクエリ関連情報を取得し、それをRAGモデリングの入力文脈として使用する必要があります。MLLMの文脈利用能力を向上させるために、マルチモーダルリトリーバル拡張指示チューニング(MM-RAIT)という、マルチモーダル文脈内でMLLMを最適化する指示チューニング手法も導入します。私たちの実験では、MM-RAITがマルチモーダル文脈から効果的に学ぶことを可能にすることで、RAGシステムのパフォーマンスを向上させることを示しています。すべてのデータとコードは、https://github.com/NEUIR/M2RAG で入手可能です。
2025-02-24T16:25:25
A novel approach to navigate the taxonomic hierarchy to address the Open-World Scenarios in Medicinal Plant Classification
http://arxiv.org/abs/2502.17289v1
Soumen Sinha, Tanisha Rana, Rahul Roy
この記事では、植物の階層的分類学を新たなアプローチで提案します。問題をオープンクラス問題として提示します。既存の薬用植物の分類法は、しばしば階層的な分類を行うことや未知の種を正確に特定することができず、包括的な植物分類学における効果を制限しています。このため、未知の種の分類の問題に取り組み、それに適した階層的ラベルを付与します。私たちは、DenseNet121、マルチスケール自己注意(MSSA)、および連鎖型分類器を統合した新しい方法を提案します。このアプローチは、門から種までの複数の分類学的レベルで薬用植物を体系的に分類し、詳細で精密な分類を確保します。マルチスケール空間注意を使用することで、モデルは画像からの局所的および全体的な文脈情報の両方をキャッチし、類似種の区別や新種の特定を改善します。注意スコアを使用して、複数のスケールで重要な特徴に焦点を当てます。提案された方法は階層的分類の解決策を提供し、既知および未知の種の特定において優れた性能を示します。モデルは、背景アーティファクトの有無にかかわらず、二つの最先端データセットでテストされ、実世界の応用に対処するために展開できることを示します。未知の種を使用してモデルをテストしました。未知の種について、モデルは正しい門、クラス、目、科を予測するために、それぞれ83.36%、78.30%、60.34%、43.32%の平均精度を達成しました。私たちの提案したモデルのサイズは、既存の最先端の方法の約4倍小さく、実世界の応用に容易に展開できることを示しています。
2025-02-24T16:20:25
Capability Instruction Tuning: A New Paradigm for Dynamic LLM Routing
http://arxiv.org/abs/2502.17282v1
Yi-Kai Zhang, De-Chuan Zhan, Han-Jia Ye
大規模言語モデル(LLM)は、特に1000億パラメータを超えるモデルにおいて、人間のような指示に従う能力を示しています。一部の小型でリソースフレンドリーなLLMは、大型LLMが優れているほとんどの指示に対処することができます。本研究では、各指示に対して最も優れたLLMをルーティングする方法を探り、全体的なパフォーマンスを向上させることを目指します。モデルの能力表現、ユーザーの指示、パフォーマンス調査のプロンプトを用いて、能力指示を構築する新しいパラダイムを開発します。能力指示から学ぶために、異なるモデルが得意または苦手とする点に基づいて正のサンプルと負のサンプルを生成する新しいエンドツーエンドのフレームワークである「モデル選択適性テスト(Model-SAT)」を導入します。モデル-SATはモデル能力エンコーダーを使用し、そのモデル表現を軽量なLLMに拡張します。我々の実験は、Model-SATが候補モデルのパフォーマンスの次元を理解し、さまざまな指示を処理する能力の確率を提供することを示しています。さらに、デプロイメント中に新しいモデルは、各20ショットの50のタスクにわたって適性テストの結果を迅速に推論することができます。Model-SATは、候補推論なしで最先端のモデルルーティングを実現し、現実世界の新しいモデルリリースシナリオでも機能します。コードは https://github.com/Now-Join-Us/CIT-LLM-Routing で入手できます。
2025-02-24T16:10:53
Unveiling Downstream Performance Scaling of LLMs: A Clustering-Based Perspective
http://arxiv.org/abs/2502.17262v1
Chengyin Xu, Kaiyuan Chen, Xiao Li, Ke Shen, Chenggang Li
ByteDance
コンピューティングの急速な進展は、大規模言語モデル(LLM)のトレーニングの規模とコストを劇的に増加させています。モデルのトレーニング前に下流タスクのパフォーマンスを正確に予測することは、効率的なリソース配分にとって重要ですが、主に次の2つの制約のために困難です:(1)「出現現象」、つまり下流パフォーマンス指標が広範なトレーニングの後にのみ意味を持つようになり、小規模モデルを予測に使用する能力が制限されること;(2)タスクの難易度分布が不均一で、一貫したスケーリング法則が存在しないため、指標の変動が大きいこと。既存のパフォーマンス予測方法は、精度と信頼性が限られているため、潜在的なLLMの能力の評価を妨げています。これらの課題に対処するために、我々はクラスターオン・ディフィカルト(COD)下流パフォーマンス予測フレームワークを提案します。CODはまず、難易度の特徴に基づいてタスクをクラスタリングすることで予測可能なサポートサブセットを構築し、戦略的に非出現および非スケーラブルなクラスターを除外します。選ばれたサブセットのスコアは、全体評価セットに対する下流パフォーマンスの効果的な中間予測因子として機能します。理論的なサポートにより、我々は予測可能なサブセットから全体評価セットへのパフォーマンス指標を変換するマッピング関数を導出し、LLMの下流パフォーマンスの正確な外挿を確保します。提案された手法は、70B LLMのパフォーマンススケーリングを予測するために適用され、トレーニングリソースの配分に対する実行可能な洞察を提供し、トレーニングプロセスのモニタリングを支援しています。特に、CODは小型モデルのアンサンブルを活用することで70B LLMに対して素晴らしい予測精度を達成し、8つの重要なLLM評価ベンチマークにわたって絶対平均偏差1.36%を示しています。
2025-02-24T15:44:57
The Lottery LLM Hypothesis, Rethinking What Abilities Should LLM Compression Preserve?
http://arxiv.org/abs/2502.17535v1
Zhenheng Tang, Xiang Liu, Qian Wang, Peijie Dong, Bingsheng He, Xiaowen Chu, Bo Li
The Hong Kong University of Science and Technology, National University of Singapore
LLMの計算コストとストレージコストを削減することに動機づけられたモデル圧縮とKVキャッシュ圧縮は、研究者から多くの注目を集めています。しかし、現在の手法は主に圧縮されたLLMのパフォーマンスを維持すること、すなわち常識的知識に関するQAや基本的な算術推論のタスクにおける困惑度や単純な精度で測定されることに重点を置いています。このブログでは、検索強化生成、マルチステップ推論、外部ツール、計算的表現力に関連するLLMの最近の進展について簡単にレビューします。これらはすべて、LLMのパフォーマンスを大幅に向上させるものです。その後、特定のLLMとタスクに対して、マルチステップ推論と外部ツールの支援を受けて、元のLLMと同じパフォーマンスを発揮できる小型のロトLLMが存在するというロトLLM仮説を提案します。LLMの現在の進展のレビューに基づいて、ロトLLMとKVキャッシュ圧縮が現在の手法では見落とされている、持つべき重要な能力について議論し、要約します。
2025-02-24T15:39:35
Detecting Benchmark Contamination Through Watermarking
http://arxiv.org/abs/2502.17259v1
Tom Sander, Pierre Fernandez, Saeed Mahloujifar, Alain Durmus, Chuan Guo
ベンチマークの汚染は、大規模言語モデル(LLM)の評価の信頼性に大きな課題をもたらします。モデルがテストセットで訓練されたかどうかを確認するのが難しいからです。この問題に対する解決策として、リリース前にベンチマークに透かしを入れる方法を提案します。この埋め込みプロセスでは、元の質問を透かし入りのLLMで再定式化し、ベンチマークの有用性を損なわないようにします。評価中に、理論的に基づいた統計的検定を用いて、モデルのトレーニング時にテキストの透かしが残す「放射能」、すなわち痕跡を検出できます。私たちは、制御されたベンチマーク汚染の下、10Bトークンで1Bモデルをゼロから事前に訓練し、ARC-Easy、ARC-Challenge、MMLUにおける汚染検出の有効性を検証しました。結果は、透かし入れ後のベンチマークの有用性が類似しており、モデルが性能を向上させるのに十分な汚染がある場合に成功裡に汚染を検出することを示しています。例えば、ARC-Easyにおいて$p$-val $=10^{-3}$で+5$\%$の性能向上がありました。
2025-02-24T15:39:31
Tidiness Score-Guided Monte Carlo Tree Search for Visual Tabletop Rearrangement
http://arxiv.org/abs/2502.17235v1
Hogun Kee, Wooseok Oh, Minjae Kang, Hyemin Ahn, Songhwai Oh
Seoul National University, Ulsan National Institute of Science and Technology (UNIST)
本論文では、RGB-Dカメラのみを使用してテーブル上の整理問題に対処するために設計された新しいフレームワークである、「整頓スコアに基づくモンテカルロツリーサーチ」(TSMCTS)を提案します。テーブル上の整理問題における二つの主要な課題に取り組みます。(1) 公共データセットとベンチマークの不足、(2) 未知の物体の目標構成を指定することの難しさです。前者には、シミュレーションで収集された構造化データセットである「テーブル上の整理(TTU)データセット」を提示することで対処します。このデータセットを使用して、整頓スコアを予測できる視覚に基づく識別器を訓練します。この識別器は、未知の構成を含む実世界のシーンにおいても、一貫して整頓の程度を評価できます。第二の問題に対処するため、モンテカルロツリーサーチ(MCTS)を用いて明示的な目標を指定することなく整理の軌跡を見つけます。特定の目標を提供する代わりに、整頓スコアをガイダンスとして用いることで、MCTSベースのプランナーが多様な整頓された構成を見つけられることを示します。したがって、最適な整頓配置を見つけるために、整頓識別器とMCTSベースの整理プランナーを統合したTSMCTSを提案します。TSMCTSは、コーヒーテーブル、ダイニングテーブル、オフィスデスク、バスルームなど、さまざまな環境でその能力を成功裏に示しました。TTUデータセットは、次のリンクから入手可能です:https://github.com/rllab-snu/TTU-Dataset。
2025-02-24T15:12:29
Making LLMs Reason? The Intermediate Language Problem in Neurosymbolic Approaches
http://arxiv.org/abs/2502.17216v1
Alexander Beiser, David Penz
TU Wien
論理的推論タスクは、大規模言語モデル(LLMs)に対する挑戦として現れます。神経シンボリックアプローチは、LLMsを使用して自然言語で定式化された論理的推論問題を形式的な中間言語に翻訳します。次に、シンボリック推論器を使用することで、信頼性の高い解決が得られます。しかし、LLMsはしばしば不適切に選ばれた中間言語のために翻訳に失敗します。私たちは、中間言語の問題を提起します。これは、神経シンボリックアプローチに適した形式言語表現を選ぶという問題です。理論的には、この問題の根本的な原因は、LLMsが構文と意味を区別できないことと、問題の表現からの相対的な独立性にあると主張します。実験的に、Answer Set ProgrammingとPython Knowledge Engineという2つの中間言語を対比させることで、その存在を示します。さらに、補足的なコンテキスト情報のさまざまな度合いの効果を示します。私たちの結果は、全体の精度で最大53.20%、実行精度で49.26%の差を示しています。GPT4o-mini LLMを使用すると、ProntoQAデータセットにおける全体の精度で最先端技術を21.20%、ProofWriterデータセットで50.50%上回ります。
2025-02-24T14:49:52
Deep Learning-Powered Electrical Brain Signals Analysis: Advancing Neurological Diagnostics
http://arxiv.org/abs/2502.17213v1
Jiahe Li, Xin Chen, Fanqi Shen, Junru Chen, Yuxin Liu, Daoze Zhang, Zhizhang Yuan, Fang Zhao, Meng Li, Yang Yang
Zhejiang University, DiFint Technology, Shanghai Institute of Microsystem and Information Technology, Chinese Academy of Sciences, University of Chinese Academy of Sciences, The INSIDE Institute for Biological and Artificial Intelligence
神経障害は世界的な健康上の重大な課題を示しており、脳信号分析方法の進展を促しています。頭皮脳波計(EEG)および頭蓋内脳波計(iEEG)は、神経条件の診断およびモニタリングに広く使用されています。しかし、データセットの異質性やタスクの変動が堅牢なディープラーニングソリューションの開発において課題をもたらしています。本レビューは、46のデータセットを使用して7つの神経障害におけるEEG/iEEGベースの神経診断のための最近のディープラーニングアプローチの進展を系統的に検討します。データの利用動向、モデルデザイン、タスク特有の適応について探求し、スケーラブルで一般化可能なソリューションのための事前訓練されたマルチタスクモデルの重要性を強調します。研究を進展させるために、多様なデータセットにおけるモデルを評価するための標準化されたベンチマークを提案し、再現性を向上させます。この調査は、最近の革新が神経診断をどのように変革し、インテリジェントで適応可能なヘルスケアソリューションの開発を可能にできるかを強調しています。
2025-02-24T14:45:05
From Euler to AI: Unifying Formulas for Mathematical Constants
http://arxiv.org/abs/2502.17533v1
Tomer Raz, Michael Shalyt, Elyasheev Leibtag, Rotem Kalisch, Yaron Hadad, Ido Kaminer
定数 $\pi$ は何世紀にもわたって学者たちを魅了し、深い数学的洞察に根ざした無数の公式の導出を促してきました。この豊富な公式の数は疑問を呼び起こします。それらは相互に関連しているのか、そして統一的な構造がその関係性を説明できるのでしょうか。私たちは、現代の大規模な言語モデル、大規模データ処理、そして新しい数学的アルゴリズムを利用して、公式の同等性を発見し証明するための体系的な方法論を提案します。457,145本のarXiv論文を分析した結果、検証された$\pi$の公式の三分の一以上が、オイラー、ガウス、ブルンカー卿の公式を含む単一の数学的対象から導出可能であることが証明され、新たなアルゴリズミックな発見によるラマヌジャン・マシンの公式も含まれています。私たちのアプローチは、$e$、$\zeta(3)$、およびカタラン数のような他の定数にも拡張可能であり、その広範な適用性を証明しています。この研究は、数学の知識の自動的な統一に向けた一歩を示しており、科学分野間の接続をAI駆動で発見するための基盤を築いています。
2025-02-24T14:42:48
Order Matters: Investigate the Position Bias in Multi-constraint Instruction Following
http://arxiv.org/abs/2502.17204v1
Jie Zeng, Qianyu He, Qingyu Ren, Jiaqing Liang, Yanghua Xiao, Weikang Zhou, Zeye Sun, Fei Yu
Fudan University, Ant Group
複数の制約を伴う実世界の指示は、既存の大規模言語モデル(LLM)にとって重大な課題を提示しています。観察されたことの一つは、LLMが組み込まれた制約の順序を変更すると、パフォーマンスが劇的に変動することです。しかし、これまでの研究の中で、マルチ制約指示のフォローにおけるこの位置バイアス問題を体系的に調査したものはありません。このギャップを埋めるために、我々は新たな難易度分布指数(CDDI)を用いて、制約の難易度分布を定量的に測定するためのプロービングタスクを設計しました。実験結果を通じて、LLMは「難しいから簡単へ」という順序で制約が提示された場合に、より高いパフォーマンスを発揮することがわかりました。この好みは、異なるアーキテクチャや異なるパラメータサイズのLLMにも一般化できます。さらに、我々は説明研究を実施し、LLMの注意と制約の順序との相関に関する直感的な洞察を提供します。私たちのコードとデータセットは、https://github.com/meowpass/PBIF で公開されています。
2025-02-24T14:39:28
Disentangling Visual Transformers: Patch-level Interpretability for Image Classification
http://arxiv.org/abs/2502.17196v1
Guillaume Jeanneret, Loïc Simon, Frédéric Jurie
Sorbonne Université, Normandy University, ENSICAEN, UNICAEN, CNRS, GREYC
視覚トランスフォーマーは画像分類タスクにおいて素晴らしい性能を達成していますが、この性能向上は解釈性の犠牲の上に成り立っています。トランスフォーマーの解釈に対する主な障害の一つは、自己注意メカニズムであり、これは全画像にわたって視覚情報を複雑に混合します。本論文では、視覚トランスフォーマーに触発された新しい設計による解釈可能なアーキテクチャ「Hindered Transformer (HiT)」を提案します。私たちの提案するアーキテクチャは、分類段階でパッチの影響をより適切に分離するためにトランスフォーマーの設計を再考します。最終的に、HiTはパッチレベルの情報の線形結合として解釈できます。私たちは、説明可能性に関するアプローチの利点が性能に対する合理的なトレードオフとともに来ることを示し、解釈可能性が重要視されるアプリケーションにとって魅力的な選択肢であることを示します。
2025-02-24T14:30:29
Laplace-Beltrami Operator for Gaussian Splatting
http://arxiv.org/abs/2502.17531v1
Hongyu Zhou, Zorah Lähner
University of Bonn, Lamarr Institute
3Dガウシアンスプラッティングの人気が高まり、レンダリングから3D再構築までのアプリケーションが広がる中で、この新しい表現に直接対応したジオメトリ処理アプリケーションの必要性が生じています。ガウシアンの中心をポイントクラウドとして考えたり、それをメッシュ化したりすることは、既存のアルゴリズムを適用可能にする選択肢ですが、データに存在する情報を無視する可能性があるため、不必要にコストがかかることもあります。さらに、ガウシアンスプラッティングには、多くの外れ値が含まれており、これらはレンダリング品質には影響しないものの、ジオメトリ処理アプリケーションでノイズの多い結果を生じさせないように正しく処理する必要があります。本研究では、ジオメトリ処理で広く使用されるツールであるラプラス・ベルトラミ演算子を、マハラノビス距離を使用してガウシアンスプラッティング上で直接計算するための定式化を提案します。ポイントクラウドのラプラスに概念的には類似していますが、我々の実験ではガウシアンスプラッティング中心にエンコードされたポイントクラウドに対して優れた精度を示しており、さらにこの演算子は最適化中の出力品質を評価するために使用できます。
2025-02-24T14:29:33
IGDA: Interactive Graph Discovery through Large Language Model Agents
http://arxiv.org/abs/2502.17189v1
Alex Havrilla, David Alvarez-Melis, Nicolo Fusi
大規模言語モデル($\textbf{LLMs}$)は、発見のための強力な手法として登場しました。数値データを利用する代わりに、LLMsは関連する変数の$\textit{セマンティックメタデータ}$を用いて変数間の関係を予測します。同時に、LLMsは目的関数$f$と試行の系列が与えられた際にブラックボックス最適化器として印象的な能力を示します。私たちは、$\textit{インタラクティブグラフ発見}$というタスクにLLMsを適用することで、これらの2つの能力の交差点におけるLLMsを研究しています。具体的には、変数間の関係を捉えた真のグラフ$G^$と、$R$ラウンドにわたる$I$のエッジ実験の予算が与えられた場合、$R$-thラウンドの終わりにおける予測グラフ$\hat{G}_R$と$G^$との距離を最小化することを目指します。このタスクを解決するために、私たちは$\textbf{IGDA}$を提案します。これは、2つの主要な要素を取り入れたLLMベースのパイプラインです:1)エッジ実験選択のためのLLM不確実性駆動法、2)選択されていない隣接エッジの予測を改善するために試験からのバイナリフィードバックを利用したローカルグラフ更新戦略。8つの異なる実世界のグラフにおける実験では、私たちのアプローチが最先端の数値法を含むすべてのベースラインをしばしば上回ることが示されました。さらに、各パイプラインコンポーネントの影響を解明する厳密な一連のアブレーションを実施しました。最後に、記憶の影響を評価するために、私たちは2024年7月に新たに登場した複雑な因果グラフであるタンパク質転写因子に対してインタラクティブグラフ発見戦略を適用し、記憶が不可能な設定において強い性能を見いだしました。全体として、私たちの結果は、IGDAが既存の数値駆動アプローチを補完する強力なグラフ発見手法であることを示しています。
2025-02-24T14:24:27
Evaluating Expert Contributions in a MoE LLM for Quiz-Based Tasks
http://arxiv.org/abs/2502.17187v1
Andrei Chernov
最近、専門家の混合(MoE)層を持つ大規模言語モデル(LLMs)が注目を集めています。現在、最先端のLLMはこのアーキテクチャを利用しています。このようなモデルのトレーニング方法やこのアーキテクチャのためのハイパーパラメータの選定に関する研究は多数ありますが、MoE層の特性の後評価分析に焦点を当てた研究は不足しています。本論文では、このギャップを埋めるための第一歩として、クイズベースのMMLUベンチマークにおける専門家の寄与を評価します。私たちは、このベンチマークの推論中にほとんどの専門家が一度も活性化されなかったことを示します。さらに、ゲーティングネットワークの出力分布はスパースよりも均一に近いことを示しています。最後に、同一層内のいくつかの専門家の平均パフォーマンスが大きく異なることを示します。
2025-02-24T14:23:52
Cheems: A Practical Guidance for Building and Evaluating Chinese Reward Models from Scratch
http://arxiv.org/abs/2502.17173v1
Xueru Wen, Jie Lou, Zichao Li, Yaojie Lu, Xing Yu, Yuqiu Ji, Guohai Xu, Hongyu Lin, Ben He, Xianpei Han, Le Sun, Debing Zhang
Chinese Academy of Sciences, University of Chinese Academy of Sciences, Xiaohongshu Inc
報酬モデル(RM)は、大規模言語モデル(LLM)を人間の好みに整合させるために重要です。しかし、ほとんどのRM研究は英語に集中しており、合成リソースに大きく依存しているため、中国語の限られた信頼性の低いデータセットとベンチマークにつながっています。このギャップに対処するために、私たちは中国の文脈における完全な人間による注釈のRM評価ベンチマークであるCheemsBenchを紹介し、人間と機械のコラボレーションを通じて注釈された大規模で多様な好みのデータセットCheemsPreferenceを提供します。私たちはCheemsBenchでオープンソースの識別的および生成的RMを体系的に評価し、中国のシナリオにおける人間の好みを捉える能力に重要な制限があることを観察しました。さらに、CheemsPreferenceに基づいて、CheemsBenchで最先端のパフォーマンスを達成するRMを構築し、RMトレーニングにおける人間の監督の必要性を示しています。私たちの調査結果は、大規模なAI生成データが人間の好みを完全に捉えるのが難しいことを明らかにし、RM開発における高品質な人間の監督の重要性を強調しています。
2025-02-24T14:09:45
Teleology-Driven Affective Computing: A Causal Framework for Sustained Well-Being
http://arxiv.org/abs/2502.17172v1
Bin Yin, Chong-Yi Liu, Liya Fu, Jinkun Zhang
感情コンピューティングは、感情認識および生成において重要な進展を遂げてきましたが、現在のアプローチは主に短期的なパターン認識に焦点を当てており、感情エージェントを長期的な人間の幸福に導く包括的な枠組みに欠けています。これに対処するために、私たちはテロロジー主導の感情コンピューティングフレームワークを提案します。このフレームワークは、感情が生存と発展を促進する適応的で目指す方向性を持つプロセスであるという前提のもと、主要な感情理論(基本感情、評価、構築主義アプローチ)を統合しています。我々のフレームワークは、長期的な時間スケールにわたり、エージェントの反応を個人およびグループの幸福に整合させることに重点を置いています。私たちは、実世界の体験サンプリングと没入型仮想現実を通じて、信念、目標、行動、成果の相互作用を捉える個人の感情的出来事の「データバース」を作成することを提唱しています。この「データバース」を活用することで、因果モデルを通じてAIシステムが個々の感情的懸念を推測し、持続的な幸福のために特化した介入を提供できるようになります。さらに、我々はエージェントをシミュレーション環境で訓練するためのメタ強化学習パラダイムを導入し、進化する感情的懸念に適応し、即時の感情的ニーズから長期的な自己実現に至る階層的な目標をバランスさせることを可能にします。このフレームワークは、統計的相関から因果推論への焦点をシフトさせ、エージェントの感情的課題に対する予測と積極的な応答能力を高め、意味のある人間-人工知能相互作用と社会的な幸福を促進するパーソナライズされた倫理的に整合した感情システムを開発するための基盤を提供します。
2025-02-24T14:07:53
JUREX-4E: Juridical Expert-Annotated Four-Element Knowledge Base for Legal Reasoning
http://arxiv.org/abs/2502.17166v1
Huanghai Liu, Quzhe Huang, Qingjing Chen, Yiran Hu, Jiayu Ma, Yun Liu, Weixing Shen, Yansong Feng
Tsinghua University, Peking University, University of Bologna
四要素理論は、犯罪法における基本的な枠組みであり、犯罪の構成を主題、客体、主観的側面、客観的側面という四つの次元を通じて定義します。この理論は法的推論において広く参照されており、多くの大規模言語モデル(LLM)が法的タスクの処理時にこれを取り入れようとしています。しかし、現在のアプローチはLLMの内部知識に依存してこの理論を取り入れているため、完全性と代表性に欠けることが多いです。この制限に対処するために、我々は155の刑事告発をカバーする専門家注釈付きの知識ベース「JUREX-4E」を導入します。この知識ベースは、法的情報源の妥当性を優先し、多様な法的解釈手法を用いて包括性と権威性を確保する進行的な階層注釈フレームワークを通じて構築されています。JUREX-4Eを類似した犯罪の区別タスクで評価し、法的ケース検索に適用することで、LLMのパフォーマンス向上におけるその効果を示します。実験結果は、JUREX-4Eの高い品質と法律タスクに対する実質的な影響を裏付けており、法律AIアプリケーションの進展に向けたその潜在能力を強調しています。コード: https://github.com/THUlawtech/JUREX
2025-02-24T14:02:00
MEMERAG: A Multilingual End-to-End Meta-Evaluation Benchmark for Retrieval Augmented Generation
http://arxiv.org/abs/2502.17163v2
María Andrea Cruz Blandón, Jayasimha Talur, Bruno Charron, Dong Liu, Saab Mansour, Marcello Federico
Tampere University, Amazon
retrieval augmented generation (RAG) システムの自動評価は、人間の専門家アノテーターによって判断される忠実性や関連性などの細かい次元に依存しています。メタ評価のベンチマークは、人間の判断と良く相関する自動評価者の開発をサポートします。しかし、既存のベンチマークは主に英語に焦点を当てるか、翻訳データを使用しているため、文化的なニュアンスを捉えることができません。ネイティブアプローチは、最終ユーザー体験のより良い表現を提供します。本研究では、多言語エンドツーエンドメタ評価RAGベンチマーク(MEMERAG)を開発しました。私たちのベンチマークは、人気のあるMIRACLデータセットを基にしており、母国語の質問を使用し、多様な大規模言語モデル(LLM)で応答を生成し、それを専門家アノテーターが忠実性と関連性のために評価します。アノテーションプロセスを説明し、高いアノテーター間の一致が達成されていることを示します。その後、人間の評価者に従って、言語ごとの回答生成LLMの性能を分析します。最後に、データセットを主な利用ケースに適用し、多言語自動評価者(LLM-as-a-judge)のベンチマークを行います。私たちのベンチマークは、高度なプロンプティング技術やLLMによって提供される改善を信頼できるように特定できることを示します。私たちは、コミュニティが多言語RAGシステムの正確な評価方法を開発するのを支援するために、私たちのベンチマークを公開します。
2025-02-24T13:58:42
Real-time Monitoring of Economic Shocks using Company Websites
http://arxiv.org/abs/2502.17161v1
Michael Koenig, Jakob Rauch, Martin Woerter
経済ショックが企業に与える影響を理解することは、経済成長とレジリエンスを分析する上で重要です。私たちは、さまざまな文脈における経済的混乱をリアルタイムで監視するための汎用ツール、Webベースの影響指標(WAI)を導入します。WAIは、500万以上の企業ウェブサイトからのテキストに対して、大規模言語モデル(LLM)を活用した分類と情報抽出を行い、企業が外部ショックに対してどの程度どのように反応しているかを定量化します。具体的な応用としてCOVID-19パンデミックを取り上げ、WAIがパンデミック抑制策と高い相関があり、企業のパフォーマンスを信頼性高く予測できることを示します。従来のデータソースとは異なり、WAIは、業界や地域にわたってタイムリーな企業レベルの情報を提供し、制度的およびデータ入手の制約により通常は入手できない情報を提供します。この方法論は、技術的、政治的、金融的、健康、または環境の危機の影響を監視し軽減するための重要な可能性を提供し、適応的な政策決定と経済的レジリエンスのための変革的なツールとなります。
2025-02-24T13:56:27
MaxGlaViT: A novel lightweight vision transformer-based approach for early diagnosis of glaucoma stages from fundus images
http://arxiv.org/abs/2502.17154v1
Mustafa Yurdakul, Kubra Uyar, Sakir Tasdemir
緑内障は、症状がなく静かに進行する一般的な目の病気です。早期に発見され、治療されないと、永久的な視力喪失を引き起こす可能性があります。コンピュータ支援診断システムは、迅速かつ効率的な識別において重要な役割を果たします。本研究では、早期の緑内障検出のために再構築されたマルチ軸ビジョントランスフォーマー(MaxViT)に基づく軽量モデルMaxGlaViTを紹介します。まず、MaxViTのブロック数とチャンネル数を最適化するためにスケーリングし、軽量なアーキテクチャを実現しました。次に、特徴学習を向上させるために、畳み込み層の後に注意メカニズム(CBAM、ECA、SE)を追加してステムを強化しました。さらに、MaxViTブロック内のMBConv構造を先進的なDLブロック(ConvNeXt、ConvNeXtV2、InceptionNeXt)に置き換えました。このモデルは、異なる緑内障段階の眼底画像を含むHDV1データセットを使用して評価されました。また、MaxGlaViTの効率を検証するために、80のCNNモデルと40のViTモデルがHDV1でテストされました。CNNモデルの中で、EfficientB6が最も高い精度(84.91%)を達成し、ViTモデルの中ではMaxViT-Tinyが最優秀(86.42%)でした。スケーリングされたMaxViTは87.93%の精度に達しました。ステムブロックにECAを追加すると、精度は89.01%に向上しました。MBConvをConvNeXtV2に置き換えることで、さらなる改善が見られ89.87%に達しました。最後に、ステムにECA、MaxViTブロックにConvNeXtV2を統合することで92.03%の精度を達成しました。緑内障の段階分類のために80のDLモデルをテストした本研究では、包括的かつ比較分析を提供します。MaxGlaViTは実験モデル及び最先端モデルを上回り、92.03%の精度、92.33%の適合率、92.03%の再現率、92.13%のF1スコア、87.12%のコーエンのカッパスコアを達成しました。
2025-02-24T13:48:04
CodeSwift: Accelerating LLM Inference for Efficient Code Generation
http://arxiv.org/abs/2502.17139v1
Qianhui Zhao, Li Zhang, Fang Liu, Xiaoli Lian, Qiaoyuanhe Meng, Ziqian Jiao, Zetong Zhou, Borui Zhang, Runlin Guo, Jia Li
Beihang University, Peking University
コード生成は高いタイムリー性が求められる遅延感度の高いタスクですが、大規模言語モデル(LLM)の自己回帰デコーディングメカニズムは推論効率が悪化します。既存のLLM推論加速手法は、主に組み込みコンポーネントのみを使用した独立した機能に焦点を当てています。さらに、これらはコードを自然言語シーケンスのように扱い、その独自の構文と意味的特徴を無視しています。その結果、これらのアプローチはコード生成タスクにおいて効果が限られ、実際のプログラミングシナリオと一致しません。この問題を軽減するために、我々はCodeSwiftを提案します。これは、出力の品質を損なうことなく、コード生成のために特別に設計されたシンプルでありながら非常に効率的な推論加速アプローチです。CodeSwiftはマルチソースデータストアを構築し、一般的およびプロジェクト特有の知識にアクセスを提供し、高品質なドラフトシーケンスを引き出すことを容易にします。さらに、CodeSwiftは取得のタイミングを制御することで取得コストを削減し、並列取得とコンテキストおよびLLMの好みに応じたキャッシュを通じて効率を向上させます。実験結果は、CodeSwiftがリポジトリレベルおよび独立したコード生成タスクにおいて自己回帰デコーディングと比較してそれぞれ最大2.53倍および2.54倍のスピードアップを達成し、最先端の推論加速手法を最大88%上回ることを示しています。
2025-02-24T13:30:30
Evaluating the Effectiveness of Large Language Models in Automated News Article Summarization
http://arxiv.org/abs/2502.17136v1
Lionel Richy Panlap Houamegni, Fatih Gedikli
ニュース分析と要約の自動化は、今日の情報社会で広がる膨大な情報を処理・分析するという課題に対する有望な解決策を提供します。大規模言語モデル(LLM)は、膨大なテキストデータを簡潔で理解しやすい要約に変換する能力を示し、情報過多の問題に対して効果的な解決策を提供し、ユーザーに関連情報の迅速な概要を提供します。この技術の特に重要な応用は、サプライチェーンリスク分析にあります。企業は、サプライヤーに関するニュースを監視し、事件に対応する必要があります。その理由は、法律や規制の遵守、リスク管理、供給チェーンのレジリエンスを維持することなど、いくつかの重要な理由があります。本論文では、LLMを使用したサプライチェーンリスク分析のための自動ニュース要約システムを開発します。提案されたソリューションは、さまざまなソースからニュースを集約し、LLMを使用して要約し、明確で簡潔な形式でユーザーに凝縮された情報を提示します。このアプローチにより、企業は情報処理を最適化し、情報に基づいた意思決定を行うことが可能になります。本研究では、2つの主な研究質問に取り組みます:(1) LLMはサプライチェーンリスク分析の文脈において、特にニュース要約の自動化に効果的ですか?(2) 要約の質において、さまざまなLLMは可読性、重複検出、リスク識別の観点でどれほど効果的ですか?本論文では、当時利用可能なさまざまなLLMを使用したオフライン研究を行い、オフライン実験の中でトップパフォーマンスのシステムに焦点を当ててユーザー研究を補完し、彼らの効果をさらに評価しました。我々の結果は、特にFew-Shot GPT-4o miniが、要約の質やリスク識別において大幅な改善を提供することを示しています。
2025-02-24T13:27:46
Applications of Large Models in Medicine
http://arxiv.org/abs/2502.17132v1
YunHe Su, Zhengyang Lu, Junhui Liu, Ke Pang, Haoran Dai, Sa Liu Yuxin Jia, Lujia Ge, Jing-min Yang
この論文は、医療分野における大規模モデルの進展と応用について探求しており、特に医療大規模モデル(MedLMs)に焦点を当てています。これらのモデルは、大規模言語モデル(LLMs)、視覚モデル、3D大規模モデル、マルチモーダルモデルを含み、疾患予測、診断支援、個別化治療計画、薬剤発見を強化することで、医療を革命化しています。医療知識グラフと薬剤発見におけるグラフニューラルネットワークの統合は、複雑な生物医学的関係を理解する上での大規模グラフモデル(LGM)の可能性を強調しています。また、研究は、医療画像分析、解剖学的モデリング、義肢設計における視覚-言語モデル(VLM)と3D大規模モデルの変革的な役割を強調しています。これらの技術は課題があるものの、医療の革新における新たな基準を設定し、診断精度を向上させ、個別化医療ソリューションへの道を開いています。この論文は、医療における大規模モデルの現状と将来の方向性について包括的な概要を提供し、世界の健康を前進させる上でのその重要性を強調することを目的としています。
2025-02-24T13:21:30
Low-distortion and GPU-compatible Tree Embeddings in Hyperbolic Space
http://arxiv.org/abs/2502.17130v1
Max van Spengler, Pascal Mettes
階層構造からオントロジーや分類法までの木のようなデータの埋め込みは、多くの分野にわたる知識を表現するための十分に研究された問題です。ハイパーボリック幾何学は、木を埋め込むための自然な解決策を提供し、ユークリッド埋め込みに対して圧倒的に優れた性能を発揮します。最近の文献では、ハイパーボリックツリーの埋め込みは、深層学習環境における階層的知識統合のために神経ネットワークの上に配置することすら可能であることが示されています。すべてのアプリケーションにおいて、木の忠実な埋め込みが必要であり、組合せ構造が最も効果的な方向性として浮上しています。本論文では、既存の研究の2つの重要な制限を特定し、解決します。第一に、組合せ構造は、ハイパースフィア上の高度に分離された点を見つけることに依存しており、これは悪名高い難しい問題です。現在のアプローチは分離が不十分であり、対応するハイパーボリック埋め込みの質が低下します。私たちは、高度に分離されたドロネー木埋め込み(HS-DTE)を提案します。これは、ドロネー埋め込みの一般化された定式化に角度の分離を統合し、埋め込みの歪みを低減します。第二に、低歪みは追加の精度を必要とします。精度を高めるための現在のアプローチは、多重精度算術を使用することですが、これは深層学習環境においてGPUで埋め込みを無効にします。私たちは、浮動小数点拡張算術を使用して組合せ構造を再定式化し、加速ハードウェア上での効用を保持しながら、優れた埋め込み品質を提供します。
2025-02-24T13:19:59
LettuceDetect: A Hallucination Detection Framework for RAG Applications
http://arxiv.org/abs/2502.17125v1
Ádám Kovács, Gábor Recski
TU Wien, 1KR Labs
Retrieval Augmented Generation (RAG) システムは、外部知識ソースを組み込んでいるにもかかわらず、幻覚的な回答に対して脆弱であり続けています。私たちは、既存の幻覚検出方法における2つの重要な制限に対処するフレームワーク「LettuceDetect」を提案します:(1) 従来のエンコーダベースの方法のコンテキストウィンドウの制約、(2) LLMベースのアプローチの計算効率の悪さです。ModernBERTの拡張コンテキスト機能(最大8kトークン)を利用し、RAGTruthベンチマークデータセットでトレーニングされた私たちのアプローチは、すべての以前のエンコーダベースのモデルおよびほとんどのプロンプトベースのモデルを上回り、最良のモデルの約30倍小型化されています。LettuceDetectは、コンテキスト-質問-回答のトリプルを処理するトークンクラス分類モデルであり、トークンレベルでのサポートされていない主張の特定を可能にします。RAGTruthコーパスでの評価では、例レベルの検出において79.22%のF1スコアを示し、これは以前の最先端のエンコーダベースのアーキテクチャであるLunaよりも14.8%の改善です。さらに、このシステムは単一のGPUで1秒あたり30から60の例を処理できるため、実際のRAGアプリケーションに対してより実用的です。
2025-02-24T13:11:47
Adversarial Training for Defense Against Label Poisoning Attacks
http://arxiv.org/abs/2502.17121v1
Melis Ilayda Bal, Volkan Cevher, Michael Muehlebach
機械学習モデルが複雑化し、公開されているデータ、例えば大規模言語モデルのトレーニングに使用される人間によって注釈付けされたラベルにますます依存するようになるにつれて、ラベルポイズニング攻撃に対してより脆弱になります。これらの攻撃では、敵対者がトレーニングデータセット内のラベルを微妙に変更し、モデルのパフォーマンスを著しく低下させ、重要なアプリケーションに重大なリスクをもたらす可能性があります。本論文では、これらの脅威に対抗するために、サポートベクターマシン(SVM)に基づく新しい敵対的トレーニング防御戦略FLORALを提案します。バイレベル最適化フレームワークを利用し、トレーニングプロセスを、重要なトレーニングラベルを戦略的に毒性化する攻撃者と、そのような攻撃から回復しようとするモデルとの間の非零和スタッケルバーグゲームとして捉えます。我々のアプローチは、さまざまなモデルアーキテクチャに対応し、カーネルSVMを用いた投影勾配降下アルゴリズムを採用して敵対的トレーニングを行います。アルゴリズムの収束特性について理論的な分析を提供し、さまざまな分類タスクにおけるFLORALの効果を実証的に評価します。堅牢なベースラインやRoBERTaのような基盤モデルと比較して、FLORALは攻撃者の予算が増加するにつれて一貫して高い堅牢性を持つ精度を達成します。これらの結果は、FLORALがラベルポイズニングの脅威に対する機械学習モデルのレジリエンスを向上させ、敵対的な設定における堅牢な分類を確保する可能性を強調しています。
2025-02-24T13:03:19
Diffusion Models for Tabular Data: Challenges, Current Progress, and Future Directions
http://arxiv.org/abs/2502.17119v1
Zhong Li, Qi Huang, Lincen Yang, Jiayang Shi, Zhao Yang, Niki van Stein, Thomas Bäck, Matthijs van Leeuwen
VU Amsterdam, LIACS, Leiden University
近年、生成モデルは、画像生成、テキスト合成、音声生成、ビデオ生成、データ拡張などの多様な応用分野で目覚ましい成果を上げてきました。拡散モデルは、生成 adversarialネットワーク(GAN)や変分オートエンコーダ(VAE)の限界(例えば、トレーニングの不安定性、モード崩壊、多様な分布の不適切な表現)を解決することにより、優れた代替手段として浮上しています。この成功は、広範な研究関心を引き起こしました。表形式データの分野では、拡散モデルがGANやVAEに対して同様の利点を示し、重要なパフォーマンスの突破口を達成し、表形式データモデリングにおける独自の課題に対処する可能性を示しています。しかし、画像や時系列などの分野には拡散モデルの進展を要約した多くの調査が存在する一方、表形式データに関しては文献に著しいギャップがあります。表形式データにおける拡散モデルへの関心が高まっているにもかかわらず、これらの進展を体系的にレビューし要約するための努力はほとんどありません。この専用の調査が欠如しているため、この重要な分野における課題、進展、未来の方向性を明確に理解することが制限されています。この調査は、表形式データにおける拡散モデルの包括的なレビューを提供することで、このギャップに対処します。拡散モデルが登場した2015年6月から2024年12月までの研究をカバーし、関連するほぼすべての研究を分析し、更新は\href{https://github.com/Diffusion-Model-Leiden/awesome-diffusion-models-for-tabular-data}{GitHubリポジトリ}で維持します。読者が統計学および拡散モデルの基礎知識を持っていると仮定し、数学的な定式化を用いて厳密で詳細なレビューを提供し、この新興かつ刺激的な分野の発展を促進することを目指します。
2025-02-24T13:01:33
Strength Estimation and Human-Like Strength Adjustment in Games
http://arxiv.org/abs/2502.17109v1
Chun Jung Chen, Chung-Chin Shih, Ti-Rong Wu
強さの推定と調整は、人間とAIの相互作用を設計する上で重要であり、特にAIが人間のプレイヤーを上回るゲームにおいて重要です。本論文では、新しい強さシステムを紹介します。このシステムには、強さ推定器(SE)と、SEに基づくモンテカルロ木探索(SE-MCTS)が含まれ、ゲームから強さを予測し、人間のスタイルに応じた異なるプレイ強度を提供します。強さ推定器は、直接的な人間のインタラクションなしにゲームから強さスコアを計算し、ランクを予測します。SE-MCTSは、モンテカルロ木探索において強さスコアを利用してプレイ強度とスタイルを調整します。最初に、さまざまなランクを持つ challenging ボードゲーム「囲碁」で実験を行います。私たちの強さ推定器は、わずか15ゲームを観察することで、ランクの予測において80%を超える精度を達成しますが、従来の方法は100ゲームで49%の精度にとどまりました。強さの調整において、SE-MCTSは指定されたランクにうまく調整し、51.33%の精度で人間の行動に一致させることに成功し、従来の最先端技術の42.56%を上回りました。私たちの強さシステムの一般性を示すために、さらにSEとSE-MCTSを将棋に適用し、一貫した結果を得ました。これらの結果は、ゲームにおける人間とAIの相互作用を向上させるための、強さの推定と調整に対する有望なアプローチを示しています。私たちのコードは、https://rlg.iis.sinica.edu.tw/papers/strength-estimator で入手可能です。
2025-02-24T12:47:47
SFLD: Reducing the content bias for AI-generated Image Detection
http://arxiv.org/abs/2502.17105v1
Seoyeon Gye, Junwon Ko, Hyounguk Shon, Minchan Kwon, Junmo Kim
KAIST
AI生成コンテンツの識別は、生成的AIの安全かつ倫理的な利用にとって重要です。最近の研究は、未知のジェネレーターに対して一般化する検出器の開発に焦点を当てており、一般的な方法は、高レベルの特徴や低レベルのフィンガープリントに依存しています。しかし、これらの方法には明確な制限があり、未知のコンテンツに対してバイアスがかかるか、JPEG圧縮などの一般的な画像劣化に対して脆弱です。これらの問題に対処するために、PatchShuffleを取り入れて高レベルの意味情報と低レベルの質感情報を統合する新しいアプローチSFLDを提案します。SFLDは複数のレベルでPatchShuffleを適用し、さまざまな生成モデルにわたる頑健性と一般化を向上させます。さらに、現在のベンチマークは、画像品質が低い、コンテンツの保存が不十分、クラスの多様性が限られているなどの課題に直面しています。これに応じて、視覚的にほぼ同一の実画像と合成画像のペアを構築する新しいベンチマーク生成手法TwinSynthsを紹介し、高品質とコンテンツの保存を確保します。私たちの広範な実験と分析は、SFLDがGAN、拡散モデル、TwinSynthsから取得したさまざまな偽画像の検出において既存の方法を上回っており、最新の性能と新しい生成モデルへの一般化能力を示しています。
2025-02-24T12:38:34
Generative Models in Decision Making: A Survey
http://arxiv.org/abs/2502.17100v2
Yinchuan Li, Xinyu Shao, Jianping Zhang, Haozhi Wang, Leo Maxime Brunswic, Kaiwen Zhou, Jiqian Dong, Kaiyang Guo, Xiu Li, Zhitang Chen, Jun Wang, Jianye Hao
Huawei Noah’s Ark Lab, Tsinghua University, The Chinese University of Hong Kong, University College London
近年、生成モデルの生成タスクにおける優れたパフォーマンスは、意思決定プロセスへの統合に対する大きな関心を引き起こしています。生成モデルは、複雑なデータ分布を扱う能力と強力なモデル容量を有しているため、エージェントを高報酬の状態-行動領域や中間的なサブゴールへと導く軌道を生成することで、意思決定システムに効果的に組み込むことができます。本論文では、意思決定タスクにおける生成モデルの応用についての包括的なレビューを提供します。私たちは、生成モデルの7つの基本的なタイプを分類します:エネルギーベースモデル、生成的敵対ネットワーク、変分オートエンコーダ、正規化フロー、拡散モデル、生成フローネットワーク、および自己回帰モデル。応用に関しては、その機能を3つの主要な役割に分類します:コントローラー、モデル作成者、最適化者、そしてそれぞれの役割が意思決定にどのように貢献しているかを議論します。さらに、これらのモデルが5つの重要な現実世界の意思決定シナリオにおいてどのように展開されているかを検討します。最後に、現在のアプローチの強みと限界を要約し、次世代の生成的指令モデルを前進させるための3つの重要な方向性を提案します:高性能アルゴリズム、大規模な一般化意思決定モデル、自己進化し適応するモデル。
2025-02-24T12:31:28
Improved Diffusion-based Generative Model with Better Adversarial Robustness
http://arxiv.org/abs/2502.17099v1
Zekun Wang, Mingyang Yi, Shuchen Xue, Zhenguo Li, Ming Liu, Bing Qin, Zhi-Ming Ma
Harbin Institute of Technology, Renmin University of China, Academy of Mathematics and Systems Science, Chinese Academy of Sciences, University of Chinese Academy of Sciences, Huawei Noah’s Ark Lab
拡散確率モデル(DPM)は、生成タスクにおいて大きな成功を収めています。しかし、これらのトレーニングとサンプリングプロセスには、分布の不一致という問題があります。デノイジングプロセス中、入力データの分布はトレーニング段階と推論段階で異なり、正確なデータ生成を妨げる可能性があります。この問題を解決するために、DPMのトレーニング目標を分析し、この不一致は分布ロバスト最適化(DRO)を通じて軽減できることを理論的に示します。これは、DPMにおいてロバストネス駆動型の敵対的トレーニング(AT)を行うことと同等です。さらに、最近提案された一貫性モデル(CM)についても分析を行い、DPMの推論プロセスを蒸留するこのモデルのトレーニング目標も不一致の問題に直面することを証明します。幸いなことに、この問題もATによって軽減できます。これらの洞察に基づき、DPMとCMの両方で効率的なATを実施することを提案します。最後に、広範な実証研究が拡散ベースのモデルにおけるATの効果を検証しています。コードはhttps://github.com/kugwzk/AT_Diffで入手可能です。
2025-02-24T12:29:16
WildFrame: Comparing Framing in Humans and LLMs on Naturally Occurring Texts
http://arxiv.org/abs/2502.17091v1
Gili Lior, Liron Nacchace, Gabriel Stanovsky
The Hebrew University of Jerusalem
人間は情報の提示方法に影響を受けます。この現象は「フレーミング効果」として知られています。以前の研究では、LLMもフレーミングの影響を受ける可能性があることが示されていますが、これは合成データに基づいており、人間の行動と比較されていませんでした。私たちは、自然に発生する文における肯定的および否定的フレーミングに対するLLMの反応を評価するためのデータセット「WildFrame」を紹介し、同じデータで人間と比較します。WildFrameは1,000のテキストで構成されており、最初に明確な感情を持つ現実の発言を選び、それを肯定的または否定的に再フレーミングし、最後に人間の感情注釈を収集します。WildFrameで8つの最先端LLMを評価した結果、すべてのモデルが人間と同様のフレーミング効果を示し($r\geq0.57$)、人間とモデルの両方が否定的な再フレーミングよりも肯定的な再フレーミングにより影響を受けることがわかりました。私たちの発見は、モデル開発者にとって有益であり、彼らは下流のアプリケーションに応じてフレーミングを活用するか、その影響を軽減することができます。
2025-02-24T12:14:05
Conditional Diffusion-Flow models for generating 3D cosmic density fields: applications to f(R) cosmologies
http://arxiv.org/abs/2502.17087v1
Julieth Katherine Riveros, Paola Saavedra, Hector J. Hortua, Jorge Enrique Garcia-Farieta, Ivan Olier
Universidad El Bosque, Liverpool John Moores University, Universidad de Córdoba
次世代の銀河調査は、宇宙規模での重力テストにおいて前例のない精度を提供することを約束しています。しかし、この潜在能力を実現するには、非線形宇宙網を正確にモデル化する必要があります。私たちは、スコアベース(拡散)およびフローベースの方法を用いて、3Dのダークマター密度場を生成するために条件付き生成モデルを探求することによって、この課題に取り組みます。私たちの結果は、拡散モデルが物質パワースペクトルやバイスペクトルを、見えない構成に対しても正確に再現できる力を示しています。また、フローベースで確率分布関数を再構築する際には、わずかに精度が低下するものの、かなりのスピードアップを提供しますが、高次の統計には苦戦します。条件付き生成を改善するために、宇宙論的パラメータの特徴表現を開発する新しいマルチアウトプットモデルを導入しました。私たちの発見は、標準的な重力からの偏差を探究するための強力なツールを提供し、高精度と低い計算コストを組み合わせることで、より包括的で効率的な宇宙論的分析への道を切り開きます。
2025-02-24T12:06:23
Forgetting Any Data at Any Time: A Theoretically Certified Unlearning Framework for Vertical Federated Learning
http://arxiv.org/abs/2502.17081v1
Linian Wang, Leye Wang
Peking University
機械学習におけるプライバシーの懸念は、GDPRのような規制によって高まっています。GDPRは「忘れられる権利」(RTBF)を強制し、機械的な忘却を重要な研究分野として促進しています。垂直連合学習(VFL)は、分散した当事者間でサンプルの特徴を集約することにより、データのプライバシーを保持しつつ協力的なモデルトレーニングを可能にします。このパラダイムは、医療、金融、およびその他のプライバシーに敏感な分野で広く採用されています。しかし、既存のVFLシステムはRTBF要件に従うための堅牢なメカニズムを欠いており、VFLにおける忘却手法は十分に探求されていません。本研究では、理論的に保証された忘却機能を備えた初のVFLフレームワークを導入し、いつでも任意のデータを削除できるようにします。これまでのアプローチは、削除のためのモデルアーキテクチャやデータタイプに制限的な仮定を課していましたが、私たちの解決策はモデルおよびデータに依存せず、普遍的な互換性を提供します。さらに、私たちのフレームワークは非同期の忘却をサポートし、忘却プロセス中にすべての当事者が同時にオンラインである必要を排除します。これらの進展は、現在のVFLシステムの重要なギャップに対処し、運用の柔軟性を維持しつつRTBF遵守を確保します。私たちのすべての実装は、https://github.com/wangln19/vertical-federated-unlearning で公開されています。
2025-02-24T11:52:35
Systematic Weight Evaluation for Pruning Large Language Models: Enhancing Performance and Sustainability
http://arxiv.org/abs/2502.17071v1
Ashhadul Islam, Samir Brahim Belhaouari, Amine Bermak
大規模言語モデル(LLM)であるChatGPTの指数関数的成長は、人工知能に革命をもたらし、自然言語処理において前例のない能力を提供しています。しかし、これらのモデルを訓練するために必要な膨大な計算リソースは、重要な環境への影響を引き起こし、高い炭素排出量、エネルギー消費、そして水の使用を伴います。本研究は、訓練プロセス全体における各重みの重要性を系統的に評価することに焦点を当てたLLMのプルーニングに関する新しいアプローチを提示します。時間を通じたパラメータの進化を監視することで、パフォーマンスを損なうことなくモデルのサイズを効果的に削減する方法を提案します。縮小されたLLMと大規模なマルチモーダルモデルの両方を用いた広範な実験により、適度なプルーニングが効率を向上させ、損失を減少させる一方で、過度なプルーニングはモデルの性能を著しく悪化させることが明らかになりました。これらの発見は、持続可能な開発を確保するために最適化されたAIモデルの重要性を強調し、技術の進歩と環境への責任のバランスを取ることの必要性を示しています。
2025-02-24T11:34:49
LLM-QE: Improving Query Expansion by Aligning Large Language Models with Ranking Preferences
http://arxiv.org/abs/2502.17057v2
Sijia Yao, Pengcheng Huang, Zhenghao Liu, Yu Gu, Yukun Yan, Shi Yu, Ge Yu
Northeastern University, Tsinghua University, Beijing National Research Center for Information Science and Technology
クエリ拡張は情報検索において重要な役割を果たしており、クエリとドキュメント間の意味的ギャップを埋めることを目的としています。これにより、マッチングパフォーマンスが向上します。本論文では、文書ベースのクエリ拡張を生成するために大規模言語モデル(LLM)を活用する新しいアプローチ、LLM-QEを紹介します。これにより、密な検索モデルが強化されます。従来の方法とは異なり、LLM-QEはランキングベースと回答ベースの報酬を設計し、これらの報酬モデルを使用して、リトリーバーとLLMのランク付けの好みに合わせるようにLLMを最適化することで、クエリ拡張中のLLMの幻覚を軽減します。ゼロショット密な検索モデルであるContrieverに関する実験では、LLM-QEの有効性が確認され、8%以上の改善を達成しました。さらに、回答ベースの報酬モデリングを組み込むことで、LLM-QEは単に冗長なトークンを生成してランキングベースの報酬を最大化するのではなく、ドキュメントに関連するより関連性が高く、正確な情報を生成します。特に、LLM-QEは密なリトリーバーのトレーニングプロセスも改善し、ファインチューニング後に5%以上の改善を達成します。すべてのコードは https://github.com/NEUIR/LLM-QE で入手可能です。
2025-02-24T11:15:41
Stable-SPAM: How to Train in 4-Bit More Stably than 16-Bit Adam
http://arxiv.org/abs/2502.17055v1
Tianjin Huang, Haotian Hu, Zhenyu Zhang, Gaojie Jin, Xiang Li, Li Shen, Tianlong Chen, Lu Liu, Qingsong Wen, Zhangyang Wang, Shiwei Liu
この論文では、最近提案された4ビットトレーニング用のいくつかのオプティマイザを包括的に評価し、低ビット精度が学習率に対する感度を高め、高い学習率で発散を引き起こすことが多く、しばしば不安定な勾配ノルムを引き起こすことを明らかにします。その中でも、SPAMという最近のオプティマイザはモーメントリセットとスパイク対応の勾配クリッピングを特徴としており、さまざまなビットレベルで最高のパフォーマンスを達成しますが、勾配ノルムの安定化には苦労しており、慎重な学習率の調整が必要です。これらの限界に対処するため、我々はStable-SPAMを提案します。これは、強化された勾配正規化とクリッピング技術を組み込んでいます。具体的には、Stable-SPAMは (1) スパイク勾配のクリッピング閾値をその歴史的な最大値を追跡することによって適応的に更新し; (2) 勾配行列全体をその歴史的な$l_2$-ノルム統計に基づいて正規化し; (3) SPAMからモーメントリセットを継承し、Adamの第一次および第二次モーメントを定期的にリセットしてスパイク勾配の蓄積を緩和します。広範な実験により、Stable-SPAMは4ビットLLMトレーニングにおいて勾配ノルムを効果的に安定化し、AdamおよびSPAMと比較して優れたパフォーマンスを発揮することが示されました。特に、Stable-SPAMでトレーニングされた4ビットLLaMA-1Bモデルは、AdamでトレーニングされたBF16 LLaMA-1Bを最大$2$パープレキシティで上回ります。さらに、両方のモデルが4ビットでトレーニングされる場合、Stable-SPAMはAdamと同じ損失を達成しながら、必要なトレーニングステップは約半分で済みます。コードは https://github.com/TianjinYellow/StableSPAM.git から入手可能です。
2025-02-24T11:09:15
TabulaTime: A Novel Multimodal Deep Learning Framework for Advancing Acute Coronary Syndrome Prediction through Environmental and Clinical Data Integration
http://arxiv.org/abs/2502.17049v1
Xin Zhang, Liangxiu Han, Stephen White, Saad Hassan, Philip A Kalra, James Ritchie, Carl Diver, Jennie Shorley
MMU, Newcastle University, NCA, None
急性冠動脈症候群(ACS)、特にSTセグメント上昇型心筋梗塞(STEMI)や非STセグメント上昇型心筋梗塞(NSTEMI)は、世界中で主要な死亡原因の一つです。従来の心血管リスクスコアは主に臨床データに依存しており、心臓の健康に大きな影響を与える大気汚染などの環境要因を見落とすことが多いです。さらに、複雑な時系列環境データと臨床記録を統合することは困難です。そこで、我々はTabulaTimeを紹介します。これは、臨床リスク要因と大気汚染データを組み合わせることでACSリスク予測を向上させる多モーダル深層学習フレームワークです。TabulaTimeは三つの重要な革新を持っています。第一に、時系列の大気汚染データと臨床の表形式データを統合し、予測精度を向上させています。第二に、そのPatchRWKVモジュールは複雑な時間的パターンを自動的に抽出し、従来の特徴エンジニアリングの限界を克服するとともに、線形計算の複雑さを維持します。第三に、注意メカニズムにより、臨床要因と環境要因の相互作用を明らかにすることで解釈可能性を高めています。実験結果は、TabulaTimeがCatBoost、ランダムフォレスト、LightGBMなどの従来のモデルと比較して、予測精度を20%以上向上させることを示しています。大気汚染データだけでも10%以上の改善に寄与しています。重要特徴分析は、以前の狭心症、収縮期血圧、PM10、NO2などの重要な予測因子を特定します。全体として、TabulaTimeは臨床的および環境的洞察をつなぎ合わせ、個別化された予防戦略を支援し、ACSリスクを軽減するための公衆衛生政策に情報を提供します。
2025-02-24T11:01:07
Language Model Re-rankers are Steered by Lexical Similarities
http://arxiv.org/abs/2502.17036v1
Lovisa Hagström, Ercong Nie, Ruben Halifa, Helmut Schmid, Richard Johansson, Alexander Junge
Chalmers University of Technology, University of Gothenburg, LMU Munich, Munich Center for Machine Learning, amass technologies
言語モデル(LM)再ランキング手法は、取得拡張生成(RAG)のために取得結果を洗練させるために使用されます。これらは、BM25のようなレキシカルマッチング手法よりも高価ですが、セマンティック情報をより良く処理できると考えられています。LM再ランキング手法が常にこの仮定を満たすかどうかを理解するために、私たちはNQ、LitQA2、およびDRUIDデータセットで6つの異なるLM再ランキング手法を評価しました。私たちの結果は、LM再ランキング手法がDRUIDにおいて単純なBM25再ランキング手法を上回るのに苦労していることを示しています。BM25スコアに基づく新しい分離メトリックを活用し、私たちはレキシカルな類似性の違いから生じる再ランキング手法のエラーを説明し特定します。また、LM再ランキング手法の性能を向上させるためのさまざまな方法を調査し、これらの方法が主にNQに対して有用であることを発見しました。総じて、私たちの研究はLM再ランキング手法の弱点を特定し説明し、その評価のためにより対立的で現実的なデータセットが必要であることを指摘します。
2025-02-24T10:37:13
Distributional Vision-Language Alignment by Cauchy-Schwarz Divergence
http://arxiv.org/abs/2502.17028v1
Wenzhe Yin, Zehao Xiao, Pan Zhou, Shujian Yu, Jiayi Shen, Jan-Jakob Sonke, Efstratios Gavves
マルチモーダルアライメントは、クロスモーダル生成や検索などのさまざまな下流タスクにおいて重要です。従来のマルチモーダルアプローチであるCLIPは、主にモダリティ間での対となるサンプルをアラインし、分布の違いを見落とすことによって相互情報量を最大化し、モダリティのギャップによる最適でないアライメントを招いています。本論文では、この制限を克服するために、コーシー・シュワルツ(CS)発散を相互情報と統合する新しくシンプルなフレームワーク、CS-Alignerを提案します。提案されたフレームワークでは、CS発散と相互情報がマルチモーダルアライメントにおいて相補的な役割を果たし、各モダリティのグローバルな分布情報と対の意味的関係の両方を捉えることで、より強固で精密なアライメントを実現します。さらに、CS-Alignerは未ペアデータやトークンレベルの表現からの追加情報を取り入れることを可能にし、実際に柔軟で細かなアライメントを強化します。テキストから画像生成とクロスモーダリティ検索タスクに対する実験により、当手法が視覚と言語のアライメントにおいて効果的であることが示されました。
2025-02-24T10:29:15
Understanding the Uncertainty of LLM Explanations: A Perspective Based on Reasoning Topology
http://arxiv.org/abs/2502.17026v1
Longchao Da, Xiaoou Liu, Jiaxin Dai, Lu Cheng, Yaqing Wang, Hua Wei
Arizona State University, University of Illinois Chicago, Purdue University
大規模言語モデル(LLM)の説明における不確実性を理解することは、その信頼性や推論の一貫性を評価するために重要であり、したがって質問に関するLLMの出力の信頼性についての洞察を提供します。本研究では、推論トポロジーの視点からLLMの説明における不確実性を定量化する新しいフレームワークを提案します。構造的な引き出し戦略を設計することで、LLMに対して回答の説明をグラフのトポロジーに構築するよう誘導します。このプロセスは、説明を知識に関連するサブ質問とトポロジーベースの推論構造に分解し、意味的レベルだけでなく推論の経路からも不確実性を定量化することを可能にします。さらに、知識の冗長性を評価し、推論プロセスに対する解釈可能な洞察を提供するための便利さをもたらします。我々の方法は、LLMの推論を解釈し、その限界を分析し、堅牢性や信頼性を向上させるためのガイダンスを提供する体系的な方法を提供します。本研究は、LLMの説明におけるグラフ構造の不確実性測定の使用を先駆けており、トポロジーベースの定量化の可能性を示しています。
2025-02-24T10:28:21
Class-Dependent Perturbation Effects in Evaluating Time Series Attributions
http://arxiv.org/abs/2502.17022v1
Gregor Baer, Isel Grau, Chao Zhang, Pieter Van Gorp
時系列アプリケーションにおいて機械学習モデルがますます普及する中、説明可能な人工知能(XAI)手法は、その予測を理解するために不可欠です。XAIの中で、特徴の帰属手法は、モデルの予測に最も寄与した入力特徴を特定することを目的としており、その評価は通常、摂動ベースの指標に依存しています。複数のデータセット、モデルアーキテクチャ、および摂動戦略にわたる実証分析を通じて、これらの指標における重要なクラス依存効果を特定しました。これらはクラス間で異なる効果を示し、一部のクラスでは強力な結果を達成する一方で、他のクラスに対してはそれほど敏感ではありません。特に、最も効果的な摂動戦略は、しばしば最も顕著なクラスの違いを示すことが分かりました。私たちの分析は、これらの効果が分類器の学習されたバイアスから生じることを示唆しており、摂動ベースの評価は本質的な帰属の質ではなく、特定のモデルの挙動を反映している可能性があることを示しています。これらの効果を評価して考慮するためのクラス認識ペナルティ項を持つ評価フレームワークを提案します。私たちの分析は時系列分類に焦点を当てていますが、これらのクラス依存効果は、摂動ベースの評価が一般的な他の構造化データ領域にもおそらく適用されるでしょう。
2025-02-24T10:22:03
Moving Past Single Metrics: Exploring Short-Text Clustering Across Multiple Resolutions
http://arxiv.org/abs/2502.17020v1
Justin Miller, Tristram Alexander
University of Sydney
クラスタ番号はクラスタリング問題の初期段階で選択されるパラメータであり、影響力はあるものの、その選択を正当化することはしばしば困難です。バイオインフォマティクスに触発された本研究では、クラスタの性質がクラスタ番号によってどのように変化するかを調査し、クラスタのロバストネスを判断するための方法を提示し、クラスタ番号を決定するための体系的な方法を提供します。研究では特に、30,000件の政治的Twitterバイオを用いた短文クラスタリングに焦点を当てており、テキスト間の単語の希薄な共起により、有意義なクラスタを見つけることが難しくなっています。特定のクラスタの安定性を明らかにするために比例安定性の指標が導入され、結果はサンキーダイアグラムを使用して視覚化され、データセットの性質を理解するための質問ツールを提供します。この視覚化は、クラスタ番号が増加するにつれてクラスタの細分化や再編成を追跡する直感的な方法を提供し、静的で単一の解像度の指標では捉えられない洞察を得ることができます。結果は、単一の「最適」な解決策を求めるのではなく、クラスタ番号の選択は情報量と複雑さのバランスを取ることが重要であることを示しています。
2025-02-24T10:17:09
Erwin: A Tree-based Hierarchical Transformer for Large-scale Physical Systems
http://arxiv.org/abs/2502.17019v1
Maksim Zhdanov, Max Welling, Jan-Willem van de Meent
不規則グリッド上で定義された大規模物理システムは、特に長距離相互作用や多階層結合が存在する場合、深層学習手法にとってかなりのスケーラビリティの課題をもたらします。すべての対の相互作用を計算する従来のアプローチ、たとえばアテンションは、ノードの数が増えると二次的に計算コストが増加するため、計算上の負担が大きくなります。私たちは、計算多体物理学の手法からインスパイアを受けた階層型トランスフォーマー「Erwin」を提案します。これは、ツリー構造に基づくアルゴリズムの効率性とアテンションメカニズムの表現力を組み合わせています。Erwinはボールツリー分割を用いて計算を整理し、固定サイズの局所的近傍内でノードを並列処理することにより線形時間のアテンションを可能にします。ボールツリー構造の漸進的な粗粗化と精練に加え、新しいクロスボール相互作用メカニズムを組み合わせることで、微細な局所的ディテールとグローバルな特徴の両方を捉えます。私たちは、宇宙論、分子動力学、粒子流体動力学を含む複数のドメインにわたるErwinの効果を示し、常に基準手法を精度と計算効率の両方で上回ることを証明しています。
2025-02-24T10:16:55
All You Need for Counterfactual Explainability Is Principled and Reliable Estimate of Aleatoric and Epistemic Uncertainty
http://arxiv.org/abs/2502.17007v1
Kacper Sokol, Eyke Hüllermeier
本ポジションペーパーは、透明性に関する研究が人工知能の多くの基礎的概念を見落としていることが、逆にデメリットであると主張します。ここでは、不確実性の定量化に焦点を当て、事前解釈可能性と反実仮想的説明可能性の文脈において、その採用がこの分野の重要な課題にどのように対処できるかを示します。まず、不確実性と事前解釈可能性は同じ基盤となるアイデアの補完的な視点を提供することを前提とします。次に、不確実性が反実仮想的説明可能性のための原則に基づいた統一的な枠組みを提供することを主張します。その結果、内在的に透明なモデルは、反実仮想のような人間中心の説明的洞察から利益を得ることができ、そうでなければ欠けているものです。より高いレベルでは、人工知能の基本概念を透明性研究に統合することは、より信頼性が高く、堅牢で理解可能な予測モデルを生み出すことが期待されます。
2025-02-24T09:38:31
Improving the Transferability of Adversarial Examples by Inverse Knowledge Distillation
http://arxiv.org/abs/2502.17003v1
Wenyuan Wu, Zheng Liu, Yong Chen, Chao Su, Dezhong Peng, Xu Wang
Sichuan University, Sichuan Newstrong UHD Video Technology Company Ltd., Institute of Optics and Electronics, Chinese Academy of Sciences
近年、深層ニューラルネットワークの急速な発展により、これらのモデルのセキュリティと堅牢性への関心が高まっています。既存の敵対攻撃アルゴリズムは敵対的転送性を改善するのに成功を収めていますが、ターゲットモデルとソースモデル間の不一致を考慮していないため、そのパフォーマンスは最適ではありません。この制限に対処するために、私たちは敵対的転送性を効果的に向上させるために設計された新しい手法「逆知識蒸留 (Inverse Knowledge Distillation; IKD)」を提案します。IKDは、勾配に基づく攻撃手法とシームレスに統合される蒸留にインスパイアされた損失関数を導入し、攻撃の勾配の多様性を促進し、特定のモデルアーキテクチャへの過剰適合を軽減します。勾配を多様化することで、IKDは異なるモデル間で優れた一般化能力を持つ敵対サンプルの生成を可能にし、ブラックボックス攻撃シナリオにおけるその効果を大幅に向上させます。ImageNetデータセットにおける広範な実験によって、私たちのアプローチの効果が検証されており、さまざまなモデルにおける敵対サンプルの転送性と攻撃成功率が大幅に改善されることが示されています。
2025-02-24T09:35:30
FADE: Why Bad Descriptions Happen to Good Features
http://arxiv.org/abs/2502.16994v1
Bruno Puri, Aakriti Jain, Elena Golimblevskaia, Patrick Kahardipraja, Thomas Wiegand, Wojciech Samek, Sebastian Lapuschkin
Fraunhofer Heinrich Hertz Institute, Technische Universität Berlin, BIFOLD - Berlin Institute for the Foundations of Learning and Data
最近のメカニスティックインタープリタビリティの進展は、LLM内の潜在表現を分析するためのインタープリタビリティパイプラインを自動化する可能性を強調しています。これにより内部メカニズムの理解が深まるかもしれませんが、この分野には発見された特徴の有効性を評価するための標準化された評価方法が欠けています。我々は、このギャップを埋めるために、FADE: Feature Alignment to Description Evaluationを導入します。これは、特徴と説明の整合性を評価するためのスケーラブルなモデル非依存のフレームワークです。FADEは、整合性を4つの重要な指標(明瞭性、応答性、純度、誠実性)にわたって評価し、特徴とその説明の不整合の原因を体系的に定量化します。FADEを用いて、既存のオープンソースの特徴説明を分析し、自動インタープリタビリティパイプラインの主要なコンポーネントを評価し、説明の質を向上させることを目指します。我々の発見は、MLPニューロンと比較してSAEにおける特徴の説明生成における基本的な課題を浮き彫りにし、自動インタープリタビリティの限界と今後の方向性についての洞察を提供します。FADEはオープンソースパッケージとして次のリンクで公開しています:https://github.com/brunibrun/FADE。
2025-02-24T09:28:35
Hotter and Colder: A New Approach to Annotating Sentiment, Emotions, and Bias in Icelandic Blog Comments
http://arxiv.org/abs/2502.16987v1
Steinunn Rut Friðriksdóttir, Dan Saattrup Nielsen, Hafsteinn Einarsson
University of Iceland, The Alexandra Institute
この論文は、「ホッターとコルダー」と呼ばれるデータセットを紹介します。これはアイスランドのブログコメントにおけるさまざまなオンライン行動を分析するために設計されています。以前の研究を基にして、私たちはGPT-4o miniを使用して、感情分析、感情検出、ヘイトスピーチ、グループ一般化を含む25のタスクのために約80万件のコメントに注釈を付けました。各コメントは5段階のリッカート尺度に基づいて自動的にラベル付けされました。第二段階の注釈では、各調査された行動を含む高確率または低確率のコメントが手動で見直されました。クラウドワーカーを活用してこれらの自動ラベル付けされたコメントを改善することで、私たちはデータセットの質と精度を確保し、12,232件の独自に注釈されたコメントと19,301件の注釈を実現しました。「ホッターとコルダー」は、アイスランドにおけるコンテンツモデレーションの研究および有害なオンライン行動を自動的に検出するための重要なリソースを提供します。
2025-02-24T09:23:39
Muon is Scalable for LLM Training
http://arxiv.org/abs/2502.16982v1
Jingyuan Liu, Jianlin Su, Xingcheng Yao, Zhejun Jiang, Guokun Lai, Yulun Du, Yidao Qin, Weixin Xu, Enzhe Lu, Junjie Yan, Yanru Chen, Huabin Zheng, Yibo Liu, Shaowei Liu, Bohong Yin, Weiran He, Han Zhu, Yuzhi Wang, Jianzhou Wang, Mengnan Dong, Zheng Zhang, Yongsheng Kang, Hao Zhang, Xinran Xu, Yutao Zhang, Yuxin Wu, Xinyu Zhou, Zhilin Yang
Moonshot AI, UCLA
最近、行列直交化に基づくMuonオプティマイザーは、小規模言語モデルのトレーニングで強力な結果を示していますが、大規模モデルへのスケーラビリティはまだ証明されていません。Muonをスケールアップするための2つの重要な技術を特定しました。(1) ウェイト減衰の追加、(2) パラメーターごとの更新スケールの慎重な調整です。これらの技術により、Muonはハイパーパラメータの調整なしで、大規模トレーニングでそのまま機能することができます。スケーリング法の実験は、Muonが計算最適トレーニングにおいてAdamWと比較して約2倍の計算効率を達成することを示しています。これらの改善に基づいて、5.7TトークンでMuonを使用して訓練された3B/16Bパラメータのミクスチャー・オブ・エキスパート(MoE)モデル、Moonlightを紹介します。私たちのモデルは、従来のモデルと比較して、はるかに少ないトレーニングFLOPでより良いパフォーマンスを達成し、現在のパレートフロンティアを改善します。私たちは、メモリ最適で通信効率の高い分散Muon実装をオープンソースとして提供します。また、将来の研究を支援するために、事前訓練済み、インストラクション調整済み、そして中間チェックポイントもリリースします。
2025-02-24T09:12:29
Convergence of Shallow ReLU Networks on Weakly Interacting Data
http://arxiv.org/abs/2502.16977v1
Léo Dana, Francis Bach, Loucas Pillaud-Vivien
Inria, CERMICS, ENPC
私たちは、$n$ データポイントを用いて勾配流によって訓練された一隠れ層 ReLU ネットワークの収束を分析します。我々の主な貢献は、入力サンプルの相関が低いことを示す、高次元の環境空間を活用することで、ニューロン数が $\log(n)$ のオーダーのネットワークであれば、高い確率でグローバルな収束が達成できることです。我々の分析は、勾配流の軌道に沿ったポリャック-ロヤジェビッチの観点を用いており、$\frac{1}{n}$ の指数的収束速度を示します。データが正確に直交する場合、収束速度のさらなる洗練された特性を示し、その漸近挙動がオーダー $\frac{1}{n}$ と $\frac{1}{\sqrt{n}}$ の間にあることを証明します。また、収束率におけるフェーズトランジション現象を示し、これが下限から上限へと進化する過程を、相対時間 $\frac{1}{\log(n)}$ のオーダーで示します。
2025-02-24T09:07:14
LongSafety: Evaluating Long-Context Safety of Large Language Models
http://arxiv.org/abs/2502.16971v1
Yida Lu, Jiale Cheng, Zhexin Zhang, Shiyao Cui, Cunxiang Wang, Xiaotao Gu, Yuxiao Dong, Jie Tang, Hongning Wang, Minlie Huang
Tsinghua University, Zhipu AI
大規模言語モデル(LLM)が長いシーケンスの理解と生成を進化させ続ける中で、長いコンテキストを通じて新たな安全性の懸念が生じています。しかし、長いコンテキストにおけるLLMの安全性はまだ十分に探求されておらず、それに伴う評価や改善において大きなギャップがあります。これに対処するために、具体的にオープンエンドの長いコンテキストタスクにおけるLLMの安全性を評価するために設計された初の包括的ベンチマークであるLongSafetyを紹介します。LongSafetyは、7つの安全問題のカテゴリと6つのユーザー指向の長いコンテキストタスクを含んでおり、合計1,543のテストケースがあり、コンテキストごとに平均5,424語です。16の代表的なLLMに対する評価は、著しい安全性の脆弱性を明らかにし、ほとんどのモデルが55%未満の安全率を達成していることがわかりました。これらの結果は、短いコンテキストシナリオでの強い安全性能が長いコンテキストタスクにおける安全性と必ずしも相関しないことを示しており、長いコンテキストの安全性を改善するための独特な課題と緊急性を強調しています。さらに、広範な分析を通じて、長いコンテキストモデルにとっての課題となる安全問題やタスクタイプを特定しました。また、関連するコンテキストや拡張入力シーケンスが長いコンテキストシナリオにおける安全リスクを悪化させる可能性があることも発見しており、長いコンテキストの安全性の課題に対する継続的な関心が必要であることを浮き彫りにしています。私たちのコードとデータは、https://github.com/thu-coai/LongSafety で入手できます。
2025-02-24T08:54:39
UrduLLaMA 1.0: Dataset Curation, Preprocessing, and Evaluation in Low-Resource Settings
http://arxiv.org/abs/2502.16961v1
Layba Fiaz, Munief Hassan Tahir, Sana Shams, Sarmad Hussain
Center for Language Engineering, Al-Khawarizmi Institute of Computer Science, University of Engineering and Technology, Lahore
多言語の大規模言語モデル(LLM)は、ウルドゥー語のようなリソースの少ない言語では最適なパフォーマンスを提供しないことがよくあります。本論文では、オープンソースのLlama-3.1-8B-Instructアーキテクチャに基づいて派生したモデルであるUrduLLaMA 1.0を紹介します。このモデルは、1億2800万のウルドゥー語トークンで継続的に事前学習され、言語の豊かな多様性を捉えています。指示に従う能力や翻訳能力を向上させるために、低ランク適応(LoRA)を利用して、4万1000のウルドゥー語の指示と約5万の英語-ウルドゥー語翻訳ペアでモデルをファインチューニングしました。3つの機械翻訳データセットでの評価は、最先端(SOTA)モデルと比較して、著しいパフォーマンスの向上を示しており、ウルドゥー語LLMの新たなベンチマークを確立しています。これらの結果は、限られたデータと計算リソースを用いたターゲット適応戦略が、リソースの少ない言語の特有の課題に対処する可能性を強調しています。
2025-02-24T08:38:21
Lean and Mean: Decoupled Value Policy Optimization with Global Value Guidance
http://arxiv.org/abs/2502.16944v1
Chenghua Huang, Lu Wang, Fangkai Yang, Pu Zhao, Zhixu Li, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan, Qi Zhang
Fudan University, Microsoft
人間のフィードバックに基づく強化学習(RLHF)におけるプロキシマルポリシー最適化(PPO)は、大規模言語モデル(LLM)を人間の好みに調整するために不可欠です。この手法では、事前学習された固定報酬モデルを用いた俳優と批評家の共同訓練が必要です。このアプローチは、俳優と批評家の相互依存性のために計算の複雑さと不安定性を増加させます。さらに、PPOはLLMタスクにおける真の環境報酬へのアクセスがないため、その適応性が制限されます。このような状況下では、価値モデルまたは報酬モデルの事前学習は同等になり、どちらも新しい真実のフィードバックなしに固定された指導信号を提供します。これらの問題に対処するために、私たちは\textbf{デカップルドバリューポリシー最適化(DVPO)}を提案します。これは、伝統的な報酬モデリングを事前学習済みの\emph{グローバルバリューモデル(GVM)}に置き換えたスリムなフレームワークです。GVMはポリシーの軌跡に条件付けされ、トークンレベルのリターン予測を行います。価値モデルをポリシー訓練から切り離すことにより(固定されたGVM駆動のRL目的を通じて)、DVPOは俳優と批評家の相互依存性を排除し、従来のRLHFと比較してGPUメモリ使用量を40%、訓練時間を35%削減します。ベンチマークにおける実験では、DVPOが効率的なRLHF手法(例えば、DPO)を上回りつつ、最先端のPPOに匹敵するパフォーマンスを示すことが分かりました。
2025-02-24T08:11:33
Reasoning Does Not Necessarily Improve Role-Playing Ability
http://arxiv.org/abs/2502.16940v1
Xiachong Feng, Longxu Dou, Lingpeng Kong
ロールプレイング大規模言語モデル(LLMs)の応用は、学術および商業の両分野で急速に拡大しており、高精度なロールプレイングモデルの需要が高まっています。同時に、推論技術の急速な進展はLLMsの性能の限界を常に押し上げています。実際のロールプレイングの要求と進化する推論能力の交差点は、重要な研究課題を提起します。「推論技術はLLMsのロールプレイング能力を向上させることができるか?」この問いに答えるために、我々は6つのロールプレイングベンチマーク、24のLLMs、3つの異なるロールプレイング戦略を使用して、直接的なゼロショットロールプレイング、Chain-of-Thought(CoT)を使ったロールプレイング、推論最適化されたLLMsを用いたロールプレイングの効果を比較する包括的な研究を行います。我々の調査結果は、CoTがロールプレイングパフォーマンスを低下させる可能性があり、推論最適化されたLLMsはロールプレイングには不適切で、推論能力がロールプレイングのスケーリング法則を乱し、大きなモデルは高度なロールプレイングにおいても依然として熟練度を欠いていること、中国のロールプレイング能力が英語のロールプレイング能力を上回ることを明らかにしました。さらに、広範な実験結果に基づいて、ロールプレイングLLMsの改善のためのRole-aware CoTとロールプレイングLLMsのための強化学習という2つの有望な今後の研究方向を提案します。これは、研究と実世界のアプリケーションのために、ロールプレイングLLMsの適応性、一貫性、効果を向上させることを目指しています。
2025-02-24T08:08:41
Supervised contrastive learning from weakly-labeled audio segments for musical version matching
http://arxiv.org/abs/2502.16936v1
Joan Serrà, R. Oguz Araz, Dmitry Bogdanov, Yuki Mitsufuji
音楽のバージョン(同じ曲の異なる演奏)の検出は、重要な応用がある難しいタスクです。真実の性質上、既存のアプローチは音楽のバージョンをトラックレベル(例えば、全曲)で一致させます。しかし、ほとんどのアプリケーションでは、セグメントレベル(例えば、20秒のチャンク)で一致させることが求められます。さらに、既存のアプローチは分類や三重項損失に依存しており、重要な改善をもたらす可能性のあるより最近の損失を無視しています。本論文では、弱く注釈されたセグメントから学習する方法を提案し、よく研究された代替案を上回る対比損失の変種を用います。前者はペアワイズセグメント距離の縮小に基づいており、後者はデカップリング、ハイパーパラメータ、幾何学的な考慮に従って既存の損失を修正します。これらの2つの要素を用いることで、標準的なトラックレベルの評価で最先端の結果を達成するだけでなく、セグメントレベルの評価でも画期的なパフォーマンスを得ることができました。ここで取り組んでいる課題の一般性により、提案された方法は音声や音楽バージョンの一致以外の分野でも役立つ可能性があると考えています。
2025-02-24T08:01:40
Perceptual Noise-Masking with Music through Deep Spectral Envelope Shaping
http://arxiv.org/abs/2502.17527v1
Clémentine Berger, Roland Badeau, Slim Essid
人々はしばしば騒がしい環境の中で音楽を聴き、周囲の音から自分を隔離しようとします。実際、音楽信号は同時マスキング効果により、ノイズの周波数成分の一部をマスクすることができます。本記事では、音楽の周波数特性を予測されたフィルタ周波数応答で再形成し、環境音をマスクする能力を向上させることを目的とした心理音響マスキングモデルに基づくニューロネットワークを提案します。このモデルは、ノイズを効果的にマスクしながら、元の音楽ミックスとユーザーが選択したリスニングレベルを維持するという2つの制約をバランスさせる知覚的損失関数を用いて訓練されます。私たちは、騒がしい環境でヘッドフォンを使用して音楽を聴くユーザーの体験を再現するシミュレーションデータでアプローチを評価しました。定義された客観的指標に基づく結果は、私たちのシステムが最先端の技術を改善することを示しています。
2025-02-24T07:58:10
BigMac: A Communication-Efficient Mixture-of-Experts Model Structure for Fast Training and Inference
http://arxiv.org/abs/2502.16927v1
Zewen Jin, Shengnan Wang, Jiaan Zhu, Hongrui Zhan, Youhui Bai, Lin Zhang, Zhenyu Ming, Cheng Li
Mixture-of-Experts(MoE)構造は、Transformerベースの大規模言語モデル(LLM)をスケーリングし、計算リソースのサブリニアな増加でパフォーマンスを向上させます。最近、さらに計算効率を改善しながらパフォーマンスの劣化を防ぐ細粒度のDeepSeekMoE構造が提案されました。しかし、MoEによって導入されたAll-to-All通信はボトルネックとなり、特に細粒度構造では、多くのエキスパートを関与させ、活性化させるため、通信オーバーヘッドが重くなることが一般的です。本論文では、BigMacという新しいMoE構造を提案します。BigMacも細粒度ですが、高い通信効率を持っています。BigMacの革新は、細粒度MoEで使用される communicate-descend-ascend-communicate(CDAC)方式を放棄することによるもので、これにより、All-to-All通信が常に最高次元で行われます。代わりに、BigMacは効率的な descend-communicate-communicate-ascend(DCCA)方式を設計しています。具体的には、エキスパートの入口と出口にそれぞれ降下および上昇のプロジェクションを追加し、通信が非常に低次元で行えるようにします。さらに、DCCAに適応するために、小エキスパートの構造を再設計し、BigMacのエキスパートがトークンを処理するのに十分な複雑さを持つことを保証しています。実験結果は、BigMacが同じ数のエキスパートと似た数の総パラメータを持つ細粒度MoEと比較して同等かそれ以上のモデル品質を達成することを示しています。同様に重要なことに、BigMacは、Megatron、Tutel、およびDeepSpeed-Inferenceなどの最先端のAI計算フレームワークで、トレーニング時のエンドツーエンドのレイテンシを最大3.09倍まで削減し、推論時のスループットを最大3.11倍まで向上させます。
2025-02-24T07:37:29
A Systematic Survey of Automatic Prompt Optimization Techniques
http://arxiv.org/abs/2502.16923v1
Kiran Ramnath, Kang Zhou, Sheng Guan, Soumya Smruti Mishra, Xuan Qi, Zhengyuan Shen, Shuai Wang, Sangmin Woo, Sullam Jeoung, Yawei Wang, Haozhu Wang, Han Ding, Yuzhe Lu, Zhichao Xu, Yun Zhou, Balasubramaniam Srinivasan, Qiaojing Yan, Yueyan Chen, Haibo Ding, Panpan Xu, Lin Lee Cheong
大規模言語モデル(LLM)の登場以来、プロンプトエンジニアリングは、さまざまな自然言語処理(NLP)タスクにおいて望ましい応答を引き出すための重要なステップとなっています。しかし、モデル、タスク、関連するベストプラクティスの急速な進展により、プロンプトエンジニアリングはエンドユーザーにとって障害のままであります。これを緩和するために、最近では、さまざまな自動化技術を使用してLLMのパフォーマンスを向上させる自動プロンプト最適化(APO)技術が登場しています。本論文では、この分野における現在の進捗と残された課題を要約した包括的な調査を提示します。APOの公式な定義、5部構成の統一フレームワークを提供し、次に、関連するすべての研究をその顕著な特徴に基づいて厳密に分類します。我々のフレームワークに基づいてさらなる研究が促進されることを期待しています。
2025-02-24T07:29:13
ENACT-Heart -- ENsemble-based Assessment Using CNN and Transformer on Heart Sounds
http://arxiv.org/abs/2502.16914v1
Jiho Han, Adnan Shaout
The University of Michigan - Dearborn, Industrial AI Lab, SimPlatform Co. Ltd.
この研究は、音声分析における Vision Transformer (ViT) の原則の適用を探求しており、特に心音に焦点を当てています。この論文では、Mixture of Experts (MoE) フレームワークを通じて、畳み込みニューラルネットワーク (CNN) と ViT の補完的な強みを活用する新しいアンサンブルアプローチである ENACT-Heart を紹介します。これにより、驚異的な分類精度 97.52% を達成しました。これは、ViT (93.88%) と CNN (95.45%) の個別の貢献を上回り、心血管健康モニタリングにおける診断精度の向上の可能性を示しています。これらの結果は、心血管健康のモニタリングと診断におけるアンサンブル手法の分類性能向上の可能性を示しています。
2025-02-24T07:19:28
When Can We Solve the Weighted Low Rank Approximation Problem in Truly Subquadratic Time?
http://arxiv.org/abs/2502.16912v1
Chenyang Li, Yingyu Liang, Zhenmei Shi, Zhao Song
Fuzhou University, The University of Hong Kong, University of Wisconsin-Madison, The Simons Institute for the Theory of Computing at the UC, Berkeley
重み付き低ランク近似問題は、基本的な数値線形代数の問題であり、機械学習に多くの応用があります。$n \times n$ の重み行列 $W$ と $n \times n$ の行列 $A$ が与えられたとき、目標は、$| W \circ (U V^\top - A) |_F2$ のコストが最小化されるような、低ランクの行列 $U, V \in \mathbb{R}^{n \times k}$ を見つけることです。これまでの研究では、行列 $A$ と $W$ が密な場合、すなわち $\Omega(n2)$ の非ゼロエントリを持つ場合、$\Omega(n2)$ の時間が必要でした。本研究では、特定の条件下において、たとえ $A$ と $W$ が密であっても、ほぼ線形の $n^{1+o(1)}$ 時間で重み付き低ランク近似問題を解決できる可能性があることを示します。
2025-02-24T07:18:24
MambaFlow: A Novel and Flow-guided State Space Model for Scene Flow Estimation
http://arxiv.org/abs/2502.16907v1
Jiehao Luo, Jintao Cheng, Xiaoyu Tang, Qingwen Zhang, Bohuan Xue, Rui Fan
South China Normal University, KTH Royal Institute of Technology, Tongji University, Xiaomi
シーンフロー推定は、連続するポイントクラウドフレームから3D動作を予測することを目指しており、自律運転分野で大きな関心を集めています。既存の方法は、空間-時間モデル化の不十分さやボクセル化の際に細かい特徴が失われるという課題に直面しています。しかし、線形の複雑さでグローバルモデリングを可能にする代表的な状態空間モデル(SSM)であるMambaの成功は、有望な解決策を提供します。本論文では、Mambaに基づくデコーダを持つ新しいシーンフロー推定ネットワーク、MambaFlowを提案します。これは、よく設計されたバックボーンを使用して、空間-時間特徴の深い相互作用と結合を可能にします。革新的に、効率的なMambaベースのデコーダを使用して、ボクセルベースの特徴のグローバル注意モデリングをポイントオフセット情報で誘導し、共有ボクセル表現をポイントワイズ特徴にデボクセル化するために使用されるボクセルからポイントへのパターンを学習します。さらに、さまざまなシナリオにおけるモデルの一般化能力を高めるために、異なる動きのパターンに自動的に適応する新しいシーン適応損失関数を提案します。Argoverse 2ベンチマークでの広範な実験により、MambaFlowが既存の研究の中でリアルタイム推論速度で最先端の性能を達成し、現実の都市シナリオにおいて正確なフロー推定を可能にすることが示されました。コードはhttps://github.com/SCNU-RISLAB/MambaFlowにて利用可能です。
2025-02-24T07:05:49
Culture-TRIP: Culturally-Aware Text-to-Image Generation with Iterative Prompt Refinment
http://arxiv.org/abs/2502.16902v1
Suchae Jeong, Inseong Choi, Youngsik Yun, Jihie Kim
Dongguk University
テキストから画像へのモデル、特にステーブルディフュージョンは、与えられたプロンプトに対して高い意味的整合性を持つ画像を生成する能力が大幅に向上しました。しかし、既存のモデルは、韓国の器具である「ハンガリ」のように、西洋文化ではあまり知られていない、または過小評価されている文化的概念や物体に対して適切な画像を生成できない場合があります。本論文では、文化的に配慮したテキストから画像への生成を行う新しいアプローチ、文化的トリップ(Culture-TRIP)を提案します。このアプローチは、プロンプトを洗練させることで、テキストから画像へのモデルにおける画像と文化名詞との整合性を向上させるものです。私たちのアプローチは (1) プロンプト内の文化名詞に関連する文化的コンテキストと視覚的詳細を取得し、(2) 一連の文化基準と大規模言語モデルに基づいてプロンプトを反復的に洗練し評価します。この洗練プロセスでは、ウィキペディアやウェブから取得した情報を活用します。8カ国の66人の参加者を対象に実施したユーザー調査により、私たちの提案したアプローチが画像とプロンプトの整合性を向上させることが示されました。特に、C-TRIPは生成された画像と過小評価された文化名詞との整合性が向上することを示しています。リソースは https://shane3606.github.io/Culture-TRIP で見つけられます。
2025-02-24T06:56:56
Char-mander Use mBackdoor! A Study of Cross-lingual Backdoor Attacks in Multilingual LLMs
http://arxiv.org/abs/2502.16901v1
Himanshu Beniwal, Sailesh Panda, Mayank Singh
Indian Institute of Technology Gandhinagar
私たちは、多言語大規模言語モデル(mLLMs)におけるクロスリンガルバックドア攻撃(X-BAT)を探求し、ある言語に挿入されたバックドアがいかに共有埋め込み空間を通じて他の言語に自動的に転送できるかを明らかにします。毒性分類をケーススタディとして使用し、攻撃者が単一の言語でデータを汚染することで多言語システムを危険にさらすことができることを示します。希少なトークンが特定の効果的なトリガーとして機能します。私たちの研究結果は、これらのモデルにおけるクロスリンガル転送を可能にする基本的なアーキテクチャの重大な脆弱性を露呈しています。私たちのコードとデータは、https://github.com/himanshubeniwal/X-BAT で公開されています。
2025-02-24T06:54:50
Zero-shot Load Forecasting for Integrated Energy Systems: A Large Language Model-based Framework with Multi-task Learning
http://arxiv.org/abs/2502.16896v1
Jiaheng Li, Donghe Li, Ye Yang, Huan Xi, Yu Xiao, Li Sun, Dou An, Qingyu Yang
再生可能エネルギー源の電力システムへの浸透の増加は、負荷予測の複雑さと不確実性を高め、特に複数のエネルギーキャリアを持つ統合エネルギーシステムにおいて顕著です。従来の予測手法は、歴史的データに大きく依存し、異なるシナリオ間での移転可能性が限られているため、スマートグリッドやエネルギーインターネットにおける新しい応用に対して重大な課題を提起しています。本論文では、これらの課題に対処するために、LLM(大規模言語モデル)に基づく新しいゼロショット負荷予測フレームワークであるTSLLM-Load Forecasting Mechanismを提案します。このフレームワークは、3つの主要なコンポーネントから構成されています。1つ目は、複数のソースからのエネルギー負荷データを処理するデータ前処理モジュール、2つ目は、マルチタスク学習と類似性整合を通じてエネルギーデータとLLMの間の意味的ギャップを埋める時系列プロンプト生成モジュール、3つ目は、正確な予測のために事前学習されたLLMを活用する予測モジュールです。このフレームワークの有効性は、20のオーストラリアの太陽光発電家庭からの負荷プロファイルを含む実世界のデータセットを用いて検証され、従来のシナリオとゼロショットシナリオの両方で優れた性能を示しました。従来のテストにおいて、我々の手法は平均二乗誤差(MSE)0.4163、平均絶対誤差(MAE)0.3760を達成し、既存のアプローチよりも少なくとも8%の改善を示しました。19の家庭におけるゼロショット予測実験では、フレームワークは一貫した精度を維持し、総MSEは11.2712、MAEは7.6709となり、現在の方法に対して少なくとも12%の改善を示しました。これらの結果は、統合エネルギーシステムにおける正確で移転可能な負荷予測の可能性を検証しており、特に再生可能エネルギー統合とスマートグリッドの応用に対して有益です。
2025-02-24T06:50:26
ReFocus: Reinforcing Mid-Frequency and Key-Frequency Modeling for Multivariate Time Series Forecasting
http://arxiv.org/abs/2502.16890v1
Guoqi Yu, Yaoming Li, Juncheng Wang, Xiaoyu Guo, Angelica I. Aviles-Rivero, Tong Yang, Shujun Wang
最近の進展により、頻度に基づく技術が深層学習モデルに徐々に取り入れられ、時系列分析タスクにおける精度と効率が著しく向上しています。しかし、実世界の時系列における中周波スペクトルギャップでは、エネルギーが低周波域に集中している一方で、中周波帯域が無視されるため、既存の深層学習モデルが重要な周波数情報を抽出する能力が妨げられています。さらに、異なる時系列が識別不可能な周波数パターンを共有する多変量時系列における共有キー周波数は、既存の文献ではほとんど活用されていません。本研究では、中周波帯域の重要性を強調するために、畳み込みと残差学習に基づく新しいモジュール「適応型中周波エネルギー最適化器」を紹介します。また、共有キー周波数を捉えるためのエネルギーに基づくキー周波数ピッキングブロックを提案し、少ないパラメータで優れたインターシリーズモデリング性能を実現します。さらに、他のチャネルからのスペクトル情報を各チャネルにランダムに導入することで、キー周波数モデリングをさらに強化する新しいキー周波数強化トレーニング戦略を採用しました。私たちのアプローチは、難易度の高いトラフィック、ECL、太陽エネルギーのベンチマークにおいて多変量時系列予測を向上させ、従来の最先端のiTransformerと比較してMSEをそれぞれ4%、6%、5%削減しました。コードはこのGitHubリポジトリで利用可能です: https://github.com/Levi-Ackman/ReFocus。
2025-02-24T06:40:33
DBudgetKV: Dynamic Budget in KV Cache Compression for Ensuring Optimal Performance
http://arxiv.org/abs/2502.16886v1
Xuanfan Ni, Liyan Xu, Chenyang Lyu, Longyue Wang, Mo Yu, Lemao Liu, Fandong Meng, Jie Zhou, Piji Li
大規模言語モデル(LLM)の推論中のメモリ負荷を軽減するために、多くの研究が注意のスパース性などの側面を探ることでKVキャッシュの圧縮に焦点を当てています。しかし、これらの技術はしばしば事前定義されたキャッシュ予算を必要とし、最適な予算は異なる入力の長さやタスクの種類に応じて変化するため、オープンドメインの指示を受け入れる実際の展開を制限します。この制限に対処するために、私たちは新しいKVキャッシュ圧縮の目的を提案します。つまり、特定の入力にかかわらず常に完全キャッシュのパフォーマンスを確保しつつ、KVキャッシュのプルーニングを可能な限り最大化することです。この目標を達成するために、残りのKVキャッシュが完全キャッシュのパフォーマンスに一致しない可能性が高いときにシグナルを送る注意ベースのメトリックを特徴とする新しいKVキャッシュ圧縮手法であるDBudgetKVを導入します。実験的評価は、多様なコンテキストの長さ、タスクの種類、モデルのサイズにわたって私たちの手法が損失のないKVプルーニングを効果的かつ堅牢に実現し、平均して25%以上の圧縮率を超えたことを示唆しています。さらに、私たちの手法はLLM推論内に簡単に統合でき、メモリスペースを最適化するだけでなく、既存の方法と比較して推論時間の短縮も示しています。
2025-02-24T06:33:39
CORAL: Learning Consistent Representations across Multi-step Training with Lighter Speculative Drafter
http://arxiv.org/abs/2502.16880v1
Yepeng Weng, Dianwen Mei, Huishi Qiu, Xujie Chen, Li Liu, Jiang Tian, Zhongchao Shi
投機的デコーディングは、軽量な投機的ドラフトモデルを活用することで、大規模言語モデル(LLM)のインファレンスを加速する強力な技術です。しかし、既存の設計はトレーニングとインファレンスの不整合により性能が低下しています。最近の手法はいくつかのステップを経たトレーニング戦略を採用することでこの問題を解決しようとしていますが、異なるトレーニングステップの複雑な入力は、ドラフトモデルの収束を困難にします。これに対処するために、私たちはCORALという新しいフレームワークを提案します。CORALは、投機的ドラフティングの精度と効率の両方を向上させます。CORALは、複数のトレーニングステップ間の整合性を強化する「クロスステップ表現整合性」手法を導入し、投機的ドラフティングのパフォーマンスを大幅に向上させます。さらに、私たちはLMヘッドがドラフトモデルのインファレンス速度における主要なボトルネックであることを特定しました。私たちは、インファレンス中にLMヘッドのパラメータのサブセットを選択的にアクティブ化する重みグルーピングメカニズムを導入し、ドラフトモデルの待機時間を実質的に削減します。CORALを3つのLLMファミリーと3つのベンチマークデータセットで評価した結果、2.50倍から4.07倍のスピードアップ比を達成し、EAGLE-2やHASSなどの最先端手法を上回りました。私たちの結果は、CORALがトレーニングとインファレンスの不整合を効果的に軽減し、大規模な語彙を持つ現代のLLMに対して著しいスピードアップを提供することを示しています。
2025-02-24T06:28:26
A Multi-LLM-Agent-Based Framework for Economic and Public Policy Analysis
http://arxiv.org/abs/2502.16879v1
Yuzhi Hao, Danyang Xie
The Hong Kong University of Science and Technology, Society Hub
この論文は、異質な人工経済エージェントとして複数の大規模言語モデル(LLM)を活用することによって、経済および公共政策分析における新しいアプローチを開拓しています。まず、二つの異なるシナリオの下での二期間消費配分問題を解決するための、五つのLLMの経済的意思決定能力を評価します。具体的な効用関数を用いるシナリオと直感的な推論に基づくシナリオの二つです。これまでの研究では、異質性を単にプロンプトを変えることでシミュレーションすることが多かったですが、私たちのアプローチは、異なるLLM間の分析能力の固有の変動を利用して、多様な認知特性を持つエージェントをモデル化します。これらの発見を基に、これらのLLMを特定の教育グループやそれに対応する所得層にマッピングすることにより、マルチLLMエージェントベース(MLAB)フレームワークを構築します。利子所得課税をケーススタディとして使用し、MLABフレームワークが異質なエージェント間での政策影響をシミュレーションできることを実証し、LLMの人間のような推論能力と計算力を活用することで、経済および公共政策分析に新しい有望な方向性を提供します。
2025-02-24T06:27:07
Utilizing Social Media Analytics to Detect Trends in Saudi Arabias Evolving Market
http://arxiv.org/abs/2502.16871v1
Kanwal Aalijah
サウジアラビアは、ビジョン2030の下で迅速な経済成長と社会変革を遂げました。これは、地域の新たなトレンドを追跡するユニークな機会を提供し、最終的には新しいビジネスと投資の可能性を切り開くことになります。この論文では、AIとソーシャルメディア分析がどのようにして建設、飲食、観光、テクノロジー、エンターテインメントなどの分野でトレンドを特定し追跡できるかを探ります。これにより、企業が情報に基づいた意思決定を行うのに役立ちます。私たちは、特化したAI駆動の方法論を活用して、毎月何百万件ものソーシャルメディア投稿を分析し、議論を分類してスコアを計算し、トレンドを追跡しました。このアプローチは、新たに浮上するトレンドを明らかにするだけでなく、減少しているトレンドも示しています。我々の方法論は、ソーシャルメディアデータを利用することでトレンドの出現と成長を予測することができます。このアプローチは、他の地域への適応の可能性を秘めています。最終的に、我々の発見は、進行中のAI駆動のトレンド分析が、ますますダイナミックな環境でより効果的でデータに基づいたビジネス・開発戦略を実現できることを示しています。
2025-02-24T06:15:39
Graphy'our Data: Towards End-to-End Modeling, Exploring and Generating Report from Raw Data
http://arxiv.org/abs/2502.16868v1
Longbin Lai, Changwei Luo, Yunkai Lou, Mingchen Ju, Zhengyi Yang
Alibaba Group, University of New South Wales
大規模言語モデル(LLM)は、最近、情報検索強化生成(RAG)や自律AIエージェントのワークフローなどのタスクにおいて素晴らしい成果を示しています。しかし、大量の非構造化文書に直面し、進行中の探査、分析、統合が必要な場合、例えば文献調査を行う際には、既存のアプローチはしばしば不十分です。私たちはこの課題、すなわち「進行中の文書調査」と呼ばれるものに対処するために、データモデリング、探査、高品質なレポート生成をユーザーフレンドリーな方法で自動化するエンドツーエンドプラットフォーム「Graphy」を導入しました。Graphyは、生の文書を事実と次元のノードからなる構造化グラフに変換するオフラインスクレイパーと、反復的な探査とLLM駆動のレポート生成を可能にするオンラインサーベイヤーから成ります。私たちは、参考文献を含む5万本以上の論文の事前スクレイパーグラフを披露し、Graphyが文献調査シナリオをどのように促進するかを示します。デモビデオは、https://youtu.be/uM4nzkAdGlM で見ることができます。
2025-02-24T06:10:49
Toward Agentic AI: Generative Information Retrieval Inspired Intelligent Communications and Networking
http://arxiv.org/abs/2502.16866v1
Ruichen Zhang, Shunpu Tang, Yinqiu Liu, Dusit Niyato, Zehui Xiong, Sumei Sun, Shiwen Mao, Zhu Han
Nanyang Technological University, University of Technology and Design, Institute for Infocomm Research, Auburn University, University of Houston, Kyung Hee University
現代の通信ネットワークの複雑さと規模の増大は、効率性、適応性、そして回復力を高めるためのインテリジェントオートメーションを要求しています。エージェンティックAIは、ダイナミックなネットワーキング環境内でAI駆動のエージェントが知覚、推論、決定、そして行動することを可能にするため、インテリジェントな通信およびネットワーキングにおける重要なパラダイムとして浮上しています。しかし、ネットワーク計画、管理、リソース配分などの通信アプリケーションにおける効果的な意思決定には、マルチホップ推論、履歴の相互参照、進化する3GPP標準への適合をサポートする取得メカニズムの統合が必要です。本稿では、生成情報検索にインスパイアされたインテリジェント通信およびネットワーキングに関する前向きな視点を提示し、通信システムにおけるエージェンティックAIのための知識獲得、処理、取得の役割を強調します。最初に、従来の検索、ハイブリッド検索、セマンティック検索、知識ベースの検索、エージェンティックコンテキスト検索など、生成情報検索戦略の包括的なレビューを提供します。次に、それらの利点、制限、およびさまざまなネットワーキングシナリオへの適合性を分析します。その後、通信およびネットワーキングにおけるそれらの応用についての調査を提示します。さらに、マルチソースの取得、構造化推論、自己反省的検証を統合することで通信特有の計画を強化するためのエージェンティックコンテキスト検索フレームワークを紹介します。実験結果は、当フレームワークが従来の検索およびセマンティック検索手法に比べて、回答の正確性、説明の整合性、そして取得の効率を大幅に向上させることを示しています。最後に、今後の研究方向性をまとめます。
2025-02-24T06:02:25
Sarang at DEFACTIFY 4.0: Detecting AI-Generated Text Using Noised Data and an Ensemble of DeBERTa Models
http://arxiv.org/abs/2502.16857v1
Avinash Trivedi, Sangeetha Sivanesan
National Institute of Technology, Tiruchirapalli
この論文では、AI生成テキストを検出するための効果的なアプローチを提示します。これは、第4回マルチモーダルファクトチェックおよびヘイトスピーチ検出ワークショップにおけるDefactify 4.0共有タスクのために開発されました。タスクは2つのサブタスクから構成されます:タスクAは、テキストがAI生成か人間の執筆かを分類すること、タスクBは、特定の大規模言語モデルがテキストを生成したかを分類することです。私たちのチーム(Sarang)は、両方のタスクで1位を達成し、F1スコアはそれぞれ1.0と0.9531でした。方法論は、データセットにノイズを追加してモデルの頑健性と一般化を向上させることを含んでいます。私たちは、テキスト内の複雑なパターンを効果的に捉えるためにDeBERTaモデルのアンサンブルを使用しました。その結果は、私たちのノイズ駆動のアプローチとアンサンブルベースのアプローチの効果を示しており、AI生成テキストの検出における新たな基準を設定し、今後の開発に対する指針を提供します。
2025-02-24T05:32:00
Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
http://arxiv.org/abs/2502.16852v1
Yuheng Zhang, Dian Yu, Tao Ge, Linfeng Song, Zhichen Zeng, Haitao Mi, Nan Jiang, Dong Yu
人間のフィードバックからの強化学習(RLHF)は、大規模言語モデル(LLM)を人間の好みに合わせる上で、驚異的な効果を示しています。既存のアライメントアプローチの多くは、各プロンプト-レスポンスペアに対して真の報酬が存在するというブラッドリー・テリー(BT)モデルの仮定に依存しています。しかし、この仮定は複雑な人間の好みをモデル化する際に過度に制限的である可能性があります。本論文では、BTモデルの仮定を廃棄し、2人プレイヤーのゲームとして一般的な好みに基づいたLLMのアライメントを研究します。ゲームにおける学習の理論的な知見を基に、私たちはナッシュポリシーを近似するために、楽観的オンラインミラー接地をアライメントフレームワークに統合します。理論的には、私たちのアプローチが双対ギャップに対して$O(T^{-1})$のバウンドを達成し、従来の$O(T^{-1/2})$の結果を改善することを示します。さらに重要なのは、私たちの方法を実装し、実験を通じて、複数の代表的なベンチマークにおいて最先端のRLHFアルゴリズムを上回ることを示したことです。
2025-02-24T05:24:52
PulseBat: A field-accessible dataset for second-life battery diagnostics from realistic histories using multidimensional rapid pulse test
http://arxiv.org/abs/2502.16848v1
Shengyu Tao, Guangyuan Ma, Huixiong Yang, Minyan Lu, Guodan Wei, Guangmin Zhou, Xuan Zhang
電気自動車(EV)の運用寿命が終わりに近づくにつれて、バッテリーは重要な経済的価値を保持し、セカンドライフ利用や素材のリサイクルにおいて有望な機会を提供します。これは、信頼できるエネルギー貯蔵が脆弱であるか存在しない電力網とエネルギーインフラが引き起こす重大な課題に対処するために不可欠なグローバルサウスやその他の未発展地域にとって特に魅力的です。しかし、この可能性にもかかわらず、広範な採用はセカンドライフバッテリーの技術的性能、安全性、再認証に関する重大な不確実性によって妨げられています。再導入された場合、推定性能と実際の性能との不一致が原因で、バッテリーは技術的に不適合または危険とされ、恩恵を受けるはずのコミュニティにとって負担となることがあります。この重大な不整合はエネルギーアクセスの格差を悪化させ、エネルギーの公正という広範なビジョンを損なっており、その可能性を解放するための強固でスケーラブルな解決策の緊急の必要性を浮き彫りにしています。PulseBatデータセットでは、著者たちは464個の廃止されたリチウムイオンバッテリーをテストし、3種類のカソード材料、6つの過去の使用履歴、3つの物理フォーマット、6つの容量設計をカバーしました。パルステスト実験は、各セカンドライフバッテリーに対して繰り返し行われ、10のパルス幅、10のパルス大きさ、複数の充電状態、および健康状態(例えば、0.37から1.03まで)の条件で実施されました。PulseBatデータセットは、これらのテスト条件と電圧応答、さらに注入されたパルス電流に影響を受けた温度信号を記録しました。これらは、充電状態の推定、健康状態の推定、カソード材料の特定、開放回路電圧の再構築、熱管理などの重要な診断タスクにとって貴重なデータリソースとして利用できます。
2025-02-24T05:10:04
Characterizing Structured versus Unstructured Environments based on Pedestrians' and Vehicles' Motion Trajectories
http://arxiv.org/abs/2502.16847v1
Mahsa Golchoubian, Moojan Ghafurian, Nasser Lashgarian Azad, Kerstin Dautenhahn
University of Waterloo, NSERC
歩行者と車両が互いに近接して運転される際の軌道挙動は、構造化された環境と非構造化された環境で異なる場合があります。この動作挙動の違いは、自律走行車の軌道予測アルゴリズムにおいて考慮する価値があります。しかし、一般的に軌道予測のベンチマークとして使用される歩行者と車両の軌道に関する利用可能なデータセットは、環境の性質に基づいて分類されていません。一方で、非構造化環境と構造化環境の定義はそれぞれ質的であり、特定の環境のタイプを正当化するために使用するのが難しいです。本論文では、平均速度や軌道の変動性などのいくつかの抽出された軌道特徴に基づいて、既存のデータセットを比較しました。K平均法と一般化線形モデルを通じて、2つの異なる環境タイプを区別するためのより定量的な尺度を提案します。私たちの結果は、軌道の変動性、停止割合、歩行者の密度などの特徴が2つの環境タイプで異なり、既存のデータセットを分類するために使用できることを示しています。
2025-02-24T05:09:21
Fair Foundation Models for Medical Image Analysis: Challenges and Perspectives
http://arxiv.org/abs/2502.16841v1
Dilermando Queiroz, Anderson Carlos, André Anjos, Lilian Berton
Federal University of São Paulo, Federal Institute of Goiás, Idiap Research Institute
医療における公正な人工知能(AI)を確保するには、すべての人口統計グループに対して偏りのない意思決定を行うシステムが必要であり、技術革新と倫理原則を結びつける必要があります。自己教師あり学習によって膨大なデータセットで訓練された基盤モデル(FMs)は、医療画像タスクにおいて効率的な適応を可能にし、ラベル付けデータへの依存度を減少させます。これらのモデルは、公正性の向上の可能性を示していますが、人口統計グループ全体で一貫したパフォーマンスを達成するには依然として重大な課題が残っています。我々のレビューによれば、FMsにおける効果的なバイアス軽減には、開発のすべての段階を通じた体系的な介入が必要です。従来のアプローチが主にモデルレベルでのバイアス軽減に焦点を当てていたのに対し、我々の分析は、FMsの公正性は、データの文書化から展開プロトコルまで、開発パイプライン全体での統合された介入を必要とすることを示しています。この包括的なフレームワークは、体系的なバイアス軽減と政策関与を組み合わせることで、医療における公正なAIに対する技術的および制度的な障壁を効果的に解決できることを示すことによって、現在の知識を進展させます。公正なFMsの開発は、特に医療インフラが限られた地域やサービスが行き届いていない人口に対して、先進的な医療技術の民主化に向けた重要なステップとなります。
2025-02-24T04:54:49
In-context learning of evolving data streams with tabular foundational models
http://arxiv.org/abs/2502.16840v1
Afonso Lourenço, João Gama, Eric P. Xing, Goreti Marreiros
Polytechnic of Porto, University of Porto, CMU, MBZUAI
最新のデータストリームマイニングにおける監視分類は、従来、インクリメンタル決定木のアンサンブルに依存してきました。しかし、構造化された数値データ向けに設計された大規模なタブularモデル、つまりトランスフォーマーの登場は、重要なパラダイムの変化を示しています。これらのモデルは、従来の重みの更新を超えて、プロンプトチューニングを通じて文脈内学習を採用しています。無限ストリーミングデータを要約するためにその場でスケッチを使用することで、この情報を事前訓練されたモデルに供給し、効率的な処理を行うことが可能になります。この研究は、両領域の進展をつなぎ合わせ、トランスフォーマーの暗黙的メタ学習能力、漂流する自然データに対する事前訓練、および文脈最適化への依存が、動的環境における適応学習の核心的な課題にどのように直接対処するかを強調します。リアルタイムのモデル適応を探求し、この研究は、タブPFNが単純なスライディングメモリ戦略と組み合わさることで、すべての非定常ベンチマークにおいてホエフディングツリーのアンサンブルを一貫して上回ることを示しています。論文では、いくつかの有望な研究方向が示されています。著者は、コミュニティにこれらのアイデアを探求するよう促し、文脈内ストリーム学習の進展のための貴重な機会を提供しています。
2025-02-24T04:52:35
A Novel Multi-Task Teacher-Student Architecture with Self-Supervised Pretraining for 48-Hour Vasoactive-Inotropic Trend Analysis in Sepsis Mortality Prediction
http://arxiv.org/abs/2502.16834v1
Houji Jin, Negin Ashrafi, Kamiar Alaei, Elham Pishgar, Greg Placencia, Maryam Pishgar
University of Southern California, California State University, Long Beach, Iran University of Medical Sciences, California State Polytechnic University, Pomona
敗血症はICUにおける死亡の主要な原因であり、早期の認識と効果的な介入が患者の予後を改善するために不可欠です。しかし、血行動態の状態によって変動する血管作動性-イノトロピックスコア(VIS)は、不規則な投薬パターンや欠損データ、交絡因子によって複雑化し、敗血症の予測を困難にしています。これに対処するために、我々はMasked Autoencoder(MAE)を用いた自己教師ありVISプレトレーニングを備えた新しいTeacher-Studentマルチタスクフレームワークを提案します。教師モデルは死亡分類と重症度スコアの回帰を行い、生徒モデルは堅牢な時系列の表現を蒸留し、異種VISデータへの適応を強化します。LSTMベースの手法と比較して、我々のアプローチはMIMIC-IV 3.0(9,476人の患者)でのAUROCが0.82を達成し、ベースライン(0.74)を上回っています。SHAP分析により、SOFAスコア(0.147)がICU死亡に最も大きな影響を与え、次いでLODS(0.033)、単身の婚姻状況(0.031)、およびメディケイド保険(0.023)が続くことが明らかとなり、社会人口統計要因の役割が強調されました。SAPSII(0.020)も重要な寄与をしました。これらの結果は、ICUの意思決定において臨床的要因と社会的要因の両方を考慮すべきことを示唆しています。我々の新しいマルチタスクおよび蒸留戦略は、高リスク患者の早期特定を可能にし、予測精度と疾病管理を改善し、ICUの意思決定支援のための新しいツールを提供します。
2025-02-24T04:38:59
Predicting the Energy Landscape of Stochastic Dynamical System via Physics-informed Self-supervised Learning
http://arxiv.org/abs/2502.16828v1
Ruikun Li, Huandong Wang, Qingmin Liao, Yong Li
Tsinghua University, Shenzhen International Graduate School, BNRist
エネルギーランドスケープは、多くの現実世界の複雑なシステムの動力学を形成する上で重要な役割を果たします。システムの進化は、エネルギー駆動の漂流とノイズによる拡散の相乗効果の下で移動する粒子としてモデル化されることが多く、エネルギーが粒子の長期的な動きを支配します。システムのエネルギーランドスケープを推定することは、長年の間、学際的な課題であり、高い運用コストや監視信号を取得する難しさによって妨げられています。したがって、真のエネルギー値がない場合にエネルギーランドスケープをどのように推測するかという問題は重要です。本論文では、システムの進化軌跡からエネルギーランドスケープを学習するための物理に基づいた自己教師あり学習方法を提案します。まず、観測空間から離散的なランドスケープ空間へとシステムの状態を適応的なコードブックによりマッピングし、その後、エネルギーをグラフニューラルフォッカー・プランク方程式に明示的に統合し、エネルギー推定と進化予測の共同学習を可能にします。学際的なシステムにおける実験結果は、私たちの推定したエネルギーが真実との相関係数が0.9以上であり、進化予測の精度がベースラインを平均17.65%上回っていることを示しています。コードはgithub.com/tsinghua-fib-lab/PESLAで入手可能です。
2025-02-24T04:26:26
Uncertainty Quantification of Large Language Models through Multi-Dimensional Responses
http://arxiv.org/abs/2502.16820v2
Tiejin Chen, Xiaoou Liu, Longchao Da, Jia Chen, Vagelis Papalexakis, Hua Wei
Arizona State University, University of California, Riverside
大規模言語モデル(LLM)は、大規模なトレーニングデータセットと強力なトランスフォーマーアーキテクチャにより、さまざまなタスクで優れた能力を示しています。しかし、LLMからの応答の信頼性は依然として疑問です。LLMの不確実性定量化(UQ)は、特にヘルスケア、金融、意思決定などの分野において、その信頼性を確保するために重要です。既存のUQ手法は主に意味的類似性に焦点を合わせており、応答に埋め込まれたより深い知識の次元を見落としています。私たちは、意味的および知識に基づいた類似性分析を統合した多次元UQフレームワークを提案します。複数の応答を生成し、補助的なLLMを活用して暗黙の知識を抽出することで、別々の類似性行列を構築し、テンソル分解を適用して包括的な不確実性表現を導出します。このアプローチは、意味的および知識の次元からのオーバーラップ情報を分離し、意味的な変動と事実の一貫性の両方を捉え、より正確なUQにつながります。私たちの実証的評価は、私たちの手法が不確実な応答を特定する際に既存の技術を上回り、高リスクな応用においてLLMの信頼性を向上させるためのより堅牢なフレームワークを提供することを示しています。
2025-02-24T04:05:08
Snoopy: Effective and Efficient Semantic Join Discovery via Proxy Columns
http://arxiv.org/abs/2502.16813v1
Yuxiang Guo, Yuren Mao, Zhonghao Hu, Lu Chen, Yunjun Gao
セマンティックジョイン発見は、クエリ列に対して高いセマンティックジョイン能力を持つテーブルリポジトリ内の列を見つけることを目的としており、データセット発見にとって重要です。既存の方法は、セルレベルの方法と列レベルの方法の2つのカテゴリに分けることができます。しかし、いずれの方法も効果的かつ効率的であることを同時に保証するものではありません。セルレベルの方法は、列間のセル一致をカウントすることによってジョイン能力を計算し、理想的な効果を享受しますが、効率が悪いという欠点があります。一方、列レベルの方法は、列の埋め込みの類似性を計算するのみでジョイン能力を決定し、適切な効率を享受する一方で、列の埋め込みに発生する問題から効果が低下します:(i) セマンティクス・ジョイン能力のギャップ、(ii) サイズ制限、(iii) 順列感度。この問題に対処するために、本稿ではプロキシ列を介して列の埋め込みを計算することを提案します。さらに、プロキシ列ベースの埋め込みを活用して有効性と効率性を結びつける新しい列レベルのセマンティックジョイン発見フレームワーク、Snoopyを提案します。具体的には、提案された列の埋め込みは、軽量な近似グラフマッチングに基づく列プロジェクションによってキャプチャされる暗黙の列とプロキシ列の関係から導出されます。列プロジェクションを指導するための良好なプロキシ列を取得するために、ランクを考慮した対照的学習パラダイムを導入します。実際の4つのデータセットに関する広範な実験により、SnoopyはRecall@25で16%、NDCG@25で10%の精度向上を示し、少なくとも5桁のオーダーでセルレベルのソリューションよりも速く、既存の列レベルの方法よりも3.5倍速く優れた効率を達成することが実証されました。
2025-02-24T03:48:00
Grounded Persuasive Language Generation for Automated Marketing
http://arxiv.org/abs/2502.16810v1
Jibang Wu, Chenghao Yang, Simon Mahns, Chaoqi Wang, Hao Zhu, Fei Fang, Haifeng Xu
University of Chicago, Stanford University, Carnegie Mellon University
この論文では、大規模言語モデル(LLM)を使用して説得力があり、根拠に基づいたマーケティングコンテンツの生成を自動化するエージェンシー フレームワークを開発します。対象アプリケーションドメインとして不動産リスティングの説明を用います。私たちの方法は、生成されたコンテンツをユーザーの好みに合わせつつ、有用な事実的属性を強調するように設計されています。このエージェントは3つの主要モジュールで構成されています:(1) グラウンディングモジュール:専門家の人間の行動を模倣して市場性のある特徴を予測します;(2) パーソナライズモジュール:コンテンツをユーザーの好みに合わせます;(3) マーケティングモジュール:事実の正確性を確保し、地域特有の特徴が含まれるようにします。私たちは不動産マーケティングの領域で体系的な人的実験を実施し、潜在的な住宅購入者を焦点グループとしました。結果は、私たちのアプローチによって生成されたマーケティング説明が、人間の専門家が書いたものよりも明確な差で好まれることを示しています。私たちの調査結果は、責任ある生成を保証しつつ事実のみを使用して大規模なターゲットマーケティングを自動化するための、有望なLLMに基づくエージェンシー フレームワークを示唆しています。
2025-02-24T03:36:57
CRTrack: Low-Light Semi-Supervised Multi-object Tracking Based on Consistency Regularization
http://arxiv.org/abs/2502.16809v1
Zijing Zhao, Jianlong Yu, Lin Zhang, Shunli Zhang
北京交通大学, 山东师范大学
低照度環境下のマルチオブジェクトトラッキングは、現実生活で一般的です。近年、マルチオブジェクトトラッキングの分野では急速な発展が見られました。しかし、データセットの不足と注釈の高コストにより、低照度環境下でのマルチオブジェクトトラッキングは依然として重大な課題です。本論文では、低照度条件下のマルチオブジェクトトラッキングに焦点を当てます。限られたデータとデータセットの不足という問題に対処するため、まず低照度マルチオブジェクトトラッキングデータセット(LLMOT)を構築しました。このデータセットは、夜間条件に強化されたMOT17のデータと、複数の未注釈の低照度ビデオを含んでいます。その後、高い注釈コストに対処し、画像品質の劣化の問題に対処するために、一貫性正則化に基づく半教師ありマルチオブジェクトトラッキング手法CRTrackを提案します。まず、一貫して適応的なサンプリング割り当てを調整して静的IoUベースの戦略に置き換え、半教師ありトラッキング手法がノイズの多い擬似バウンディングボックスに耐えられるようにします。次に、未注釈データを効果的に活用してモデルのパフォーマンスを向上させる適応的な半教師ありネットワーク更新手法を設計します。データセットとコード: https://github.com/ZJZhao123/CRTrack。
2025-02-24T03:35:38
Multi-Agent Autonomous Driving Systems with Large Language Models: A Survey of Recent Advances
http://arxiv.org/abs/2502.16804v1
Yaozu Wu, Dongyuan Li, Yankai Chen, Renhe Jiang, Henry Peng Zou, Liancheng Fang, Zhen Wang, Philip S. Yu
The University of Tokyo, Cornell University, University of Illinois Chicago
自律運転システム(ADS)は、人間の介入を減少させ、運用効率を改善し、安全性を向上させることで、輸送を革命的に変えています。優れた計画および推論能力で知られる大規模言語モデル(LLM)が、運転の意思決定を支援するためにADSに統合されています。しかし、LLMベースの単独エージェントADSは、限られた認識、不十分な協力、高い計算要求という3つの主要な課題に直面しています。これらの問題に対処するために、最近のLLMベースのマルチエージェントADSにおける進展は、エージェント間のコミュニケーションと協力の改善に重点を置いています。本論文では、LLMベースのマルチエージェントADSの最前線の調査を提供します。最初に、関連する概念の背景紹介を行い、その後、異なるエージェント相互作用モードに基づいて既存のLLMベースのアプローチを分類します。次に、LLMベースのエージェントが人間と関わるシナリオにおけるエージェント-ヒューマンインタラクションについて議論します。最後に、この分野における将来の研究をサポートするための主要なアプリケーション、データセット、および課題をまとめます(https://anonymous.4open.science/r/LLM-based_Multi-agent_ADS-3A5C/README.md)。
2025-02-24T03:26:13
Unsupervised Topic Models are Data Mixers for Pre-training Language Models
http://arxiv.org/abs/2502.16802v1
Jiahui Peng, Xinlin Zhuang, Qiu Jiantao, Ren Ma, Jing Yu, Tianyi Bai, Conghui He
Shanghai AI Laboratory, School of Computer Science and Technology, East China Normal University
大規模言語モデル(LLM)の性能は、前訓練データの質と構成によって大きく影響を受けます。このデータは本質的に多様で、さまざまなドメイン、ソース、トピックにわたります。これら異種データソースを効果的に統合することは、LLMの性能を最適化するために重要です。これまでの研究は主にドメインベースのデータ混合に集中しており、しばしばデータのトピックレベルの特性の微妙な点を無視してきました。このギャップに対処するために、私たちは、トピックモデリング手法「DataWeave」を通じて生成された細かいトピックを利用するシンプルながら効果的なトピックベースのデータ混合戦略を提案します。DataWeaveは、意味的に類似した文書をグループ化するために多段階のクラスタリングプロセスを用い、LLMを活用して詳細なトピックを生成し、データセットの構成についてより微妙な理解を促進します。私たちの戦略は、特定のトピックをアップサンプリングまたはダウンサンプリングするためのヒューリスティックな方法を採用しており、下流タスクにおけるLLMの性能を大幅に向上させ、以前のより複雑なデータ混合アプローチと比較して優れた結果を達成します。さらに、科学と人間関係というトピックが特に効果的であり、最も大きな性能向上をもたらすことを確認しています。我々のコードとデータセットは、一般に公開される予定です。
2025-02-24T03:25:56
MobileSteward: Integrating Multiple App-Oriented Agents with Self-Evolution to Automate Cross-App Instructions
http://arxiv.org/abs/2502.16796v1
Yuxuan Liu, Hongda Sun, Wei Liu, Jian Luan, Bo Du, Rui Yan
Gaoling School of Artificial Intelligence, Renmin University of China, Xiaomi AI Lab, School of Computer Science, Wuhan University
モバイルフォンエージェントは、人々が日常のタスクを自動化する手助けをすることができ、これが主要な研究の焦点となっています。しかし、既存の手順指向エージェントは、以下の課題のためにアプリ間の指示に苦労しています:(1) 複雑なタスク関係、(2) 多様なアプリ環境、(3) マルチステップ実行中のエラー伝播と情報の損失。オブジェクト指向プログラミングの原則からインスピレーションを得て、オブジェクト指向の解決策がアプリ間の指示により適していることを認識します。これらの課題に対処するために、私たちはMobileStewardという自己進化型マルチエージェントフレームワークを提案します。これは、中央のStewardAgentによって調整された複数のアプリ指向のStaffAgentsを統合しています。MobileStewardには、3つの特化したモジュールを設計しています:(1) ダイナミックリクルートは、情報フローに基づいてスケジューリンググラフを生成し、アプリ間のタスクを明示的に関連付けます。(2) アサインドエグゼキューションは、各アプリに特化した専門知識を持つアプリ指向のStaffAgentsにタスクを割り当てます。(3) 調整評価は評価を行い、反省のヒントを提供したり、重要な情報を届けたりすることで、マルチステップ実行中のエラー伝播と情報損失を軽減します。MobileStewardのパフォーマンスを継続的に改善するために、成功した実行からの経験を要約してMobileStewardのパフォーマンスを向上させるメモリベースの自己進化メカニズムを開発します。私たちは、複雑なアプリ間の指示を解決するエージェントの能力を評価するために、実世界の環境で初の英語のCross-APP Benchmark (CAPBench) を設立します。実験結果は、MobileStewardが単一エージェントおよびマルチエージェントフレームワークと比較して最高のパフォーマンスを達成し、多様な複雑さを持つユーザーの指示をより良く処理する上でのMobileStewardの優越性を強調しています。
2025-02-24T03:12:45
AAD-LLM: Neural Attention-Driven Auditory Scene Understanding
http://arxiv.org/abs/2502.16794v1
Xilin Jiang, Sukru Samet Dindar, Vishal Choudhari, Stephan Bickel, Ashesh Mehta, Guy M McKhann, Adeen Flinker, Daniel Friedman, Nima Mesgarani
Columbia University, Hofstra Northwell School of Medicine, The Feinstein Institutes for Medical Research, New York University
聴覚基盤モデル、特に聴覚大型言語モデル(LLM)は、リスナーの知覚とは無関係にすべての音の入力を同等に処理します。しかし、人間の聴覚知覚は本質的に選択的です:リスナーは複雑な聴覚シーンの中で特定の話者に焦点を合わせ、他の話者を無視します。既存のモデルではこの選択性が組み込まれておらず、知覚に適合した応答を生成する能力が制限されています。これに対処するために、私たちは意図に基づく聴覚シーン理解(II-ASU)を提案し、リスナーの注意を推測するために脳信号を統合したプロトタイプシステム「聴覚注意駆動LLM(AAD-LLM)」を提示します。AAD-LLMは、リスナーが注意を向けている話者を解読するために頭蓋内脳波記録(iEEG)を組み込むことによって聴覚LLMを拡張し、それに応じて応答を洗練します。このモデルは、まず神経活動から注意を向けている話者を予測し、その後この推測された注意状態に基づいて応答生成を条件付けます。私たちは、複数の話者がいるシナリオにおける話者の説明、スピーチの文字起こしと抽出、質問応答のタスクにおいてAAD-LLMを評価しました。客観的および主観的な評価の両方が、リスナーの意図との整合性が向上したことを示しています。意図を意識した聴覚AIに向けた第一歩を踏み出すこの研究は、リスナーの知覚が機械のリスニングに影響を与える新しいパラダイムを探求し、将来のリスナー中心の聴覚システムへの道を開きます。デモとコードは以下で入手可能です:https://aad-llm.github.io。
2025-02-24T03:06:45
VGFL-SA: Vertical Graph Federated Learning Structure Attack Based on Contrastive Learning
http://arxiv.org/abs/2502.16793v1
Yang Chen, Bin Zhou
グラフニューラルネットワーク(GNN)は、グラフデータから表現を学習する能力により注目を集めています。プライバシーの懸念や、クライアント間でグラフデータを直接共有することを妨げる利益相反のため、垂直グラフ連合学習(VGFL)フレームワークが開発されました。最近の研究では、VGFLが性能を低下させる敵対的攻撃に対して脆弱であることが示されています。しかし、VGFLの領域ではクライアントノードがしばしばラベル付けされていないという一般的な問題があります。その結果、勾配を取得するためのラベリング情報の利用可能性に依存する既存の攻撃は、適用性において本質的に制約を受けます。この制限は、実際の現実環境での展開を妨げます。これらの問題に対処するために、私たちはVGFLに対する新たなグラフ敵対的攻撃、すなわちVGFL-SAを提案します。VGFL-SAは、ラベルを使用せずにローカルクライアントの構造を変更することによって、VGFLの性能を低下させます。具体的には、VGFL-SAは、ローカルクライアントがトレーニングされる前に攻撃を完了するために対比学習法を使用します。VGFL-SAは最初に、汚染されたクライアントのグラフ構造とノード特徴情報にアクセスし、ノード次数に基づくエッジの増強と特徴のシャッフル増強によって対比ビューを生成します。その後、VGFL-SAは共有されたグラフエンコーダーを使用して各ビューの埋め込みを取得し、対比関数によって隣接行列の勾配を取得します。最後に、勾配修正ルールを使用して摂動したエッジが生成されます。私たちは、実世界のデータセットに対してノード分類タスクを実行することでVGFL-SAの性能を検証し、その結果、VGFL-SAは優れた攻撃効果と転送性を達成することを示しました。
2025-02-24T03:04:48
The Role of Sparsity for Length Generalization in Transformers
http://arxiv.org/abs/2502.16792v1
Noah Golowich, Samy Jelassi, David Brandfonbrener, Sham M. Kakade, Eran Malach
MIT, Harvard University, Kempner Institute at Harvard University
大規模言語モデルをトレーニングして、そのトレーニングコンテキストの長さを超えて予測することは、近年多くの注目を集めていますが、長さの一般化の背後にある原理はまだ十分に探求されていません。私たちは、デコーダーオンリーのトランスフォーマーによって実行される次のトークン予測タスクのために長さの一般化を研究する新しい理論的枠組みを提案します。概念的には、各予測トークンが少数の(固定された)前のトークンに依存している限り、長さの一般化が発生することを示します。このようなタスクを、私たちが呼ぶ$k$-スパース植え込み相関分布という概念によって形式化し、注意ヘッドを一般化する理想化されたトランスフォーマーモデルがこのようなタスクでうまく長さ一般化することを示します。さらに、私たちの理論モデルは、長さの一般化を改善するために導入された位置エンベディングを修正する特定の技術(位置結合など)を正当化します。私たちは、合成タスクと自然言語に関する実験で理論的結果をサポートし、長さの一般化を促進する重要な要因が各トークンが前のトークンに対して持つ「スパースな」依存構造であることを確認しました。私たちの理論に触発され、位置結合アプローチで使用される位置IDを予測するためにトランスフォーマーをトレーニングする予測位置結合を導入します。予測位置結合により、位置結合を用いて長さの一般化を達成するために、適用可能なタスクの範囲を広げることが可能になります。
2025-02-24T03:01:03
AlphaAgent: LLM-Driven Alpha Mining with Regularized Exploration to Counteract Alpha Decay
http://arxiv.org/abs/2502.16789v1
Ziyi Tang, Zechuan Chen, Jiarui Yang, Jiayao Mai, Yongsen Zheng, Keze Wang, Jinrui Chen, Liang Lin
Sun Yat-sen University, University of New South Wales, Nanyang Technological University, The Chinese University of Hong Kong, Shenzhen
アルファマイニングは、定量的投資において重要な要素であり、ますます複雑化する金融市場において未来の資産リターンに対する予測信号を発見することに焦点を当てています。しかし、要因が時間とともに予測力を失うアルファデケイの普遍的な問題は、アルファマイニングにとって重大な挑戦です。遺伝的プログラミングのような従来の手法は、過剰適合や複雑さにより急速にアルファデケイに直面します。一方で、大規模言語モデル(LLM)に基づくアプローチは、その可能性があるにもかかわらず、既存の知識に過度に依存することが多く、同質の要因を生み出し、群集化とアルファデケイを悪化させてしまいます。この課題に対処するために、私たちはAlphaAgentを提案します。これは、アルファファクターをデケイに強いものとして掘り起こすために、LLMエージェントとアドホックな正則化を効果的に統合する自律型フレームワークです。AlphaAgentは、次の3つの主要メカニズムを採用しています:(i) 既存のアルファに対する抽象構文木(AST)に基づく類似度測定を通じた独自性の強制、(ii) 市場仮説と生成された要因の間の意味的一貫性をLLMによって評価し、仮説ファクターの整合性の確保、(iii) ASTに基づく構造的制約を介した複雑さの制御により、過剰適合に陥りやすい過剰設計の構造を防ぎます。これらのメカニズムは、独自性、金融的論理、進化する市場状況への適応性のバランスをとりながら、アルファ生成プロセスをガイドし、アルファデケイのリスクを軽減します。広範な評価により、AlphaAgentは強気市場および弱気市場において従来の手法やLLMベースの手法を上回り、過去4年間にわたって中国のCSI 500および米国のS&P 500市場で一貫して重要なアルファを提供していることが示されています。特に、AlphaAgentはアルファデケイに対して顕著な抵抗を示し、強力な要因を生み出す可能性を高めています。
2025-02-24T02:56:46
Unposed Sparse Views Room Layout Reconstruction in the Age of Pretrain Model
http://arxiv.org/abs/2502.16779v1
Yaxuan Huang, Xili Dai, Jianan Wang, Xianbiao Qi, Yixing Yuan, Xiangyu Yue
The Hong Kong University of Science and Technology, The Hong Kong University of Science and Technology (Guangzhou), Astribot, Intellifusion Inc., MMLab, The Chinese University of Hong Kong
複数の視点画像からの部屋レイアウト推定は、マルチビュー幾何学から生じる複雑さのため、十分に調査されていません。これは、カメラの内部および外部の推定、画像マッチング、三角測量などの多段階の解決策を必要とします。しかし、3D再構築において、最近の3D基盤モデルであるDUSt3Rの進展は、従来の動きから構造を推定するプロセスから、エンドツーエンドの単一ステップアプローチへのパラダイムシフトをもたらしました。この目的のために、私たちはPlane-DUSt3Rを導入します。これは、3D基盤モデルDUSt3Rを利用した複数視点の部屋レイアウト推定のための新しい手法です。Plane-DUSt3RはDUSt3Rフレームワークを組み込んでおり、構造的平面を推定するために修正された目的で部屋レイアウトデータセット(Structure3D)でファインチューニングされています。均一で簡素な結果を生成することにより、Plane-DUSt3Rは単一の後処理ステップと2D検出結果のみで部屋レイアウトの推定を可能にします。以前の方法が単一視点またはパノラマ画像に依存しているのに対し、Plane-DUSt3Rは複数の視点画像を処理できる設定を拡張しています。さらに、プロセスを簡略化し、誤差の蓄積を減らすエンドツーエンドのソリューションを提供します。実験結果は、Plane-DUSt3Rが合成データセット上で最先端の手法を上回るだけでなく、カートゥーンなどの異なる画像スタイルの野外データに対しても堅牢で効果的であることを示しています。
2025-02-24T02:14:19
The Robustness of Structural Features in Species Interaction Networks
http://arxiv.org/abs/2502.16778v1
Sanaz Hasanzadeh Fard, Emily Dolson
種間相互作用ネットワークは、生態系コミュニティを説明するための強力なツールです。通常、これらのネットワークは種を表すノードと、それらの種間の相互作用を表すエッジを含んでいます。類似したネットワークのグループについて抽象的な推論を行うために、生態学者はしばしばグラフトポロジーのメトリックを使用して構造的特徴を要約します。しかし、これらのネットワークの基盤となるデータを収集することは困難であり、いくつかの相互作用が見逃される可能性があります。したがって、欠落データが異なる構造メトリックにどの程度影響を与えるかを理解することが重要です。この問題に対処するために、私たちは4つの異なるタイプの種間相互作用(授粉、宿主-寄生虫、植物-アリ、種子散布)を表す148の実世界の二部ネットワークのデータベースを分析しました。各ネットワークについて、接続成分の数、ノードの媒介中心性の分散、ノードのページランクの分散、最大固有値、非ゼロの固有値の数、および4つの異なるアルゴリズムによって決定されるコミュニティ検出という6つの異なるトポロジー特性を測定しました。次に、欠落した可能性のあるデータを表す追加のエッジがネットワークに追加されると、これらの特性がどのように変化するかをテストしました。私たちは、さまざまな特性が欠落データに対してどの程度ロバストであるかに相当なばらつきがあることを発見しました。例えば、Clauset-Newman-MooreおよびLouvainのコミュニティ検出アルゴリズムは、エッジが追加されるにつれて、ラベル伝播およびGirvan-Newmanアルゴリズムに比べて変化がはるかに緩やかであることが示され、前者がよりロバストであることを示唆しています。また、相互作用のタイプに基づく一部のメトリックのロバスト性も異なりました。これらの結果は、散発的な生態ネットワークデータを分析する際に使用するネットワーク特性を選択するための基盤を提供します。
2025-02-24T02:14:17
AISafetyLab: A Comprehensive Framework for AI Safety Evaluation and Improvement
http://arxiv.org/abs/2502.16776v1
Zhexin Zhang, Leqi Lei, Junxiao Yang, Xijie Huang, Yida Lu, Shiyao Cui, Renmiao Chen, Qinglin Zhang, Xinyuan Wang, Hao Wang, Hao Li, Xianqi Lei, Chengwei Pan, Lei Sha, Hongning Wang, Minlie Huang
Tsinghua University, Beihang University
AIモデルが多様な現実のシナリオでますます展開される中、彼らの安全性を確保することは重要だが十分に探求されていない課題です。AIの安全性を評価し向上させるためにかなりの努力がなされてきましたが、標準化されたフレームワークと包括的なツールキットの欠如は、体系的な研究と実用的な採用に対して重要な障害となっています。このギャップを埋めるために、代表的な攻撃、防御、評価手法を統合した一元的なフレームワークおよびツールキットであるAISafetyLabを紹介します。AISafetyLabは、開発者がさまざまな技術をシームレスに適用できる直感的なインターフェースを備え、将来の発展のために適切に構造化され、拡張可能なコードベースを維持します。さらに、異なる攻撃および防御戦略を分析し、それらの比較効果に関する貴重な洞察を提供するために、Vicunaを対象に実証研究を行います。AIの安全性に関する継続的な研究と開発を促進するために、AISafetyLabはhttps://github.com/thu-coai/AISafetyLabで一般に利用可能であり、私たちはその継続的なメンテナンスと改善にコミットしています。
2025-02-24T02:11:52
LED-Merging: Mitigating Safety-Utility Conflicts in Model Merging with Location-Election-Disjoint
http://arxiv.org/abs/2502.16770v1
Qianli Ma, Dongrui Liu, Qian Chen, Linfeng Zhang, Jing Shao
Shanghai Jiao Tong University, Shanghai AI Laboratory, East China Normal University
事前に訓練された大規模言語モデル(LLM)を専門的なタスクのためにファインチューニングするには、膨大な計算リソースとデータコストがかかります。モデルの統合は、複数のタスク固有のモデルを統合するための訓練不要のソリューションを提供しますが、既存の手法は、安全性と有用性の対立に悩まされています。つまり、向上した一般的な能力が安全性の保障を損なうのです。私たちは、\textbf{ニューロンの誤認識}(単純なパラメータの大きさに基づく選択による)と、統合中の\textbf{タスク間ニューロンの干渉}という2つの根本原因を特定しました。これらの課題に対処するために、私たちは\textbf{LED-Merging}という三段階のフレームワークを提案します。このフレームワークは、勾配ベースの帰属を通じてタスク固有のニューロンを\textbf{L}ocateし、マルチモデルの重要度融合を通じて重要なニューロンを動的に\textbf{E}lectし、パラメータの隔離を通じて対立する更新を\textbf{D}isjointします。Llama-3-8B、Mistral-7B、Llama2-13Bによる広範な実験により、LED-Mergingは有害な応答率を低下させ(例:HarmBenchでのLlama-3-8B-Instructにおいて31.4%の減少)、95%の有用性性能を保持します(例:GSM8Kでの52.39%の精度)。LED-Mergingは安全性と有用性の対立を解決し、信頼性のあるマルチタスクLLMを構築するための軽量かつ訓練不要のパラダイムを提供します。
2025-02-24T01:19:43
Towards Reinforcement Learning for Exploration of Speculative Execution Vulnerabilities
http://arxiv.org/abs/2502.16756v1
Evan Lai, Wenjie Xiong, Edward Suh, Mohit Tiwari, Mulong Luo
UT Austin, Virginia Tech, Cornell
Spectreのような投機的攻撃は、オペレーティングシステムに発見されることなく秘密情報を漏洩する可能性があります。投機的実行の脆弱性は厄介で、深いものであり、それを悪用するには徹底的な手動作業とハードウェアに関する深い知識が必要です。本論文では、ポストシリコン(ブラックボックス)マイクロプロセッサ内の投機的実行漏洩を見つけるために強化学習を利用するフレームワークであるSpecRLを紹介します。
2025-02-24T00:17:57
2025-02-23 arXiv論文リスト(cs.AI)
About
arXivに掲載されたcs.AIの論文を検索し、一部をリスト化したものです。
※AIによってAbstractを日本語に翻訳しており、内容に誤りがある可能性があります。
リスト件数: 88件
リストから抽出されたキーワード: NL2SQL Enhancement, Adaptive Knowledge Transfer, Dynamic Decomposition
SQLong: Enhanced NL2SQL for Longer Contexts with LLMs
http://arxiv.org/abs/2502.16747v1
Dai Quoc Nguyen, Cong Duy Vu Hoang, Duy Vu, Gioacchino Tangari, Thanh Tien Vu, Don Dharmasiri, Yuan-Fang Li, Long Duong
Oracle Corporation, None
オープンウェイト大規模言語モデル(LLMs)は、自然言語からSQLへのタスク(NL2SQL)においてパフォーマンスが大幅に向上しました。しかし、大規模なデータベーススキーマを扱う際、コンテキストの長さが増加するため、その効果は減少します。この制限に対処するために、私たちはSQLongという新しい効率的なデータ拡張フレームワークを提案します。これは、NL2SQLタスクにおける長いコンテキストシナリオでのLLMのパフォーマンスを向上させるように設計されています。SQLongは、既存のデータベーススキーマを追加の合成CREATE TABLEコマンドとそれに対応するデータ行で拡張することで拡張データセットを生成します。これらのデータは、トレーニングデータ内の多様なスキーマからサンプリングされます。このアプローチは、ファインチューニングや評価の際の長いコンテキストシナリオを効果的にシミュレートします。SpiderおよびBIRDデータセットにおける実験を通じて、SQLongで拡張されたデータでファインチューニングされたLLMが、標準データセットで訓練されたLLMを著しく上回ることを示します。これにより、SQLongの実用的な実装と、複雑なデータベーススキーマを持つ実世界の設定におけるNL2SQL機能の向上に対する影響が示唆されます。
2025-02-23T23:23:51
Order-Optimal Projection-Free Algorithm for Adversarially Constrained Online Convex Optimization
http://arxiv.org/abs/2502.16744v1
Yiyang Lu, Mohammad Pedramfar, Vaneet Aggarwal
Purdue University, Mila
制約付きオンライン凸最適化(COCO)に対する投影ベースのアルゴリズムは、制約集合への反復値の投影の計算的複雑性のために高次元設定でスケーラビリティの課題に直面します。本論文では、投影なしでCOCOのためのアルゴリズムを紹介し、最先端の性能保証を達成しつつ投影の必要性を排除します。アダプティブオンライン勾配降下法(OGD)と分離オラクルを統合し、リャプノフ駆動の代理関数を用いて、勾配のノルムを使用して動的にステップサイズを調整することで、我々の方法は後悔と累積制約違反(CCV)を共同で最適化します。また、OGDのブロックバージョンを使用し、分離オラクルへの呼び出し回数とのバランスを達成します。凸コスト関数に対して、我々のアルゴリズムは後悔の最適値を$\mathcal{O}(\sqrt{T})$、CCVを$\mathcal{O}(\sqrt{T} \log T)$に達成し、最も知られている投影ベースの結果と一致しますが、分離オラクルへの呼び出しは$\tilde{\mathcal{O}}({T})$のみです。また、分離オラクルへの呼び出しが少ない場合、後悔とCCVが増加するというトレードオフも示しています。強凸設定では、さらに$\mathcal{O}(\log T)$の後悔と$\mathcal{O}(\sqrt{T\log T})$のCCVを達成し、${\mathcal{O}}({T}^2)$回の分離オラクルへの呼び出しを必要とします。さらに、オラクル呼び出し回数の減少とのトレードオフも検討されます。これらの結果は、投影なしの方法と投影ベースのアプローチのギャップを埋め、投影なしの方法が投影ベースの対抗物と同等の性能を達成できることを示しています。
2025-02-23T23:18:40
AUKT: Adaptive Uncertainty-Guided Knowledge Transfer with Conformal Prediction
http://arxiv.org/abs/2502.16736v2
Rui Liu, Peng Gao, Yu Shen, Ming Lin, Pratap Tokekar
教師モデルと生徒モデルの間の知識移転は、様々な機械学習アプリケーションで効果的であることが証明されています。しかし、教師の予測がノイズを含んでいる場合や、生徒のトレーニング中にデータのドメインが教師の事前トレーニングデータからシフトする場合には、課題が生じます。そのようなシナリオでは、教師の予測に盲目的に依存することで、最適ではない知識移転がもたらされる可能性があります。これらの課題に対処するために、我々は新しい汎用的なフレームワークである適応的不確実性指向知識移転($\textbf{AUKT}$)を提案します。このフレームワークは、コンフォーマル予測(CP)を活用し、教師の予測の不確実性に基づいて生徒の教師への依存度を動的に調整します。CPは、分布に依存しない、モデルに依存しないアプローチであり、統計的なカバレッジ保証と最小限の計算オーバーヘッドを持つ信頼できる予測セットを提供します。この適応メカニズムは、望ましくないまたは誤った知識を学習するリスクを軽減します。提案されたフレームワークを、画像分類、模倣指向強化学習、自律運転を含む多様なアプリケーションで検証しました。実験結果は一貫して、我々のアプローチが性能、堅牢性、移転性を向上させることを示しており、実世界のアプリケーションにおける知識移転の強化に向けた有望な方向性を提供します。
2025-02-23T22:39:19
DeepSeek reshaping healthcare in China's tertiary hospitals
http://arxiv.org/abs/2502.16732v1
Jishizhan Chen, Qingzeng Zhang
人工知能(AI)の急速な統合が医療を変革しており、臨床意思決定や病院運営に影響を与えています。DeepSeekは、2025年1月以来、中国の三次医療機関で広く導入されているリーディングAIシステムとして浮上しています。最初は上海の主要な医療機関で導入され、その後全国に拡大し、診断精度を向上させ、ワークフローを効率化し、患者管理を改善しています。AIを活用した病理、画像解析、臨床意思決定支援システムは、医療プロセスの最適化や医療専門家の認知的負担の軽減において重要な可能性を示しています。しかし、医療におけるAIの広範な導入は、AI支援診断における説明責任や自動化バイアスのリスクに関する重要な規制上の倫理的課題を提起しています。明確に定義された責任の枠組みが欠如しているため、AIが自律的な意思決定者ではなく支援ツールとして機能することを保証する政策の必要性が強調されています。技術の進歩が続く中で、AIはゲノムや画像解析などの多様なデータソースを統合し、精密医療や個別化治療戦略への道を開くと期待されています。医療におけるAIの未来は、透明性のある規制構造、産業協力、革新と責任のバランスを取る適応型ガバナンスの枠組みの発展にかかっています。それによって、公平で効果的なAI駆動の医療サービスが確保されることになります。
2025-02-23T22:09:17
RapidPen: Fully Automated IP-to-Shell Penetration Testing with LLM-based Agents
http://arxiv.org/abs/2502.16730v1
Sho Nakatani
私たちはRapidPenを紹介します。これは、初期の足場(IPからシェルへのアクセス)を人間の介入なしで達成するという課題に対処する、完全に自動化されたペネトレーションテスト(ペンテスティング)フレームワークです。以前のアプローチが主にポストエクスプロイテーションに焦点を当てたり、人間が関与することを必要としたのに対し、RapidPenは大規模言語モデル(LLM)を利用して、単一のIPアドレスから自律的に脆弱性を発見し、悪用します。成功したエクスプロイトの知識ベースを利用した高度なReActスタイルのタスク計画(Re)と、コマンド生成および直接実行のフィードバックループ(Act)を統合することで、RapidPenは体系的にサービスをスキャンし、有効な攻撃ベクターを特定し、ターゲットとしたエクスプロイトを完全に自動化された方法で実行します。Hack The Boxプラットフォームの脆弱なターゲットに対する評価では、RapidPenは200〜400秒以内にシェルアクセスを実現し、実行ごとのコストは約\$0.3〜\$0.6で、以前の「成功事例」データを再利用することで60%の成功率を示しました。これらの結果は、セキュリティ初心者と経験豊富な専門家の両方にとって、真の自律的ペンテスティングの可能性を強調しています。専任のセキュリティチームを持たない組織は、RapidPenを活用して重要な脆弱性を迅速に特定でき、専門のペンテスターは繰り返しのタスクを軽減し、複雑な課題に集中できます。最終的に、私たちの取り組みは、ペネトレーションテストをよりアクセスしやすく、コスト効率を高めることを目的としており、現代のソフトウェアエコシステム全体のセキュリティ態勢を強化します。
2025-02-23T21:57:46
DOSE3 : Diffusion-based Out-of-distribution detection on SE(3) trajectories
http://arxiv.org/abs/2502.16725v1
Hongzhe Cheng, Tianyou Zheng, Tianyi Zhang, Matthew Johnson-Roberson, Weiming Zhi
Carnegie Mellon University, Robotics Institute
外部分布(OOD)検出は、異常サンプルを特定することを目的とした基本的な機械学習タスクであり、従来は異なるインライア分布に対してモデルの再トレーニングが必要でした。最近の研究では、拡散モデルがOOD検出に適用できることが示されていますが、既存のアプローチはユークリッド空間または潜在画像空間に限定されています。我々の研究は、3Dの特別ユークリッド群($\mathbb{SE}(3)$)における軌道にOOD検出を拡張し、$\mathbb{SE}(3)$で物体のポーズシーケンスを処理するコンピュータビジョン、ロボティクス、エンジニアリングアプリケーションにおける重要なニーズに対応します。我々は、$\mathbb{SE}(3)$のポーズシーケンスの統一されたサンプル空間に拡散を拡張した新しいOODフレームワークである$\textbf{D}$iffusion-based $\textbf{O}$ut-of-distribution detection on $\mathbb{SE}(3)$($\mathbf{DOSE3}$)を提案します。複数のベンチマークデータセットに対する広範な検証を通じて、最先端のOOD検出フレームワークと比較して、$\mathbf{DOSE3}$の優れた性能を示します。
2025-02-23T21:32:48
Layer-Wise Evolution of Representations in Fine-Tuned Transformers: Insights from Sparse AutoEncoders
http://arxiv.org/abs/2502.16722v1
Suneel Nadipalli
事前学習済みトランスフォーマーのファインチューニングは、特定のタスクにおけるベースモデルのパフォーマンスを向上させるための強力な手法です。BERTのようなモデルにおける初期の応用から、大規模言語モデル(LLM)のファインチューニングに至るまで、このアプローチは汎用アーキテクチャを特定のダウンストリームタスクに適応させる上で重要な役割を果たしてきました。ファインチューニングプロセスを理解することは、トランスフォーマーが特定の目標にどのように適応し、一般的な表現を保持し、タスク特有の特徴を獲得するかを明らかにするために重要です。本論文では、BERTトランスフォーマーにおけるファインチューニングの基盤となるメカニズムを探求し、アクティベーションの類似性を分析し、スパースオートエンコーダー(SAE)をトレーニングし、異なる層でのトークンレベルのアクティベーションを可視化します。複数のデータセットとBERT層を通じて実施した実験に基づき、特徴が与えられたタスクにどのように適応していくかの着実な進行を観察しました。初期の層は主に一般的な表現を保持し、中間の層は一般的な特徴とタスク特有の特徴の間の遷移として機能し、後の層はタスク適応に完全に特化します。これらの発見は、ファインチューニングの内部動作とトランスフォーマーアーキテクチャ内での表現学習に与える影響に関する重要な洞察を提供します。
2025-02-23T21:29:50
Speed and Conversational Large Language Models: Not All Is About Tokens per Second
http://arxiv.org/abs/2502.16721v1
Javier Conde, Miguel González, Pedro Reviriego, Zhen Gao, Shanshan Liu, Fabrizio Lombardi
オープンウェイトの大規模言語モデル(LLMs)の速度と、その速度が実行するタスクに依存する様子をGPU上で検討し、最も人気のあるオープンLLMsの速度の比較分析を示します。
2025-02-23T21:28:55
NatSGLD: A Dataset with Speech, Gesture, Logic, and Demonstration for Robot Learning in Natural Human-Robot Interaction
http://arxiv.org/abs/2502.16718v1
Snehesh Shrestha, Yantian Zha, Saketh Banagiri, Ge Gao, Yiannis Aloimonos, Cornelia Fermüller
最近のマルチモーダルなヒューマン-ロボットインタラクション (HRI) データセットの進展は、音声とジェスチャーの統合を強調し、ロボットが明示的な知識と暗黙的な理解を吸収できるようにしています。しかし、既存のデータセットは主に物体の指さしや押しなどの基本的なタスクに焦点を当てており、複雑な領域への適用性が制限されています。彼らはより単純な人間のコマンドデータを優先していますが、ロボットがタスクを正しく解釈し、適切に応答するようにトレーニングすることにはあまり重点を置いていません。これらのギャップを埋めるために、私たちはNatSGLDデータセットを提案します。このデータセットは、参加者が自律的であると信じているロボットと対話するウィザード・オブ・オズ (WoZ) メソッドを使用して収集されました。NatSGLDは、人間のマルチモーダルコマンド(音声とジェスチャー)を記録し、それぞれがデモンストレーショントラジェクトリと、コマンドされたタスクの真実の解釈を提供する線形時相論理 (LTL) 言語式とペアになっています。このデータセットは、HRIと機械学習の交差点での研究のための基盤となるリソースとして機能します。マルチモーダル入力と詳細な注釈を提供することにより、NatSGLDはマルチモーダルな指示の実行、計画認識、デモからの人間可能な強化学習などの分野での探求を可能にします。私たちは、将来のHRI研究を支援するために、データセットとコードをMITライセンスのもとで公開しています。詳しくは https://www.snehesh.com/natsgld/ をご覧ください。
2025-02-23T21:27:06
Understanding the Impact of Artificial Intelligence in Academic Writing: Metadata to the Rescue
http://arxiv.org/abs/2502.16713v1
Javier Conde, Pedro Reviriego, Joaquín Salvachúa, Gonzalo Martínez, José Alberto Hernández, Fabrizio Lombardi
Universidad Politécnica de Madrid, Universidad Carlos III de Madrid, Northeastern University
このコラムでは、AIを利用して執筆された学術論文に特化したメタデータを含めることを提唱しています。これは、研究の普及におけるそのようなツールの使用を分析する試みの一環です。
2025-02-23T21:10:44
Liver Cirrhosis Stage Estimation from MRI with Deep Learning
http://arxiv.org/abs/2502.18225v1
Jun Zeng, Debesh Jha, Ertugrul Aktas, Elif Keles, Alpay Medetalibeyoglu, Matthew Antalek, Amir A. Borhani, Daniela P. Ladner, Gorkem Durak, Ulas Bagci
私たちは、マルチシーケンスMRIから自動化された肝硬変のステージ推定のためのエンドツーエンドの深層学習フレームワークを提案します。肝硬変は、肝臓の重度の瘢痕(線維症)であり、さまざまな慢性肝疾患の一般的な終末期です。早期診断は、脱補償や癌などの合併症を防ぐために重要であり、これにより余命が大幅に減少します。しかし、肝硬変の初期段階での診断は困難であり、患者はしばしば生命を脅かす合併症を呈します。私たちのアプローチは、マルチスケールの特徴学習をシーケンス特異的な注意メカニズムと統合し、肝硬変の進行段階における微妙な組織変化を捉えます。CirrMRI600+という、339人の患者からの628件の高解像度MRIスキャンの大規模な公開データセットを使用し、3段階の肝硬変分類において最先端の性能を示します。私たちの最良のモデルは、T1Wシーケンスで72.8%、T2Wシーケンスで63.8%の精度を達成し、従来の放射線バイオメトリクスに基づくアプローチを大幅に上回ります。広範なアブレーションスタディを通じて、私たちのアーキテクチャがステージ特異的なイメージングバイオマーカーを効果的に学習することを示しています。自動化された肝硬変のステージングに関する新しいベンチマークを確立し、臨床に適用可能な深層学習システムの開発に向けた洞察を提供します。ソースコードはhttps://github.com/JunZengz/CirrhosisStageで利用可能になります。
2025-02-23T20:50:08
Exploring Incremental Unlearning: Techniques, Challenges, and Future Directions
http://arxiv.org/abs/2502.16708v1
Sadia Qureshi, Thanveer Shaik, Xiaohui Tao, Haoran Xie, Lin Li, Jianming Yong, Xiaohua Jia
University of Southern Queensland, Lingnan University, Wuhan University of Technology, City University of Hong Kong
機械学習(ML)アプリケーションにおけるデータプライバシーの需要が高まる中、機械的忘却(MU)が重要な研究分野として浮上しています。「忘れられる権利」が世界的に規制されるにつれて、これらのシステムのパフォーマンスとスケーラビリティを維持しながらユーザーデータをAIシステムから削除するメカニズムを開発することがますます重要になっています。段階的忘却(IU)は、フル再訓練を必要とせずに特定のデータをMLモデルから効率的に削除する課題に対処するための有望なMUソリューションです。本論文では、IUに関するさまざまな技術とアプローチを紹介します。IUメカニズムの設計と実装における課題についても探ります。また、忘却技術のパフォーマンスを評価するためのデータセットと指標についても議論します。最後に、IUの課題に対する潜在的な解決策と将来の研究方向性を提案します。この調査は、IUの現在の状況とプライバシーを保護するインテリジェントシステムの強化の可能性を理解しようとする研究者や実務者にとって貴重な洞察を提供します。
2025-02-23T20:47:27
Reflective Planning: Vision-Language Models for Multi-Stage Long-Horizon Robotic Manipulation
http://arxiv.org/abs/2502.16707v1
Yunhai Feng, Jiaming Han, Zhuoran Yang, Xiangyu Yue, Sergey Levine, Jianlan Luo
複雑な長期のロボット操作問題を解決するには、高度な高レベルの計画能力、物理世界について推論する能力、そして適切な運動スキルを反応的に選択する能力が必要です。インターネットデータで事前学習された視覚-言語モデル(VLM)は、原則としてこのような問題に取り組むためのフレームワークを提供できる可能性があります。しかし、現状のVLMは、ロボット操作に必要な複雑な物理に関する微妙な理解と、エラー蓄積の問題に対処するための長期的な推論能力を欠いています。本論文では、マルチステージ操作タスクにおけるVLMの物理的推論能力を強化する新しいテスト時間計算フレームワークを紹介します。私たちのアプローチの核心は、事前学習されたVLMを「反映」メカニズムで反復的に改善することです。このメカニズムは、生成モデルを使用して将来の世界状態を想像し、これらの予測を利用して行動選択を導き、潜在的な非最適性を批判的に反映して推論を洗練します。実験結果は、私たちの方法がいくつかの最先端の商業VLMや、モンテカルロ木探索(MCTS)などの他のポストトレーニングアプローチを大幅に上回ることを示しています。ビデオは https://reflect-vlm.github.io で利用可能です。
2025-02-23T20:42:15
A Reverse Mamba Attention Network for Pathological Liver Segmentation
http://arxiv.org/abs/2502.18232v1
Jun Zeng, Ulas Bagci, Debesh Jha
私たちは、逆マンバ注意モジュール(RMA)を通じて視覚状態空間モデルの能力を向上させる新しいアーキテクチャRMA-Mambaを提案します。この主な革新は、RMA-Mambaが階層的な処理パイプラインを介して、正確な局所特徴表現を維持しながら長距離依存を捉える能力にあります。Vision Mamba(VMamba)の効率的な系列モデリングとRMAのターゲット特徴精練を統合することで、私たちのアーキテクチャは複数のスケールで優れた特徴学習を実現します。この二重メカニズムアプローチにより、計算効率を維持しながら、複雑な形態パターンを力強く処理することが可能になります。RMA-Mambaの効果を、組織の変動により従来のセグメンテーションアプローチがしばしば失敗する病理学的肝臓セグメンテーションという挑戦的なドメインで示します。T2強調MRIスキャンからなる新たに導入された肝硬変肝臓データセット(CirrMRI600+)で評価された際、RMA-MambaはDice係数92.08%、平均IoU87.36%、再現率92.96%の最先端性能を達成します。このアーキテクチャの一般化可能性は、CTスキャンからの癌性肝臓セグメンテーション(LiTS:肝腫瘍セグメンテーションデータセット)でも検証され、Diceスコア92.9%、mIoU88.99%を得ました。提案されたRMA-Mambaのソースコードは、https://github.com/JunZengz/RMAMamba で入手可能です。
2025-02-23T20:41:25
DISC: Dynamic Decomposition Improves LLM Inference Scaling
http://arxiv.org/abs/2502.16706v1
Jonathan Light, Wei Cheng, Wu Yue, Masafumi Oyamada, Mengdi Wang, Santiago Paternain, Haifeng Chen
多くの推論スケーリング手法は、問題を小さなステップ(またはトークンのグループ)に分割し、次の最良のステップをサンプリングして選択することで機能します。しかし、これらのステップとそのサイズは通常、人間の直感やドメイン知識に基づいて事前に決定されています。本論文では、推論中に解決策と推論トレースをステップに自動的かつ適応的に分割する手法であるダイナミックデコーポジションを紹介します。このアプローチは、難しいステップにより多くのリソースを集中させ、それらをさらに分解し、サンプリングを優先することで計算効率を改善します。コーディングと数学のベンチマーク(APPS、MATH、LiveCodeBench)に関する実験は、ダイナミックデコーポジションがトークンレベル、文レベル、または単一ステップの分解といった固定のステップに依存する静的手法よりも優れたパフォーマンスを示すことを示しています。これらの結果は、ダイナミックデコーポジションが多くの推論スケーリング技術を強化できる可能性があることを示唆しています。
2025-02-23T20:37:32
Can ChatGPT Learn to Count Letters?
http://arxiv.org/abs/2502.16705v1
Javier Conde, Gonzalo Martínez, Pedro Reviriego, Zhen Gao, Shanshan Liu, Fabrizio Lombardi
大規模言語モデル(LLM)は、単語内の文字の出現回数を数えるといった単純なタスクに苦労します。本論文では、ChatGPTが文字を数えることを学習できるかを調査し、効率的な解決策を提案します。
2025-02-23T20:31:22
Code Summarization Beyond Function Level
http://arxiv.org/abs/2502.16704v1
Vladimir Makharev, Vladimir Ivanov
Innopolis University, AIRI, Research Center of the Artificial Intelligence Institute
コード要約は、自然言語処理およびソフトウェアエンジニアリングにおいて重要なタスクであり、ソースコードの簡潔な説明を生成することを目的としています。最近の進展により、これらの要約の品質が向上し、コードの可読性と保守性が向上しました。しかし、関数コード要約においては、リポジトリやクラスの内容が考慮されていませんでした。本研究では、関数レベルを超えたコード要約モデルの効果を調査し、要約の質に対するクラスとリポジトリのコンテキストの影響を探りました。本研究では、クラスおよびリポジトリレベルでモデルを評価するためのベンチマークを見直し、ベースラインモデルを評価し、追加のコンテキストを用いて要約の質の向上を判断するためにコンテキスト学習を持つLLMを評価しました。結果は、ファインチューニングされた最先端のCodeT5+ベースモデルがコード要約に優れていることを明らかにし、ファイブショット学習とRAGから取得したコードチャンクを組み込むことで、このタスクにおけるLLMのパフォーマンスが大幅に向上しました。特に、Deepseek Coder 1.3BおよびStarcoder2 15Bモデルは、クラスおよびリポジトリレベルの両方でBLEURT、METEOR、BLEU-4などの指標において大幅な改善を示しました。リポジトリレベルの要約は期待できる可能性を示しましたが、かなりの計算リソースを必要とし、構造化されたコンテキストの追加からも利益を得ることが求められます。最後に、我々は最近のSIDEコード要約指標を評価に使用しました。本研究は、プロンプトエンジニアリング、ファイブショット学習、RAGの戦略の洗練に寄与し、さまざまなレベルでのコード要約のベンチマークにおけるギャップに対処します。最後に、すべての研究の詳細、コード、データセット、評価結果をhttps://github.com/kilimanj4r0/code-summarization-beyond-function-levelで入手可能なGitHubリポジトリに公開します。
2025-02-23T20:31:21
End-to-End Deep Learning for Structural Brain Imaging: A Unified Framework
http://arxiv.org/abs/2502.18523v1
Yao Su, Keqi Han, Mingjie Zeng, Lichao Sun, Liang Zhan, Carl Yang, Lifang He, Xiangnan Kong
脳画像分析は神経科学において基礎的な役割を果たしており、脳の構造と機能に関する貴重な洞察を提供します。従来のワークフローは、脳抽出、登録、セグメンテーション、パーセレーション、ネットワーク生成、分類といった順次パイプラインに従い、各ステップを独立したタスクとして扱います。これらの方法は、タスク固有のトレーニングデータと中間エラーを修正するための専門家の介入に大きく依存しており、高次元の神経画像データにおいては注釈や品質管理が高コストで時間がかかるため特に負担が大きくなります。そこで、私たちは、すべての処理ステップを単一の最適化プロセスに統合し、タスク同士が相互に作用し合い、洗練し合うことを可能にする統合的なエンドツーエンドのフレームワーク「UniBrain」を紹介します。従来のアプローチが広範なタスク固有の注釈を必要とするのとは異なり、UniBrainは最小限の監視で動作し、低コストのラベル(すなわち分類と抽出)と単一のラベル付きアトラスのみを活用します。抽出、登録、セグメンテーション、パーセレーション、ネットワーク生成、及び分類を共同で最適化することにより、UniBrainは精度と計算効率を向上させながら、注釈の手間を大幅に削減します。実験結果は、複数のタスクにおいて既存の方法に対してその優位性を示しており、神経画像分析に対するよりスケーラブルで信頼できるソリューションを提供します。私たちのコードとデータは、https://github.com/Anonymous7852/UniBrain にてご覧いただけます。
2025-02-23T20:08:24
Beyond Release: Access Considerations for Generative AI Systems
http://arxiv.org/abs/2502.16701v1
Irene Solaiman, Rishi Bommasani, Dan Hendrycks, Ariel Herbert-Voss, Yacine Jernite, Aviya Skowron, Andrew Trask
Hugging Face, Stanford University, Center for AI Safety, Run, EleutherAI, OpenMined
生成AIのリリース決定は、システムコンポーネントが利用可能にされるかどうかを決定しますが、リリースはユーザーや利害関係者がシステムにどのように関与できるかを変える他の多くの要素には対処していません。リリースを超えて、システムコンポーネントへのアクセスは潜在的なリスクや利益に関する情報を提供します。アクセスは、利用可能なコンポーネントを何らかの形で使用するために、実際のニーズ、インフラ、技術、社会的な要素を指します。私たちはアクセスを、リソース、技術的な使いやすさ、ユーティリティの3つの軸に沿って分析します。各カテゴリー内では、システムコンポーネントごとの一連の変数がトレードオフを明確にします。たとえば、リソースはモデルの重みを提供するための計算インフラへのアクセスを必要とします。また、私たちは、4つの高性能な言語モデルのアクセス可能性を比較します。2つはオープン・ウェイト、2つはクローズド・ウェイトで、すべてのモデルについてアクセス変数に基づいて類似した考慮事項があることを示します。アクセス変数は、ユーザーへのスケールまたはアクセスを拡大するための基盤を設定します。私たちはアクセスのスケールとそれがリスクの管理や介入能力に与える影響を考察します。このフレームワークは、システムリリースのランドスケープやリスクと利益のトレードオフをより包括的に捉え、システムリリースの決定、研究、政策に役立てるものです。
2025-02-23T20:06:12
Dynamic LLM Routing and Selection based on User Preferences: Balancing Performance, Cost, and Ethics
http://arxiv.org/abs/2502.16696v1
Deepak Babu Piskala, Vijay Raajaa, Sachin Mishra, Bruno Bozza
大規模言語モデル(LLM)であるGPT-4、BART、およびLLaMAの広範な展開に伴い、コスト、レイテンシ、精度、倫理的考慮をバランスよく考慮しつつ、特定のタスクに最も適したモデルをインテリジェントに選択できるシステムの必要性がますます重要になっています。すべてのタスクが100億パラメータを超えるモデルを必要とするわけではないことを認識し、私たちはOptiRouteを導入します。OptiRouteは、詳細なユーザー定義の要件に基づいてタスクを最適なLLMに動的に選択しルーティングするために設計された高度なモデルルーティングエンジンです。OptiRouteは、機能的(精度、速度、コストなど)および非機能的(役立ち度、無害性、誠実さなど)な基準の両方を捉え、軽量のタスク分析と複雑さの推定を活用して、多様なLLMの中から最適なモデルとタスクを効率的にマッチングします。k最近傍法(kNN)サーチと階層的フィルタリングを組み合わせたハイブリッドアプローチを採用することで、OptiRouteはユーザーの優先事項を最適化しながら計算オーバーヘッドを最小限に抑えます。これにより、クラウドベースのMLプラットフォーム、パーソナライズされたAIサービス、規制された業界におけるリアルタイムアプリケーションに最適となります。
2025-02-23T19:23:22
Multimodal Bearing Fault Classification Under Variable Conditions: A 1D CNN with Transfer Learning
http://arxiv.org/abs/2502.17524v1
Tasfiq E. Alam, Md Manjurul Ahsan, Shivakumar Raman
University of Oklahoma
ベアリングは回転機械の信頼性と効率性を確保する上で不可欠な役割を果たしており、摩擦を減少させ、重要な負荷を扱います。ベアリングの故障は機械的故障の90%を占めることがあり、信頼できる状態監視と故障検出の必要性を強調しています。本研究では、1次元畳み込みニューラルネットワーク(1D CNN)フレームワーク内で振動信号とモーターフェーズ電流信号に基づくマルチモーダルなベアリング故障分類手法を提案します。この手法は複数の信号からの特徴を統合して故障検出の精度を向上させます。ベースライン条件(1,500 rpm、0.7 Nmの負荷トルク、1,000 Nの放射力)下で、モデルはL2正則化の追加により96%の精度を達成します。これは非正則化モデルと比較して2%の顕著な改善を示します。また、モデルは3つの異なる運転条件において転移学習(TL)戦略を採用することで堅牢な性能を示します。テストされたTLのバリアントの中で、最初の最大プーリング層までパラメータを保持し、次の層を調整するアプローチが最も高い性能を達成します。このアプローチはさまざまな条件で優れた精度を達成しますが、より多くの訓練可能なパラメータがあるため、計算時間が長くなります。リソースの制約に対処するために、計算負荷の少ないモデルはわずかな精度のコストで実現可能なトレードオフを提供します。全体として、このマルチモーダル1D CNNフレームワークと遅延融合およびTL戦略は、変動する運転条件を持つ産業環境におけるより正確で適応可能、かつ効率的なベアリング故障分類の基盤を築くものです。
2025-02-23T19:11:25
From Text to Space: Mapping Abstract Spatial Models in LLMs during a Grid-World Navigation Task
http://arxiv.org/abs/2502.16690v1
Nicolas Martorell
大規模言語モデル(LLM)が空間情報をどのように表現し、推論するかを理解することは、実世界やシミュレーション環境をナビゲートできる堅牢なエージェントシステムを構築する上で重要です。本研究では、グリッドワールドナビゲーションタスクにおけるLLMの性能と内部活性に対する異なるテキストベースの空間表現の影響を調査します。目標へのナビゲーションを必要とするタスクにおいて、さまざまなサイズのモデルを評価し、空間情報をエンコードするために使用されるフォーマットが意思決定にどのように影響するかを検討します。我々の実験では、空間のデカルト座標表現が一貫して高い成功率と経路効率をもたらすことが明らかになりました。モデルサイズに応じて性能が顕著にスケールすることもわかりました。さらに、LLaMA-3.1-8Bを調査したところ、主に中間層に位置する内部ユニットのサブセットが、エージェントのグリッド内での位置や行動の正確性といった空間的特徴と強く相関していることが分かりました。これは、情報がどのように表現される場合でも同様であり、無関係な空間推論タスクによっても活性化されます。この研究は、LLMが空間情報を処理する方法に対する理解を深め、より解釈可能で堅牢なエージェントAIシステムの開発に対する貴重な洞察を提供します。
2025-02-23T19:09:01
Automatic Input Rewriting Improves Translation with Large Language Models
http://arxiv.org/abs/2502.16682v1
Dayeon Ki, Marine Carpuat
University of Maryland
私たちは、LLMを用いて入力を自動的に書き直すことで機械翻訳(MT)を改善できるのでしょうか。ユーザーは、よく書かれたテキストは市販のMTシステムを使用する際に翻訳しやすいという直感に依存することが一般的です。LLMは、テキストをさまざまな方法で書き直すことができますが、MTの文脈では、これらの能力は主にポストエディティングを通じて出力を書き直すために活用されてきました。本研究では、英語から6つの対象言語への翻訳のために、3つのオープンウェイトのLLMを使用した21の入力書き直し方法の実証的研究を発表します。私たちは、テキストの単純化が最も効果的なMT非依存の書き直し戦略であり、翻訳可能性を評価するために品質推定を使用することでさらに改善できることを示します。人間による評価も、単純化された書き直しとそのMT出力が元の意味をほぼ大きく保持していることを確認しています。これらの結果は、LLMを活用した入力の書き直しが翻訳改善のための有望な方向性であることを示唆しています。
2025-02-23T18:56:56
Are Sparse Autoencoders Useful? A Case Study in Sparse Probing
http://arxiv.org/abs/2502.16681v1
Subhash Kantamneni, Joshua Engels, Senthooran Rajamanoharan, Max Tegmark, Neel Nanda
スパースオートエンコーダー(SAE)は、大規模言語モデル(LLM)の活性化における概念の解釈に人気のある手法です。しかし、LLMが使用する概念のグラウンドトゥルースが存在しないため、解釈の妥当性に関する証拠が不足しており、現在のSAEに関する問題を提起する研究が増えています。一つの代替的な証拠の源は、SAEが既存のベースラインを超えて下流タスクの性能を向上させることを示すことです。私たちは、データの希少性、クラス不均衡、ラベルノイズ、共変量シフトの4つの状況において、LLMの活性化プロービングという実世界のタスクにSAEを適用することでこれをテストします。これらの困難な状況で概念を検出するのが難しいため、SAEの解釈可能な概念レベルのラテントの基盤が有用な帰納的バイアスを提供するはずであると仮定します。しかし、SAEは個々のデータセットで時折ベースラインより優れた性能を示しますが、ベースラインのみを使用したアンサンブル手法を一貫して上回るSAEとベースラインを組み合わせたアンサンブル手法を設計することはできませんでした。さらに、SAEは当初、虚偽の相関関係を特定したり、不良データセットの品質を検出したり、マルチトークンプローブをトレーニングしたりするのに有望に見えますが、単純な非SAEベースラインでも同様の結果を達成できることがわかりました。他のタスクにおけるSAEの有用性を否定することはできませんが、私たちの発見は現在のSAEの欠点と、強力なベースラインを用いた下流タスクに対する解釈手法の厳密な評価の必要性を浮き彫りにしています。
2025-02-23T18:54:15
MimeQA: Towards Socially-Intelligent Nonverbal Foundation Models
http://arxiv.org/abs/2502.16671v1
Hengzhi Li, Megan Tjandrasuwita, Yi R. Fung, Armando Solar-Lezama, Paul Pu Liang
社会的に知的なAIは、人々の日常生活において、ますます重要になっています。AIが日常活動に密接に統合されるにつれて、人間とシームレスに理解し対話できることが求められています。しかし、現在の人工的な社会的推論に関する研究はすべて、言語のみ、または言語が主導するアプローチに依存しており、その結果、言葉によるコミュニケーションは改善されつつあるものの、非言語的な社会的理解には苦労しています。この制限に対処するために、私たちは非言語的かつ社会的な相互作用が豊富な新しいデータソース、すなわちミームビデオに注目しました。ミームとは、言葉を使わずにジェスチャーや動きで表現するアートであり、非言語的な社会的コミュニケーションを解釈する上で独自の課題と機会を提供します。私たちは、YouTubeから221本のビデオを厳密な注釈と検証を通じて集めた新しいデータセット「MimeQA」を貢献します。これにより、101本のビデオと806の質問-回答ペアを含むベンチマークが得られました。MimeQAを使用して、最先端のビデオ大規模言語モデル(vLLMs)を評価したところ、その全体的な正確性は15~30%の範囲であることがわかりました。私たちの分析によれば、vLLMsはしばしば想像上の物体を地に足をつけて考えることに失敗し、微妙な非言語的相互作用を無視しながらテキストのプロンプトに過度に依存しています。私たちのデータリソースは、非言語的な人間の相互作用を解釈する真の社会的知性を具現化する基盤モデルにおける今後の研究のインスピレーションを提供するために、https://github.com/MIT-MI/MimeQA で公開されています。
2025-02-23T18:05:49
SBSC: Step-By-Step Coding for Improving Mathematical Olympiad Performance
http://arxiv.org/abs/2502.16666v1
Kunal Singh, Ankan Biswas, Sayandeep Bhowmick, Pradeep Moturi, Siva Kishore Gollapalli
我々はステップバイステップコーディング(SBSC)を提案します。これは、多段階の数学的推論フレームワークであり、大規模言語モデル(LLM)がオリンピックレベルの数学問題を解決するためのプログラムのシーケンスを生成できるようにします。各ステップ/ターンで、以前のステップのコード実行出力とプログラムを活用することで、モデルは次のサブタスクとそれを解決するための対応するプログラムを生成します。このようにして、SBSCは連続的に最終的な回答に到達することができます。SBSCは、既存の方法と比較して、問題解決に対してより細分化され、柔軟で正確なアプローチを提供します。広範な実験は、競技およびオリンピックレベルの数学問題に取り組む際のSBSCの効果を強調します。Claude-3.5-Sonnetにおいて、SBSC(グリーディデコーディング)がAMC12で既存の最先端(SOTA)プログラム生成に基づく推論戦略を絶対10.7%、AIMEで8%、MathOdysseyで12.6%上回ることを観察しました。SBSCは多段階の特性を持っているため、既存のSOTA数学推論戦略の自己一貫性デコーディング結果に対するSBSCのグリーディデコーディングをベンチマークし、AMCで絶対6.2%、AIMEで6.7%、MathOdysseyで7.4%の性能向上を観察しました。
2025-02-23T17:51:26
Saarthi: The First AI Formal Verification Engineer
http://arxiv.org/abs/2502.16662v1
Aman Kumar, Deepak Narayan Gadde, Keerthan Kopparam Radhakrishna, Djones Lettnin
Infineon Technologies Semiconductor India Private Limited, Infineon Technologies Dresden GmbH & Co. KG, Infineon Technologies AG
最近、デビンは世界初の完全自律型AIソフトウェアエンジニアとして、人工知能(AI)コミュニティで大きな注目を集めています。彼は、自立してソフトウェアコードを開発する能力を持っています。デビンは生成AI(GenAI)におけるエージェンティックワークフローの概念を利用しており、AIエージェントがよりダイナミックで反復的、かつ自己反省的なプロセスに従事できるようにします。本稿では、エージェンティックワークフローを使用して与えられたRTL設計をエンドツーエンドで検証できる、同様の完全自律型AI形式検証エンジニア「サールティ」を紹介します。サールティを使うことで、検証エンジニアはより複雑な問題に集中でき、検証チームはより野心的な目標に挑戦できるようになります。サールティのドメイン非依存な実装により、RTL設計やUVMベースの検証など、さまざまな分野での利用が可能です。
2025-02-23T17:42:50
BioMaze: Benchmarking and Enhancing Large Language Models for Biological Pathway Reasoning
http://arxiv.org/abs/2502.16660v1
Haiteng Zhao, Chang Ma, FangZhi Xu, Lingpeng Kong, Zhi-Hong Deng
大規模言語モデル(LLMs)のさまざまな生物学的領域での応用は最近探求されてきましたが、経路のような複雑な生物学的システムにおける推論能力はまだ十分に探索されていません。これは、生物現象の予測、仮説の構築、実験のデザインにとって非常に重要です。本研究では、経路推論におけるLLMsの可能性を探ります。私たちは、実際の研究に基づいた5.1Kの複雑な経路問題からなるデータセット「BioMaze」を導入します。このデータセットは、自然な動的変化、攪乱、追加の介入条件、および多スケールの研究対象を含むさまざまな生物学的文脈をカバーしています。CoTやグラフ拡張推論などの手法の評価では、LLMsが特に攪乱されたシステムにおける経路推論に苦労していることが示されています。これに対処するために、私たちはPathSeekerを提案します。これは、相互作用型サブグラフに基づくナビゲーションを通じて推論を強化するLLMエージェントであり、生物システムの複雑さを科学的に整合した方法で扱うより効果的なアプローチを可能にします。データセットとコードはhttps://github.com/zhao-ht/BioMazeで入手できます。
2025-02-23T17:38:10
Few-shot Continual Relation Extraction via Open Information Extraction
http://arxiv.org/abs/2502.16648v1
Thiem Nguyen, Anh Nguyen, Quyen Tran, Tu Vu, Diep Nguyen, Linh Ngo, Thien Nguyen
Hanoi University of Science and Technology, Oraichain Labs Inc., VinAI Research, Bytedance, VNU University of Engineering and Technology, University of Oregon
通常、Few-shot Continual Relation Extraction (FCRE)モデルは、非常に限られたデータで新しいタスクに適応しながら、以前の知識を保持する必要があります。しかし、現実のシナリオでは、既存の方法がまだ対処に苦しむ見えないまたは未確定の関係が関与することもあります。これらの課題に対処するために、私たちは知識グラフ構築 (KGC) のオープン情報抽出の概念を活用する新しいアプローチを提案します。私たちの方法は、トレーニングセットに存在しない確定ラベルと未確定ラベルを含むすべての関係のペアにモデルをさらし、多様な関係の説明でモデルの知識を豊かにし、知識の保持と適応力を向上させます。この設定におけるKGCの観点から、これは継続的学習の設定で探求された初めての研究であり、データが進化するにつれてグラフの効率的な拡張を可能にします。実験結果は、他の最先端のFCREベースラインと比較して、私たちの優れたパフォーマンスおよびこの設定における動的グラフ構築の処理における効率性を示しています。
2025-02-23T16:52:59
CODESYNC: Synchronizing Large Language Models with Dynamic Code Evolution at Scale
http://arxiv.org/abs/2502.16645v1
Chenlong Wang, Zhaoyang Chu, Zhengxiang Cheng, Xuyi Yang, Kaiyue Qiu, Yao Wan, Zhou Zhao, Xuanhua Shi, Dongping Chen
大規模言語モデル(LLM)はソフトウェア工学において優れたパフォーマンスを示していますが、特に第三者ライブラリのAPIの頻繁な更新に関して、常に進化するコード知識に適応することに課題を抱えています。この制限は静的な事前トレーニングデータセットから生じており、しばしば非実行可能なコードや、安全性と効率性が最適でない実装をもたらします。この目的のために、本論文ではCODESYNCを紹介します。CODESYNCは、古くなったコードパターンを特定し、Pythonの第三者ライブラリからリアルタイムのコード知識更新を収集するためのデータエンジンです。CODESYNCを基に、コードの進化に同期するLLMの能力を評価するための包括的なベンチマークであるCODESYNCBENCHを開発しました。これは、6つのPythonライブラリから220のAPIの実世界の更新を網羅しています。私たちのベンチマークは、3つの評価タスクにわたって3,300のテストケースを提供し、2,200のトレーニングサンプルから成る更新意識のある指示調整データセットを含んでいます。最先端の14のLLMに対する広範な実験は、これらが動的なコードの進化に苦しんでいることを示しており、先進的な知識更新手法(例:DPO、ORPO、SimPO)のサポートがあってもそうです。私たちは、私たちのベンチマークが将来的にリアルタイムのコード知識更新のためのより効果的な手法の開発に強固な基盤を提供できると信じています。実験用のコードとデータセットは、以下のリンクで公開されています:https://github.com/Lucky-voyage/Code-Sync。
2025-02-23T16:46:18
Automatic Joint Structured Pruning and Quantization for Efficient Neural Network Training and Compression
http://arxiv.org/abs/2502.16638v1
Xiaoyi Qu, David Aponte, Colby Banbury, Daniel P. Robinson, Tianyu Ding, Kazuhito Koishida, Ilya Zharkov, Tianyi Chen
Microsoft, Lehigh University
構造的プルーニングと量子化は、深層ニューラルネットワーク(DNN)のサイズを削減するための基本的な技術であり、通常は独立して適用されます。これらの技術を共同最適化を通じて同時に適用することで、より小さく高品質なモデルを生成する可能性があります。しかし、既存の共同手法は、(1) エンジニアリングの難しさ(複雑なマルチステージプロセス)、(2) ブラックボックス最適化(全体の圧縮を制御するための広範なハイパーパラメータ調整)、および (3) 不十分なアーキテクチャの一般化によって広く使用されていません。これらの制限に対処するために、我々はGETAというフレームワークを提案します。GETAは、任意のDNNに対して自動的かつ効率的に共同構造プルーニングおよび量子化対応トレーニングを実行します。GETAは、次の3つの重要な革新を導入します:(i) 一般的な量子化対応DNNのためのプルーニング探索空間を構築する量子化対応依存グラフ(QADG)、(ii) 層ごとのビット制約が満たされることを保証する部分的に投影された確率的勾配法、(iii) プルーニングと量子化の間の解釈可能な関係を取り入れた新しい共同学習戦略。畳み込みニューラルネットワークおよびトランスフォーマーアーキテクチャに関する数値実験を示し、我々のアプローチが既存の共同プルーニングおよび量子化手法と比較して競争力のある(しばしば優れた)性能を達成することを示します。
2025-02-23T16:28:18
Time Series Domain Adaptation via Latent Invariant Causal Mechanism
http://arxiv.org/abs/2502.16637v1
Ruichu Cai, Junxian Huang, Zhenhui Yang, Zijian Li, Emadeldeen Eldele, Min Wu, Fuchun Sun
Guangdong University of Technology, Mohamed bin Zayed University of Artificial Intelligence, A*STAR, Tsinghua University
時系列ドメイン適応は、ラベル付きのソースドメインからラベルなしのターゲットドメインに複雑な時間依存関係を移転することを目的としています。最近の進展では、観測変数上の安定した因果メカニズムを活用して、ドメイン不変の時間依存性をモデル化しています。しかし、高次元データ(例えば、ビデオ)における正確な因果構造のモデル化は依然として困難です。さらに、観測変数(例えば、ピクセル)の間に直接的な因果関係が存在しない場合もあります。これらの制限は、実世界のシナリオへの既存のアプローチの適用を妨げます。これらの課題に対処するために、私たちは高次元の時系列データが低次元の潜在変数から生成されることを発見し、これが時間的潜在過程の因果メカニズムをモデル化する動機となります。この直感に基づいて、再構成された潜在因果構造のユニークさを保証する潜在因果メカニズム同定フレームワークを提案します。具体的には、まず、歴史的情報の十分な変化を利用して潜在変数を特定します。さらに、潜在変数間の関係のスパース性を強制することにより、同定可能な潜在因果構造を達成できます。理論的結果に基づいて、私は潜在因果性整合性(LCA)モデルを開発し、これは潜在構造再構成のためにドメイン内の潜在スパース性制約を取り入れ、ドメイン不変の構造再構成のためにドメイン間の潜在スパース性制約を組み込んだ変分推論を活用します。8つのベンチマークにおける実験結果は、ドメイン適応型の時系列分類および予測タスクにおける一般的な改善を示しており、私たちの手法が実際のシナリオで効果的であることを強調しています。コードはhttps://github.com/DMIRLAB-Group/LCAで入手可能です。
2025-02-23T16:25:58
OptionZero: Planning with Learned Options
http://arxiv.org/abs/2502.16634v1
Po-Wei Huang, Pei-Chiun Peng, Hung Guei, Ti-Rong Wu
選択肢を持った計画 - 基本的な行動の系列 - は、複雑な環境における強化学習で効果的であることが示されています。以前の研究は、専門家のデモデータを通じて定義されたオプションや学習されたオプションでの計画に焦点を当ててきました。人間の知識を一切持たずに超人的なヒューリスティックを学習するMuZeroに触発され、私たちはOptionZeroという新しいアプローチを提案します。OptionZeroはMuZeroにオプションネットワークを組み込み、自己対戦ゲームを通じてオプションの自律的発見を提供します。さらに、オプションを使用する際に環境遷移を提供するようにダイナミクスネットワークを修正し、同じシミュレーション制約の下でより深く探索できるようにします。26のAtariゲームで実施した実験により、OptionZeroがMuZeroを上回り、平均人間正規化スコアで131.58%の改善を達成することが示されました。私たちの行動分析は、OptionZeroがオプションを学習するだけでなく、異なるゲーム特性に合わせた戦略的スキルも獲得することを示しています。私たちの研究結果は、計画におけるオプションの発見と利用における有望な方向性を示しています。私たちのコードは、https://rlg.iis.sinica.edu.tw/papers/optionzero で入手可能です。
2025-02-23T16:20:15
Energy-Efficient Transformer Inference: Optimization Strategies for Time Series Classification
http://arxiv.org/abs/2502.16627v2
Arshia Kermani, Ehsan Zeraatkar, Habib Irani
Texas State University
トランスフォーマーモデルの時系列分類における計算需要の増加は、エネルギー効率の高い展開のために効果的な最適化戦略を必要とします。本論文では、トランスフォーマーアーキテクチャに対する構造的プルーニングと量子化手法に焦点を当て、最適化技術の体系的な調査を提示します。 RefrigerationDevices、ElectricDevices、PLAIDの3つの異なるデータセットに対して広範な実験を行い、異なるトランスフォーマー構成にわたるモデルのパフォーマンスとエネルギー効率を定量的に評価します。 実験結果は、静的量子化が分類パフォーマンスを維持しつつエネルギー消費を29.14%削減することを示しており、L1プルーニングは精度のわずかな低下で推論速度を63%向上させることに成功しています。 これらの発見は、トランスフォーマーベースの時系列分類の最適化戦略の有効性に関する貴重な洞察を提供し、リソース制約のある環境での効率的なモデル展開のための基盤を確立します。
2025-02-23T16:04:56
Can Large Vision-Language Models Detect Images Copyright Infringement from GenAI?
http://arxiv.org/abs/2502.16618v1
Qipan Xu, Zhenting Wang, Xiaoxiao He, Ligong Han, Ruixiang Tang
Rutgers University
生成AIモデルは、高品質のコンテンツを合成する能力で知られ、著作権で保護された素材の不適切な生成に関する懸念が高まっています。最近の研究では、著作権問題に対処するためのさまざまなアプローチが提案されていますが、大型ビジョン・ランゲージモデル(LVLM)が著作権侵害を検出する能力はほとんど探求されていません。本研究では、さまざまな画像サンプルを使用して、最先端のLVLMの著作権検出能力の評価に焦点を当てます。著作権侵害のサンプルとあいまいな非侵害のネガティブサンプルを含む包括的なデータセットが欠如していることを認識し、著名なIPキャラクターの著作権保護に違反するポジティブサンプルと、これらのキャラクターに似ているが著作権の問題を引き起こさないネガティブサンプルからなるベンチマークデータセットを構築しました。このデータセットは、高度なプロンプトエンジニアリング技術を用いて作成されています。そして、私たちはこのベンチマークデータセットを使用して先進的なLVLMを評価します。実験結果では、LVLMが過学習しやすく、一部のネガティブサンプルをIP侵害ケースとして誤分類する傾向があることが明らかになりました。最後のセクションでは、これらの失敗ケースを分析し、過学習の問題を軽減するための潜在的な解決策を提案します。
2025-02-23T15:41:12
Intelligent Tutors Beyond K-12: An Observational Study of Adult Learner Engagement and Academic Impact
http://arxiv.org/abs/2502.16613v1
Adit Gupta, Christopher MacLellan
Drexel University, Georgia Institute of Technology
インテリジェント・チューターはK-12教育において効果的であることが証明されていますが、成人学習者への影響、特に補助リソースとしての役割はまだ十分に探求されていません。成人が教育テクノロジーにどのように自主的に関与するかを理解することは、スキルの再学習や向上をサポートするツールの設計に役立ちます。より重要なこととして、通常K-12学習者のために構築されるチュータリングシステムが、成人層をもサポートできるかどうかを判断するのに役立ちます。本研究では、ある州の技術短期大学における成人学習者の間で、新しいチュータリングシステム「アプレンティス・チューター」の採用、使用パターン、および効果を調査しています。ユーザーの人口統計、成績、チューターとのインタラクションを含む3種類のデータを分析し、自発的なチューターの使用が測定可能な学習成果に転換されるかどうかを評価します。私たちの調査結果は、チューターの関与における重要な時間的パターンを明らかにし、知識の構成要素におけるスキル向上を通じてチューター内での学びの証拠を提供します。また、チューター使用後のコース評価スコアの向上を通じて、この学びがチューターの外に転送されたという証拠も見つかりました。これらの結果は、インテリジェント・チューターが成人学習者にとって有効なツールであることを示唆しており、この人口に対する長期的影響に関するさらなる研究が必要です。
2025-02-23T15:36:22
MemeIntel: Explainable Detection of Propagandistic and Hateful Memes
http://arxiv.org/abs/2502.16612v1
Mohamed Bayan Kmainasi, Abul Hasnat, Md Arid Hasan, Ali Ezzat Shahroor, Firoj Alam
Qatar University, Blackbird.AI, APAVI.AI, University of New Brunswick, Qatar Computing Research Institute, HBKU
ソーシャルメディアにおけるマルチモーダルコンテンツの増加は、誤情報、ヘイトスピーチ、プロパガンダなどの複雑で文脈依存の問題を理解し、モデレートする上で重大な課題をもたらしています。自動検出のためのリソースを開発し、新しい手法を提案する努力はなされていますが、ラベル検出や予測されたラベルのための説明ベースの根拠の生成に関しては、あまり注目されていません。この課題に対処するために、私たちはMemeIntelを紹介します。これはアラビア語のプロパガンダミームと英語のヘイトミームのための説明強化データセットであり、これらのタスクのための初の大規模なリソースとなります。このタスクを解決するために、私たちは多段階最適化アプローチを提案し、ビジョン・ランゲージモデル(VLM)をトレーニングします。我々の結果は、このアプローチがベースモデルに対して両方の「ラベル検出」と「説明生成」でパフォーマンスを大幅に改善し、ArMemeで約3%、ヘイトミームで約7%の絶対的な改善を達成していることを示しています。再現性と今後の研究のために、私たちはMemeIntelデータセットと実験リソースを公開することを目指します。
2025-02-23T15:35:48
Target Speaker Extraction through Comparing Noisy Positive and Negative Audio Enrollments
http://arxiv.org/abs/2502.16611v1
Shitong Xu, Yiyuan Yang, Niki Trigoni, Andrew Markham
ターゲットスピーカー抽出は、複数のスピーカーが含まれる音声ミクスチャから特定のスピーカーの声を分離することに焦点を当てています。ターゲットスピーカーのアイデンティティに関する情報を提供するために、従来の研究では、条件付き入力としてクリーンな音声サンプルを利用してきました。しかし、そういったクリーンな音声サンプルは常に容易に入手できるわけではありません(例:カクテルパーティーで知らない人の声のクリーンな音声サンプルを得るのは、騒がしい環境から離れなければ実用的ではありません)。先行研究の中で、騒がしい音声サンプルからターゲットスピーカーの特性を抽出することを探求したものは限られています。これには、邪魔なスピーカーからの重なり合った発話が含まれる場合があります。本研究では、登録段階において複数のスピーカーが存在する際のターゲットスピーカー抽出に焦点を当て、ターゲットスピーカーが話している音声セグメント(ポジティブ・エンロールメント)と、彼らが話していないセグメント(ネガティブ・エンロールメント)との違いを利用します。実験結果は、提案されたタスクのためのモデルアーキテクチャと専用の事前トレーニング手法の有効性を示しています。私たちの手法は、提案されたアプリケーション設定で最先端のパフォーマンスを達成しており、困難かつ現実的なシナリオにおいて強い汎用性を示しています。
2025-02-23T15:33:44
AdverX-Ray: Ensuring X-Ray Integrity Through Frequency-Sensitive Adversarial VAEs
http://arxiv.org/abs/2502.16610v1
Francisco Caetano, Christiaan Viviers, Lena Filatova, Peter H. N. de With, Fons van der Sommen
Eindhoven University of Technology, Philips IGT
医療画像の質と整合性を確保することは、深層学習に基づくコンピュータ支援診断(CAD)およびコンピュータ支援検出(CAD)システムにおける診断精度を維持するために重要です。共変量シフトは、異なる画像装置や設定によって引き起こされるデータ分布の微妙な変動であり、これによりモデルのパフォーマンスが大幅に低下する可能性があります。これは、敵対的攻撃の影響に似ています。したがって、CADモデルを使用する前に、これらの画像の質を評価するための軽量で迅速な方法が重要です。AdverX-Rayは、このニーズに応えるために、共変量シフトを効果的に検出するために設計された画像品質評価レイヤーとして機能します。この敵対的変分オートエンコーダは、識別器の役割を優先し、生成器の最適でない出力を負のサンプルとして使用して、識別器の高周波アーティファクトを特定する能力を微調整します。敵対的ネットワークによって生成された画像は、多くの場合、深刻な高周波アーティファクトを示し、識別器がこれらのコンポーネントに過度に焦点を合わせるように導きます。このため、識別器はこのアプローチに最適です。特定の機械モデルのX線画像のパッチで訓練されたAdverX-Rayは、スキャンがトレーニング分布に一致するか、または同じ機械のスキャンが異なる設定で取得されたかを評価できます。さまざまなOOD検出手法との広範な比較により、AdverX-Rayは既存の技術を大幅に上回り、X線画像の64のランダムパッチのみを使用して96.2%の平均AUROCを達成しました。その軽量で迅速なアーキテクチャはリアルタイムアプリケーションに適しており、医療画像システムの信頼性を向上させます。コードと事前訓練されたモデルは公に利用可能です。
2025-02-23T15:32:40
Toward Dependency Dynamics in Multi-Agent Reinforcement Learning for Traffic Signal Control
http://arxiv.org/abs/2502.16608v1
Yuli Zhang, Shangbo Wang, Dongyao Jia, Pengfei Fan, Ruiyuan Jiang, Hankang Gu, Andy H. F. Chow
Xi'an Jiaotong-Liverpool University, University of Sussex, City University of Hong Kong
強化学習(RL)は、複雑な都市交通ネットワークにおける適応型信号制御(ATSC)のための有望なデータ駆動型アプローチとして浮上しており、深層ニューラルネットワークがその学習能力を大幅に向上させています。しかし、中央集権型RLは、非常に高次元のジョイントアクション空間のために、複数のエージェントが関与するATSCには実用的ではありません。マルチエージェントRL(MARL)は、制御をローカルRLエージェントに分散することによってこのスケーラビリティの問題を緩和します。それでも、この分散型手法は新たな課題をもたらします:各ローカルエージェントの視点から環境が部分的に観察可能になるため、エージェント間の通信が制約されます。中央集権型RLとMARLは、特に重い交差点交通条件下で独自の強みと弱みを示します。本論文では、エージェント(交差点)間にスピルバック混雑が発生しない(エージェント依存なし)場合に、MARLが複数のIRL(独立強化学習)プロセスに分離することによって最適なグローバルQ値を達成できることを正当化します。スピルバック混雑が存在する場合(エージェント依存あり)には、中央集権型RLを用いることで最大のグローバルQ値を達成できます。これらの結論に基づき、エージェント間の依存性ダイナミクスに基づいて重みとバイアスを更新する新しい動的パラメータ更新戦略(DQN-DPUS)を提案します。すなわち、スピルバック混雑のないシナリオでは対角サブマトリックスのみを更新します。変化する交通状況のもとで2つの交差点を持つ単純なネットワークにおいてDQN-DPUSを検証し、提案された戦略が最適な探索を犠牲にすることなく収束速度を向上させることができることを示します。結果は理論的な発見を裏付け、交通信号制御の最適化におけるDQN-DPUSの有効性を示しています。
2025-02-23T15:29:12
Reasoning about Affordances: Causal and Compositional Reasoning in LLMs
http://arxiv.org/abs/2502.16606v1
Magnus F. Gjerde, Vanessa Cheung, David Lagnado
大規模言語モデル(LLM)の急速な進展に伴い、彼らの能力と限界を理解することがますます重要になっています。私たちは、物体のアフォーダンスという、従来は具現化された認知に関連付けられている領域において、LLMと人間の因果的および構成的推論能力を調査する二つの実験を行いました。データの汚染を避けるためにゼロから設計されたタスクでは、意思決定者が特定の目的のために典型的な道具に代わる非常に独創的な物体を選択する必要があります。例えば、テーブルテニスラケットを使って穴を掘るというようなものです。実験1では、GPT-3.5とGPT-4oを評価し、チェーン・オブ・ソートプロンプティングを与えた場合、GPT-4oは人間の参加者と同等のパフォーマンスを発揮する一方で、GPT-3.5はかなり劣っていることが分かりました。実験2では、二つの新しい条件、ディストラクター(物体の選択肢が増え、難易度が上がる)とイメージ(視覚的に提示される物体オプション)を導入し、GPTモデルに加えてClaude 3 SonnetおよびClaude 3.5 Sonnetも評価しました。ディストラクター条件は人間とモデルの両方のパフォーマンスを著しく低下させましたが、GPT-4oとClaude 3.5は依然としてランダムを上回るパフォーマンスを示しました。驚くべきことに、イメージ条件は人間やGPT-4oにはほとんど影響を与えませんでしたが、Claude 3.5の精度を大幅に低下させました。質的分析では、GPT-4oとClaude 3.5は前任者よりも因果的に関連する物体の特性を特定し、柔軟に適用する能力が強化されていることが示されました。GPT-3.5およびClaude 3からGPT-4oおよびClaude 3.5への改善は、モデルがいくつかの領域で因果的および構成的推論がますます可能であることを示唆していますが、LLMがどのように推論するかを理解するためにはさらなる機構的研究が必要です。
2025-02-23T15:21:47
VidLBEval: Benchmarking and Mitigating Language Bias in Video-Involved LVLMs
http://arxiv.org/abs/2502.16602v1
Yiming Yang, Yangyang Guo, Hui Lu, Yan Wang
Nanyang Technological University, National University of Singapore, Sichuan University
最近、大規模な視覚と言語のモデル(LVLM)が多様なマルチモーダルタスクやベンチマークにおいて重要な進展を遂げました。本論文では、既存のビデオを含むLVLMからこれまであまり探求されていない問題—言語バイアス—を明らかにします。この問題は、モデルがビデオよりも言語を優先する傾向があり、その結果、不正確な回答をもたらすものです。この研究のギャップに対処するために、まず、ビデオに関連するLVLMにおける言語バイアスを評価するために特別に設計された「ビデオ言語バイアス評価ベンチマーク」を収集しました。このベンチマークは、曖昧なビデオ対照と疑問文の質問を通じて、言語バイアスを評価するための二つの重要なタスクを含んでいます。これに応じて、言語によるバイアスのあるLVLMにペナルティを課すことを目的とした評価メトリクスも設計しました。加えて、私たちは、多専門分岐対照デコーディング(MCD)を提案し、アマチュアなテキスト専用ブランチが生成する可能性のある言語バイアスに同時に対抗するために二つの専門ブランチを導入します。私たちの実験は、i) 既存のビデオを含むLVLMには、商用及びオープンソースを含むが、言語バイアスの問題に大きく制限されていること; ii) 私たちのMCDがこの問題を効果的に緩和し、追加の再訓練やモデルアーキテクチャの変更なしに、さまざまなビデオを含むLVLMにおいて一般的な能力を維持できることを示しています。
2025-02-23T15:04:23
Tracking the Copyright of Large Vision-Language Models through Parameter Learning Adversarial Images
http://arxiv.org/abs/2502.16593v1
Yubo Wang, Jianting Tang, Chaohu Liu, Linli Xu
University of Science and Technology of China, State Key Laboratory of Cognitive Intelligence
大規模ビジョン・言語モデル(LVLM)は、驚異的な画像理解能力と対話能力を示しており、さまざまな視覚的質問応答タスクを処理できるようになっています。しかし、その広範な利用可能性は、無許可の使用や著作権侵害に関する懸念を引き起こしています。ユーザーや個人が公開されたモデルをファインチューニングすることで自分自身のLVLMを開発できるからです。本論文では、元のモデルを変更することなくLVLMの著作権を追跡するための新しい手法、パラメータ学習攻撃(PLA)を提案します。具体的には、元のモデルに対する狙った攻撃を通じて敵対的な画像を構築し、特定の出力を生成できるようにします。著作権追跡を引き起こすために、こうした攻撃がファインチューニングされたモデルでも効果的であるように、敵対的攻撃プロセス中に元のモデルがトリガー画像を学習できるように、パラメータを逆方向に更新します。特に、この提案された手法は元のモデルのリリース後に適用できるため、モデルの性能や挙動に影響を与えることはありません。実世界のアプリケーションをシミュレートするために、さまざまなデータセットにわたって多様な戦略を使用して元のモデルをファインチューニングし、著作権確認のためにさまざまなモデルを作成します。広範な実験により、我々の手法がファインチューニングされたモデルの元の著作権をベースライン手法に比べてより効果的に特定できることが実証されました。したがって、この研究はLVLMの著作権を追跡し、無許可の使用を検出するための強力なツールを提供します。
2025-02-23T14:49:34
Co-MTP: A Cooperative Trajectory Prediction Framework with Multi-Temporal Fusion for Autonomous Driving
http://arxiv.org/abs/2502.16589v2
Xinyu Zhang, Zewei Zhou, Zhaoyi Wang, Yangjie Ji, Yanjun Huang, Hong Chen
Tongji University
車両間通信技術(V2X)は、認知範囲を拡大し、遮蔽を通して見る理想的なパラダイムとなっています。既存の取り組みは単一フレームの協調知覚に焦点を当てていますが、V2Xを用いてフレーム間の時間的手がかりを捉え、予測タスクや計画タスクを促進する方法はまだ十分に探求されていません。本論文では、コーオペレーティブ軌道予測フレームワークであるCo-MTPを導入します。このフレームワークは、自動運転のために多時系列融合を行い、V2Xシステムを活用して、履歴と未来の領域におけるエージェント間の相互作用を完全に捉え、計画に役立てます。履歴領域では、V2Xが単一車両の知覚における不完全な履歴軌道を補完し、複数のエージェントからの履歴特徴の融合を学習するために異種グラフ変換器を設計し、履歴の相互作用を捉えます。さらに、予測の目的は未来の計画をサポートすることです。したがって、未来の領域では、V2Xが周囲の物体の予測結果を提供し、自己の計画と他の車両の意図との未来の相互作用を捉えるために、グラフ変換器をさらに拡張し、特定の計画行動の下で最終的な未来のシナリオ状態を取得します。私たちは、実世界のデータセットV2X-SeqでCo-MTPフレームワークを評価し、その結果、Co-MTPが最先端のパフォーマンスを達成し、履歴と未来の融合が予測に大きく貢献できることを示しました。
2025-02-23T14:38:13
Audio-FLAN: A Preliminary Release
http://arxiv.org/abs/2502.16584v1
Liumeng Xue, Ziya Zhou, Jiahao Pan, Zixuan Li, Shuai Fan, Yinghao Ma, Sitong Cheng, Dongchao Yang, Haohan Guo, Yujia Xiao, Xinsheng Wang, Zixuan Shen, Chuanbo Zhu, Xinshen Zhang, Tianchi Liu, Ruibin Yuan, Zeyue Tian, Haohe Liu, Emmanouil Benetos, Ge Zhang, Yike Guo, Wei Xue
最近のオーディオトークナイゼーションの進展により、大規模言語モデル(LLM)へのオーディオ機能の統合が大幅に向上しました。しかし、オーディオの理解と生成はしばしば異なるタスクとして扱われ、真に統一されたオーディオ・言語モデルの開発が妨げられています。インストラクションチューニングは、テキストやビジョンにおける一般化やゼロショット学習を改善する上で顕著な成功を示していますが、オーディオへの適用はほとんど探求されていません。主な障害は、オーディオの理解と生成を統合する包括的なデータセットの不足です。これに対処するために、私たちはAudio-FLANを導入します。この大規模なインストラクションチューニングデータセットは、音声、音楽、およびサウンドのドメインにわたって80の多様なタスクをカバーし、1億を超えるインスタンスを含んでいます。Audio-FLANは、広範なオーディオドメインにおける理解(例:文字起こし、理解)および生成(例:音声、音楽、音)タスクをゼロショット方式でシームレスに処理できる統一されたオーディオ・言語モデルの基盤を築きます。Audio-FLANデータセットはHuggingFaceとGitHubで入手可能で、今後も継続的に更新される予定です。
2025-02-23T14:24:15
LawPal : A Retrieval Augmented Generation Based System for Enhanced Legal Accessibility in India
http://arxiv.org/abs/2502.16573v1
Dnyanesh Panchal, Aaryan Gole, Vaibhav Narute, Raunak Joshi
Vidyavardhini’s College of Engineering and Technology
インドにおける法的知識へのアクセスは、意識の欠如、誤情報、および司法リソースへの限られたアクセスによってしばしば妨げられています。多くの人々が複雑な法的枠組みを理解するのに苦労し、その結果、法律が誤用されたり、不十分な法的保護が生じたりしています。これらの問題に対処するため、我々は効率的で正確な法情報検索を実現するために、ベクトルストア指向のFAISSを活用した取得拡張生成(RAG)ベースの法的チャットボットを提案します。従来のチャットボットとは異なり、我々のモデルは法的文書、公式文書、インド憲法を含む広範なデータセットを用いて訓練されており、最も複雑または誤解を招く法的質問に対しても正確な応答を提供することができます。このチャットボットは、迅速なベクトルベースの検索のためにFAISSを活用しており、検索速度と正確性を大幅に向上させています。また、ねじれたまたは曖昧な法的質問に対応できるように設計されており、不正確な解釈の可能性を減少させます。法的質問への回答というコア機能に加え、プラットフォームにはリアルタイムの法的ニュースの更新、法律に関するブログ、および法律関連書籍へのアクセスなどの追加機能が含まれており、ユーザーにとって包括的なリソースとなっています。高度なAI技術と最適化された検索システムを統合することにより、我々のチャットボットは法的知識を民主化し、法的リテラシーを向上させ、誤情報の拡散を防ぐことを目指しています。この研究は、我々のアプローチが法的アクセシビリティを効果的に改善し、高い正確性と効率を維持しながら、より情報に基づいた力強い社会に貢献することを示しています。
2025-02-23T13:45:47
Entropy-Lens: The Information Signature of Transformer Computations
http://arxiv.org/abs/2502.16570v1
Riccardo Ali, Francesco Caso, Christopher Irwin, Pietro Liò
University of Cambridge, Sapienza University of Rome, University of Eastern Piedmont
トランスフォーマーモデルは自然言語処理からコンピュータビジョンに至るまで多くの分野に革命をもたらしましたが、その内部計算ダイナミクスは十分に理解されておらず、予測可能性や堅牢性に対する懸念が生じています。本研究では、情報理論を利用してフローズンで即席の大規模トランスフォーマーを解釈するためのスケーラブルでモデル非依存のフレームワークであるエントロピー・レンズを紹介します。中間残渣ストリーム内のシャノンエントロピーの変遷を定量化することで、私たちのアプローチはモデルファミリーを区別し、タスク特有のプロンプトを分類し、出力精度と相関する計算の署名を抽出します。さらに、ビジョントランスフォーマーへの分析の拡張によって、私たちの手法の一般性を示します。私たちの結果は、エントロピーに基づく指標が現代のトランスフォーマーアーキテクチャの内部作業を明らかにするための原則的なツールとして機能できることを示唆しています。
2025-02-23T13:33:27
The Hidden Strength of Disagreement: Unraveling the Consensus-Diversity Tradeoff in Adaptive Multi-Agent Systems
http://arxiv.org/abs/2502.16565v1
Zengqing Wu, Takayuki Ito
コンセンサス形成はマルチエージェントシステム(MAS)において重要であり、集団の一貫性と個々の多様性のバランスを取ります。従来のLLMをベースにしたMASは、主に明示的な調整、例えばプロンプトや投票に依存しており、早期の均質化のリスクがあります。私たちは、エージェントが情報を交換しつつ、コンテキスト学習を通じて独立して意思決定を行う暗黙的なコンセンサスの方が、長期的な適応性を必要とするダイナミックな環境ではより効果的であると主張します。部分的な多様性を維持することで、システムは新しい戦略をより良く探索し、外部のショックに対処することができます。私たちはコンセンサスと多様性のトレードオフを定式化し、暗黙的な手法が明示的な手法を上回る条件を示します。ダイナミックな災害対応、情報の拡散と操作、ダイナミックな公共財提供という三つのシナリオにおける実験は、グループの規範からの部分的な逸脱が探索、堅牢性、パフォーマンスを高めることを確認しています。私たちはコンテキスト学習を通じた新たな調整の重要性を強調し、レジリエントな意思決定のために多様性を維持することの価値に注目します。
2025-02-23T13:12:53
Spectral Theory for Edge Pruning in Asynchronous Recurrent Graph Neural Networks
http://arxiv.org/abs/2502.17522v1
Nicolas Bessone
グラフニューラルネットワーク(GNN)は、グラフ構造データの学習において強力なツールとして台頭しており、ソーシャルネットワーク分析や分子生物学など、数多くの分野で応用されています。この広範なカテゴリの中で、非同期再帰的グラフニューラルネットワーク(ARGNN)は、動的グラフにおける複雑な依存関係を捉える能力で際立っています。これは、生物の複雑かつ適応的な性質に似ています。しかし、その複雑さはしばしば大規模で計算コストの高いモデルをもたらします。したがって、パフォーマンスを大きく損なうことなく効率を向上させるために、不必要なエッジの剪定が重要となります。本論文では、ネットワークグラフのラプラス行列の固有値の虚部を利用したグラフスペクトル理論に基づく動的剪定手法を提案します。
2025-02-23T13:05:08
Analysis of Emotion in Rumour Threads on Social Media
http://arxiv.org/abs/2502.16560v1
Rui Xing, Boyang Sun, Kun Zhang, Timothy Baldwin, Jey Han Lau
オンラインソーシャルメディアにおける噂は現代社会に重大なリスクをもたらし、その発展をより良く理解する必要性を促しています。本研究では、スレッド形式のディスコースにおける感情と噂の相互作用に特に焦点を当てており、このテーマに関する文献は意外に乏しく、主に元の噂投稿の中の感情に集中しており、噂と非噂の比較に関する違いはほとんど見落とされてきました。本研究では、既存の自然言語処理(NLP)データセットを使用して、噂と非噂のケースを対比させる包括的な分析的感情フレームワークを提供し、噂の中の感情ダイナミクスをさらに理解します。我々のフレームワークは、いくつかの発見を明らかにします。噂は憤り、恐れ、悲観的な感情など、よりネガティブな感情を示す一方で、非噂はよりポジティブな感情を引き起こします。感情はオンラインの相互作用において伝染し、噂はネガティブな感情を助長し、非噂はポジティブな感情を育むということです。また、因果分析に基づくと、驚きは噂と他の感情との橋渡しをし、悲観主義は悲しみと恐れによって駆動され、楽観主義は喜びと愛によって駆動されます。
2025-02-23T12:57:40
Beyond Words: How Large Language Models Perform in Quantitative Management Problem-Solving
http://arxiv.org/abs/2502.16556v1
Jonathan Kuzmanko
この研究は、ゼロショット設定における定量的管理意思決定問題に対する大規模言語モデル(LLMs)のパフォーマンスを調査します。20の多様な管理シナリオにおいて、5つの主要モデルによって生成された900の応答を基に、私たちの分析では、これらの基本モデルがさまざまな提示形式、シナリオの複雑さ、および繰り返しの試行において正確な数値的決定を提供できるかどうかを探ります。以前の研究結果とは対照的に、テキストの提示形式(直接、物語、または表形式)やテキストの長さが正確さに与える影響は有意ではありませんでした。しかし、シナリオの複雑さ、特に制約や無関係なパラメータの観点からは、パフォーマンスに強い影響を与え、しばしば正確さを低下させました。驚くべきことに、モデルは予想以上に複数の解決ステップを必要とするタスクを効果的に処理しました。特筆すべきは、正確な応答はわずか28.8%であり、精度の限界を浮き彫りにしています。さらに、反復の中で有意な「学習効果」は見られず、パフォーマンスは繰り返しのクエリに対して安定していました。しかし、テストした5つのLLMの間には大きな変動が見られ、いくつかのモデルは優れた2値精度を示しました。全体として、これらの発見は、複雑な定量的意思決定におけるLLMの活用の約束と落とし穴を強調し、マネージャーや研究者に最適な展開戦略についての情報を提供します。
2025-02-23T12:39:39
Composable Strategy Framework with Integrated Video-Text based Large Language Models for Heart Failure Assessment
http://arxiv.org/abs/2502.16548v1
Jianzhou Chen, Xiumei Wang, Jinyang Sun, Xi Chen, Heyu Chu, Guo Song, Yuji Luo, Xingping Zhou, Rong Gu
心不全は、世界中で主要な死因の一つであり、毎年何百万もの死亡が報告されていると、世界保健機関(WHO)や他の公衆衛生機関のデータが示しています。心不全の分野では重要な進展があり、生存率の向上や駆出分率の改善が見られますが、その複雑さと多因子の特徴により、依然として多くの未充足ニーズが存在します。したがって、私たちは心不全の評価と治療の最適化のための構成可能な戦略フレームワークを提案します。このフレームワークは、医師と患者の相談プロセスをシミュレートし、ビデオ、身体検査、テキスト結果、医療歴など、さまざまなデータを分析するためにマルチモーダルアルゴリズムを活用します。これらのさまざまなデータソースを統合することにより、私たちのフレームワークは、患者のより包括的な評価と最適化された治療計画を提供します。私たちの結果は、このマルチモーダルアプローチが、心不全(HF)の予後予測の精度において単一モーダルの人工知能(AI)アルゴリズムを上回ることを示しています。この方法を通じて、心不全予後に対するさまざまな病理指標の影響をさらに評価し、より包括的な評価を提供することができます。
2025-02-23T12:06:08
Advanced Chain-of-Thought Reasoning for Parameter Extraction from Documents Using Large Language Models
http://arxiv.org/abs/2502.16540v1
Hong Cai Chen, Yi Pin Xu, Yang Zhang
技術文書からパラメータを抽出することは、電子設計における設計精度とシミュレーションの信頼性を確保するために非常に重要です。しかし、現在の手法は高次元設計データを扱うのに苦労しており、リアルタイム処理の要求に応えることができていません。電子設計自動化(EDA)では、エンジニアが多くの文書を手動で検索して、PySpiceモデルを構築するために必要なコンポーネントパラメータを取得することが多く、これは労力がかかり時間がかかるプロセスです。この課題に対処するために、私たちは大規模言語モデル(LLM)を活用して、データシートからパラメータの抽出およびPySpiceモデルの生成を自動化する革新的なフレームワークを提案します。私たちのフレームワークは、3つの思考連鎖(CoT)に基づく技術を導入します: (1) ターゲット文書取得(TDR)、これは関連する技術セクションの迅速な特定を可能にします; (2) 反復取得最適化(IRO)、反復的改善を通じてパラメータ検索を洗練します; (3) 優先最適化(PO)、これは関連性に基づいて重要な文書セクションの優先順位を動的に設定します。実験結果は、これら3つの手法を併用することで取得精度が47.69%向上し、処理遅延が37.84%短縮されることを示しています。さらに、コーエンのdを用いた効果サイズ分析により、POは遅延を大幅に減少させ、IROは精度向上に最も寄与することが明らかになりました。これらの発見は、私たちのフレームワークがEDAプロセスを効率化し、設計精度を向上させ、開発期間を短縮する可能性を強調しています。さらに、私たちのアルゴリズムはモデル非依存の一般化を持っており、異なるLLM全体でパラメータ検索のパフォーマンスを向上させることができます。
2025-02-23T11:19:44
Class-Conditional Neural Polarizer: A Lightweight and Effective Backdoor Defense by Purifying Poisoned Features
http://arxiv.org/abs/2502.18520v1
Mingli Zhu, Shaokui Wei, Hongyuan Zha, Baoyuan Wu
The Chinese University of Hong Kong, Shenzhen
最近の研究では、深層ニューラルネットワークがバックドア攻撃に対して脆弱であることが強調されています。バックドア攻撃では、モデルが毒されたサンプル内の埋め込まれたトリガーに依存するように操作される一方で、良性情報とトリガー情報の両方が存在します。いくつかの防御手法が提案されていますが、バックドアの緩和と良性のパフォーマンスを維持することのバランスをとるのが難しいことがよくあります。本研究では、特定の偏光を持つ光波を通し、他の光波をフィルタリングする光学偏光子の概念に触発され、軽量なバックドア防御アプローチであるNPDを提案します。この方法では、妥協されたモデル内の中間層としてニューラル偏光子(NP)を統合し、バイレベル最適化を通じて最適化された軽量線形変換として実装します。学習可能なNPは、毒されたサンプルからトリガー情報をフィルタリングしながら、良性の内容を保持します。その有効性にもかかわらず、経験的な研究を通じて、NPDのパフォーマンスは、精製に必要なターゲットラベルが不正確に推定されると低下することを確認しました。この制限に対処し、ターゲットを絞った敵対的緩和の可能性を活用するために、クラス条件付きニューラル偏光子ベースの防御(CNPD)を提案します。重要な革新は、バックドアされたモデルによって予測されたラベルと精製する特徴を統合する融合モジュールです。このアーキテクチャは、NPDで使用されるラベル推定を必要とせず、ターゲットを絞った敵対的防御メカニズムを本質的に模倣します。CNPDの3つの実装を提案します。最初はr-CNPDで、これは各クラスのために複製されたNP層をトレーニングし、推論中にバックドアモデルからの予測されたクラスに基づいて適切なNP層を選択します。多数のクラスを効率的に処理するために、2つのバリアントが設計されています。e-CNPDは、クラス情報を追加の特徴として組み込み、a-CNPDは、クラス情報を使用してネットワークの注意を向けます。
2025-02-23T11:11:16
Rebalancing the Scales: A Systematic Mapping Study of Generative Adversarial Networks (GANs) in Addressing Data Imbalance
http://arxiv.org/abs/2502.16535v1
Pankaj Yadav, Gulshan Sihag, Vivek Vijay
IIT Jodhpur, None
機械学習アルゴリズムはさまざまな分野で利用されており、その多くはデータの不均衡のために重大な課題に直面しています。研究者たちは、データ前処理、コスト感受性学習、アンサンブル法など、問題に対処するためのさまざまなアプローチを探求してきました。生成的敵対ネットワーク(GAN)は、高品質の合成データを生成するデータ前処理技術として非常に大きな可能性を示しました。本研究では、4つのデジタルライブラリから収集した不均衡データに基づくGANベースのサンプリング技術に関する3041本の論文を分析するために、体系的マッピング手法を採用しています。フィルタリングプロセスにより、医療、金融、サイバーセキュリティなどの分野にまたがる100の重要な研究が特定されました。包括的な定量分析を通じて、本研究は不均衡なデータの取り扱いに用いられるアプリケーションドメイン、GAN技術、GANバリアントの3つの分類マッピングを導入します。GANベースのオーバーサンプリングは、効果的な前処理手法として浮上します。高度なアーキテクチャと特化したフレームワークによって、データの不均衡のケースにおいてGANはさらに改善されました。バニラGAN、CTGAN、CGANなどのGANバリアントは、構造化された不均衡データのケースにおいて非常に適応性が高いことが示されています。不均衡データに対するGANの関心は急速に高まり、近年ピークに達しており、ジャーナルや会議は基礎理論と実践的アプリケーションの伝達に重要な役割を果たしています。このような進展がある一方で、レビューされた研究の中には、拡散モデルや強化学習技術を用いたハイブリッド化されたGANフレームワークを明示的に探求するものはありません。このギャップは、データの不均衡を効果的に扱うための革新的アプローチを開発する未来の研究アイデアを導きます。
2025-02-23T11:03:29
Multilingual != Multicultural: Evaluating Gaps Between Multilingual Capabilities and Cultural Alignment in LLMs
http://arxiv.org/abs/2502.16534v1
Jonathan Rystrøm, Hannah Rose Kirk, Scott Hale
University of Oxford, Oxford Internet Institute
大規模言語モデル(LLM)は、世界各国の言語においてますます高い能力を持つようになっています。しかし、言語間でのコミュニケーション能力は、必ずしも適切な文化的表現に翻訳されるわけではありません。主な懸念の一つは、米国中心のバイアスであり、LLMが米国の文化価値観を反映し、現地の文化価値観を無視するということです。私たちは、デンマーク語、オランダ語、英語、ポルトガル語の4つの言語に関する世界価値調査からの人口レベルの意見データに対して、LLM生成された応答の分布を比較する新しい方法論を提案します。厳密な線形混合効果回帰フレームワークを使用して、GoogleのGemmaモデル(2B~27Bパラメータ)と、OpenAIのターボシリーズの連続したバージョンの2つのモデルファミリーを比較します。モデルのファミリーを通じて、言語能力と文化的整合性の間に一貫した関係は見られませんでした。Gemmaモデルは、言語能力と文化的整合性の間に正の相関関係がある一方で、OpenAIモデルにはそのような関係は見られませんでした。重要なのは、自己一貫性が多文化的整合性の強力な予測因子であり、言語能力よりも優れているということです。我々の結果は、有意義な文化的整合性を達成するには、一般的な言語能力を向上させる以上の専念した努力が必要であることを示しています。
2025-02-23T11:02:41
A Survey of Graph Transformers: Architectures, Theories and Applications
http://arxiv.org/abs/2502.16533v1
Chaohao Yuan, Kangfei Zhao, Ercan Engin Kuruoglu, Liang Wang, Tingyang Xu, Wenbing Huang, Deli Zhao, Hong Cheng, Yu Rong
グラフトランスフォーマー(GT)は、グラフニューラルネットワーク(GNN)の内在的な制限、例えばオーバースムージングやオーバースクイージングに対処することで、グラフ構造のモデル化に強力な能力を示しています。最近の研究では、グラフトランスフォーマーに対する多様なアーキテクチャ、説明能力の向上、実用的な応用が提案されています。これらの急速な進展を踏まえ、本調査ではグラフトランスフォーマーの包括的なレビューを行い、アーキテクチャ、理論的基盤、アプリケーションなどの側面を網羅します。グラフトランスフォーマーのアーキテクチャは、グラフトークン化、位置エンコーディング、構造認識アテンション、モデルアンサンブルを含む構造情報の処理戦略に応じて分類します。さらに、理論的観点から、様々なアーキテクチャにおけるグラフトランスフォーマーの表現力を検討し、他の高度なグラフ学習アルゴリズムと対比させてその関連性を明らかにします。また、分子、タンパク質、言語、視覚交通、脳、材料データなど、グラフトランスフォーマーが利用されている実用的なアプリケーションの概要を提供します。本調査の最後では、グラフトランスフォーマーにおける現在の課題と将来の研究のための展望について議論します。
2025-02-23T10:55:19
Retrieval-Augmented Fine-Tuning With Preference Optimization For Visual Program Generation
http://arxiv.org/abs/2502.16529v1
Deokhyung Kang, Jeonghun Cho, Yejin Jeon, Sunbin Jang, Minsub Lee, Jawoon Cho, Gary Geunbae Lee
視覚プログラミング言語(VPL)は、ユーザーがグラフィカルインターフェイスを通じてプログラムを作成することを可能にし、これによりアクセシビリティが向上し、さまざまな分野での広範な使用が実現しています。このアクセシビリティをさらに向上させるために、最近の研究では大規模言語モデル(LLM)を用いてユーザーの指示からVPLコードを生成することに焦点が当てられています。具体的には、プロンプトベースの手法を用いることで、これらの研究は有望な結果を示しています。しかしながら、このようなアプローチは、ラダーダイアグラム(LD)などの産業用VPLに対しては効果が薄い場合があります。LDは産業オートメーションプロセスで使用される重要な言語であり、広範なドメイン特有の設定が関与しているため、単一のプロンプトで捉えるのが難しいのです。本研究では、トレーニングベースの手法がLD生成の精度においてプロンプトベースの手法を上回ることを示します。この成果を踏まえ、VPL生成をさらに向上させるための二段階トレーニング戦略を提案します。まず、産業用VPLで一般的に見られるサブルーチンの繰り返し使用を活用するために、リトリーバル拡張ファインチューニングを採用します。次に、グラフ編集操作を通じて系統的に生成された優先ペアを用いて、モデルをより正確な出力へ誘導するために直接好み最適化(DPO)を適用します。実際のLDデータに対する広範な実験により、私たちのアプローチが監視付きファインチューニングと比較してプログラムレベルの精度を10%以上向上させることを示し、産業オートメーションを進める可能性を強調しています。
2025-02-23T10:27:44
Pay Attention to Real World Perturbations! Natural Robustness Evaluation in Machine Reading Comprehension
http://arxiv.org/abs/2502.16523v1
Yulong Wu, Viktor Schlegel, Riza Batista-Navarro
University of Manchester, Imperial College London
神経言語モデルが機械読解理解(MRC)において人間と同等のパフォーマンスを達成し、広く採用されるようになる中で、リアルワールドシナリオにおけるその堅牢性を確保することがますます重要になってきました。しかし、現在の堅牢性評価の研究は主に合成擾乱手法を発展させており、それが実際のシナリオをどの程度反映しているのか明確ではありません。これを考慮し、私たちはMRCベンチマークの段落を利用可能なウィキペディアの編集履歴に基づく対応する段落と置き換えることで、自然に発生するテキストの擾乱に対してMRCモデルを自動的に検査するフレームワークを提示します。このような擾乱タイプは、人工的な生成プロセスに由来しないため自然であり、以前に調査された合成アプローチとは本質的に異なります。SQUADデータセットとさまざまなモデルアーキテクチャを含む大規模な研究において、自然な擾乱が事前学習済みのエンコーダー言語モデルの性能低下を引き起こすことを観察しました。さらに懸念すべきは、これらの最先端のFlan-T5および大規模言語モデル(LLM)がこれらのエラーを引き継ぐことです。さらなる実験により、私たちの発見が他のより困難なMRCベンチマークで見られる自然な擾乱に一般化されることを示しました。これらのエラーを軽減するために、自然または合成擾乱のサンプルで訓練することによって自然な擾乱への堅牢性を向上させることが可能であることを示しましたが、未擾乱データに対するパフォーマンスと比較すると依然として顕著なギャップが残ります。
2025-02-23T10:04:21
Predicting Bad Goods Risk Scores with ARIMA Time Series: A Novel Risk Assessment Approach
http://arxiv.org/abs/2502.16520v2
Bishwajit Prasad Gond
National Institute of Technology Rourkela
供給チェーンの複雑さの増加と、欠陥品や劣悪品(悪い製品)に関連するコストの上昇は、リスクを軽減し、運営効率を向上させるための高度な予測手法の緊急な必要性を浮き彫りにしています。本研究では、時系列予測の後に悪い製品を計算するために特別に設計された独自の式と、時系列ARIMA(自己回帰統合移動平均)モデルを統合する新しいフレームワークを提案します。販売、返品、キャパシティなどの履歴データパターンを活用することで、このモデルは潜在的な品質不良を予測し、事前の意思決定を可能にします。ARIMAは時系列データの時間的トレンドを捉えるために使用され、新たに開発された式は欠陥の可能性と影響をより正確に定量化します。2022年から2024年までのデータセットに基づく実験結果は、提案された方法が予測精度とリスク評価の両方において、指数平滑化やホルト・ウィンターズなどの従来の統計モデルを上回ることを検証しています。この研究は、供給チェーンの品質管理における時系列予測、ARIMA、およびリスクマネジメントを統合することにより、予測分析の分野を前進させており、悪い製品による損失を最小限に抑えるためのスケーラブルで実用的な解決策を提供します。
2025-02-23T09:52:11
Gaussian Process Regression for Improved Underwater Navigation
http://arxiv.org/abs/2502.16510v1
Nadav Cohen, Itzik Klein
University of Haifa
正確な水中ナビゲーションは、全球ナビゲーション衛星システムの信号がないため、また時間の経過とともにドリフトを生じる慣性ナビゲーションシステムに依存するため、困難な作業です。ドップラ速度記録装置(DVL)は、速度測定を通じてこのドリフトを軽減するために一般的に使用されており、速度は通常、最小二乗法(LS)などのパラメータ推定アプローチを使用して推定されます。しかし、LSは理想的な条件下で機能するという仮定のもとに成り立っており、センサーのバイアスを考慮していないため、最適なパフォーマンスを発揮することができません。本論文では、DVL速度推定を改善するために、複数出力ガウス過程回帰(MOGPR)に基づいたデータ駆動型の代替手法を提案します。MOGPRは速度推定と関連する計測共分散を提供し、誤差状態拡張カルマンフィルタ(EKF)内での適応的な統合を可能にします。提案したアプローチを実世界のAUVデータを用いて評価し、LSおよび最先端の深層学習モデルであるBeamsNetと比較しました。結果は、MOGPRが速度推定誤差を約20%削減し、特に向き状態において全体のナビゲーション精度を同時に向上させることを示しています。さらに、MOGPRからの不確実性推定の組み込みにより、動的な水中環境でのナビゲーションの堅牢性が向上する適応EKFフレームワークが実現されます。
2025-02-23T09:13:41
FanChuan: A Multilingual and Graph-Structured Benchmark For Parody Detection and Analysis
http://arxiv.org/abs/2502.16503v1
Yilun Zheng, Sha Li, Fangkun Wu, Yang Ziyi, Lin Hongchao, Zhichao Hu, Cai Xinjun, Ziming Wang, Jinxuan Chen, Sitao Luan, Jiahao Xu, Lihui Chen
パロディは、個人が自分とは反対の役割や立場を模倣する形でユーモアや挑発、論争のために表現する、ソーシャルメディア上で新たに台頭している現象です。パロディの検出と分析は困難であり、文脈に依存することが多いですが、文化的価値の理解を深め、サブカルチャーを促進し、自己表現を豊かにする上で重要な役割を果たします。しかし、パロディの研究は、利用可能なデータが限られていることと、現在のデータセットにおける多様性の欠如によって妨げられています。このギャップを埋めるために、英語と中国語のコーパスから7つのパロディデータセットを構築し、合計14,755の注釈付きユーザーと21,210の注釈付きコメントを収集しました。十分な文脈情報を提供するために、返信も収集し、ユーザー間のインタラクショングラフを構築して、既存のデータセットには欠けているより豊かな文脈情報を提供します。これらのデータセットを用いて、私たちは3つの主要なタスクに対して従来の手法と大規模言語モデル(LLM)をテストします:(1) パロディの検出、(2) パロディを含むコメントの感情分析、(3) パロディを含むユーザー感情分析。私たちの広範な実験から、パロディ関連のタスクはすべてのモデルにとって依然として困難であり、文脈情報が重要な役割を果たすことが明らかになりました。興味深いことに、特定のシナリオでは、従来の文埋め込み手法とシンプルな分類器を組み合わせることで、高度なLLM、つまりDeepSeek-R1やGPT-o3を上回る性能を発揮することがあります。これは、パロディがLLMにとって重要な課題であることを強調しています。
2025-02-23T08:52:46
PMAT: Optimizing Action Generation Order in Multi-Agent Reinforcement Learning
http://arxiv.org/abs/2502.16496v1
Kun Hu, Muning Wen, Xihuai Wang, Shao Zhang, Yiwei Shi, Minne Li, Minglong Li, Ying Wen
nudt.edu.cn, sjtu.edu.cn, bristol.ac.uk, tsinghua.org.cn
マルチエージェント強化学習(MARL)は、マルチエージェントシステム内の複雑な相互依存性のためにエージェントの調整に課題を抱えています。ほとんどのMARLアルゴリズムは同時意思決定のパラダイムを用いていますが、エージェント間のアクションレベルの依存性を無視しているため、調整効率が低下します。それに対して、逐次意思決定のパラダイムはエージェントの意思決定順序に対してより詳細な監視を提供し、優れた意思決定順序管理を通じて依存性を扱う可能性を示しています。しかし、最適な意思決定順序を決定することは依然として課題です。本論文では、エージェントの意思決定順序最適化のための新しいメカニズムであるプラケット・ルースサンプリングを用いたアクション生成(AGPS)を紹介します。私たちは、順序決定タスクをプラケット・ルースサンプリングプロセスとしてモデル化し、ランキングの不安定性やネットワークトレーニングプロセス中の消失勾配などの問題に取り組みます。AGPSは、エージェントのローカル観察の重要性とその意思決定クレジットとの間に橋を架けることで、信用に基づく意思決定順序の決定を実現し、順序最適化と依存性管理を促進します。AGPSとマルチエージェントトランスフォーマーを統合し、意思決定順序最適化を備えた逐次意思決定MARLアルゴリズムである優先マルチエージェントトランスフォーマー(PMAT)を提案します。StarCraft IIマルチエージェントチャレンジ、Google Research Football、マルチエージェントMuJoCoなどのベンチマークでの実験において、PMATは最先端のアルゴリズムを上回り、調整効率を大幅に向上させることが示されました。
2025-02-23T08:30:14
Recent Advances in Large Langauge Model Benchmarks against Data Contamination: From Static to Dynamic Evaluation
http://arxiv.org/abs/2502.17521v1
Simin Chen, Yiming Chen, Zexin Li, Yifan Jiang, Zhongwei Wan, Yixin He, Dezhi Ran, Tianle Gu, Haizhou Li, Tao Xie, Baishakhi Ray
Columbia University, National University of Singapore, University of California, Riverside, University of Southern California, The Ohio State University, Peking University, Tsinghua University, The Chinese University of Hong Kong, Shenzhen
データ汚染は、膨大なインターネット由来のトレーニングコーパスに依存する大規模言語モデル(LLMs)の時代において、ますます注目を集めています。データ汚染の潜在的なリスクを軽減するために、LLMのベンチマークは静的から動的ベンチマークへの変革を遂げました。本研究では、データ汚染リスクを削減することを目的とした既存の静的から動的ベンチマーク手法に関する詳細な分析を行います。まず、静的ベンチマークを強化する方法を検討し、それらの内在的な限界を特定します。次に、動的ベンチマークを評価するための標準化された基準の欠如という重要なギャップを浮き彫りにします。この観察に基づき、動的ベンチマークの最適設計原則の一連を提案し、既存の動的ベンチマークの限界を分析します。この調査は、データ汚染研究の最近の進展に関する簡潔かつ包括的な概要を提供し、貴重な洞察と今後の研究努力のための明確なガイドを提供します。私たちは、静的および動的ベンチマーク手法を継続的に収集するためのGitHubリポジトリを維持しています。このリポジトリは、こちらのリンクで見ることができます。
2025-02-23T08:18:37
On Computational Limits of FlowAR Models: Expressivity and Efficiency
http://arxiv.org/abs/2502.16490v1
Chengyue Gong, Yekun Ke, Xiaoyu Li, Yingyu Liang, Zhizhou Sha, Zhenmei Shi, Zhao Song
The University of Texas at Austin, Independent Researcher, University of New South Wales, The University of Hong Kong, University of Wisconsin-Madison, Tsinghua University, The Simons Institute for the Theory of Computing at UC Berkeley
深層視覚生成モデル、例えばフローベースモデルや自己回帰(AR)モデルの表現力と計算複雑性は、生成タスクにおける広範な応用に対する関心を集めています。しかし、[Ren et al., 2024]によって提案されたFlowARのような最先端アーキテクチャにおける表現力の理論的特徴付けは、特に回路の複雑性の観点からは十分に探求されていません。このギャップは、それらの本質的な計算限界や実用的な効率に対する理解を制限します。本研究では、FlowARアーキテクチャの回路の複雑性を分析することによってこのギャップに対処します。FlowARモデルが生成する最大の特徴マップの次元が$n \times n \times c$であるとき、FlowARモデルは深さが一定の$\mathsf{TC}^0$の閾値回路のファミリーによってシミュレート可能であることを示します。これにより、ポリノミナル幅$\mathrm{poly}(n)$を持つ回路を利用します。これは、FlowARモデルの表現力の制限を厳密に強調する初めての研究です。さらに、FlowARモデルの計算がほぼ二次的な時間を達成できる条件を特定します。理論的な発見を検証するために、導出した基準に合致する低ランク近似に基づく効率的なモデル変種の構築を提示します。我々の研究は、他の生成パラダイムとの将来の比較のための基盤を提供し、より効率的で表現力豊かな実装の開発を導くものです。
2025-02-23T08:07:35
A Split-Window Transformer for Multi-Model Sequence Spammer Detection using Multi-Model Variational Autoencoder
http://arxiv.org/abs/2502.16483v1
Zhou Yang, Yucai Pang, Hongbo Yin, Yunpeng Xiao
Chongqing University of Posts and Telecommunications, University of Electronic Science and Technology of China
この論文では、MS$^2$Dformerと呼ばれる新しいトランスフォーマーが紹介されており、マルチモーダルなスパム検出の一般化されたバックボーンとして使用できるものです。スパム検出は複雑なマルチモーダルタスクであり、したがってトランスフォーマーを適用する際の課題は二重です。第一に、ユーザーに関する複雑なマルチモーダルノイズ情報は、特徴抽出を妨げる可能性があります。第二に、ユーザーの過去の行動の長いシーケンスは、注意計算に対して巨大なGPUメモリの負荷をかけます。これらの問題を解決するために、まずマルチモーダル変分オートエンコーダー(MVAE)に基づくユーザー行動トークナイゼーションアルゴリズムを設計します。続いて、階層的なスプリットウィンドウマルチヘッドアテンション(SW/W-MHA)メカニズムを提案します。スプリットウィンドウ戦略は、超長シーケンスを内部ウィンドウの短期および外部ウィンドウの全体的な注意の組み合わせに階層的に変換します。公共データセットで事前訓練されたMS$^2$Dformerの性能は、従来の最先端技術を大きく上回ります。実験は、MS$^2$Dformerがバックボーンとして機能する能力を示しています。
2025-02-23T07:53:08
Unmasking Societal Biases in Respiratory Support for ICU Patients through Social Determinants of Health
http://arxiv.org/abs/2502.16477v1
Mira Moukheiber, Lama Moukheiber, Dana Moukheiber, Hyung-Chul Lee
Massachusetts Institute of Technology, Seoul National University
危機管理の現場では、正確で迅速な介入が健康結果にとって重要であり、患者の結果の格差を評価することが不可欠です。現在のアプローチでは、健康の社会的決定要因に影響を受ける個人に対する呼吸サポート介入の影響を十分に把握できていないことが多いです。性別、人種、年齢などの属性は一般的に評価され、有益な洞察を提供しますが、多様な集団が直面する複雑さの一部しか示していません。この研究では、長期機械換気と成功した離脱という二つの臨床的に重要な課題に焦点を当てています。さらに、集中治療室における呼吸介入の健康格差をより理解するために、人口統計群や健康の社会的決定要因にわたるモデルの予測に関して公正性監査を行います。加えて、臨床専門家によって検証された時間的ベンチマークデータセットを公開し、臨床呼吸介入タスクのベンチマーキングを促進します。
2025-02-23T07:23:15
Dragen3D: Multiview Geometry Consistent 3D Gaussian Generation with Drag-Based Control
http://arxiv.org/abs/2502.16475v1
Jinbo Yan, Alan Zhao, Yixin Hu
Tencent
単一画像からの3D生成は、仮想現実、3Dモデリング、およびデジタルコンテンツの作成において重要な研究テーマとして浮上しています。しかし、既存の手法には、マルチビュー幾何学的一貫性の欠如や生成プロセス中の制御の限界などの課題があり、その利用可能性を大きく制限しています。これらの課題に対処するために、私たちは3Dガウススプラッティング(3DGS)を活用した幾何学的一貫性と制御可能な3D生成を実現する新しいアプローチであるDragen3Dを提案します。ここでは、点群と単一画像をアンカーラテンと呼ばれるものにエンコードし、これらのラテンを3DGSにデコードするアンカーガウシアン変分オートエンコーダ(Anchor-GSVAE)を導入します。これにより、効率的な潜在空間生成が可能になります。マルチビュー幾何学的一貫性と制御可能な生成を実現するために、私たちはシードポイント駆動戦略を提案します:まず、粗い幾何学的表現としてスパースシードポイントを生成し、それらをシード・アンカー・マッピングモジュールを通じてアンカーラテンにマッピングします。幾何学的一貫性は、簡単に学習可能なスパースシードポイントによって保証され、ユーザーは最終的な3DGSの幾何を変形するためにシードポイントを直感的にドラッグでき、その変更がアンカーラテンを通じて伝播します。私たちの知る限り、2Dディフュージョンプライヤーに依存することなく、幾何学的に制御可能な3Dガウス生成と編集を実現したのは初めてであり、最先端の手法に匹敵する3D生成品質を提供します。
2025-02-23T07:19:03
FreeTumor: Large-Scale Generative Tumor Synthesis in Computed Tomography Images for Improving Tumor Recognition
http://arxiv.org/abs/2502.18519v1
Linshan Wu, Jiaxin Zhuang, Yanning Zhou, Sunan He, Jiabo Ma, Luyang Luo, Xi Wang, Xuefeng Ni, Xiaoling Zhong, Mingxiang Wu, Yinghua Zhao, Xiaohui Duan, Varut Vardhanabhuti, Pranav Rajpurkar, Hao Chen
腫瘍は、世界中で主要な死因であり、年間約1000万人が腫瘍関連疾患に起因する死亡と推定されています。AI駆動の腫瘍認識は、より正確でインテリジェントな腫瘍スクリーニングと診断のための新しい可能性を開きます。しかし、進展は厳密に注釈付けされたデータセットの不足によって大きく妨げられており、これには放射線科医による広範な注釈付け作業が必要です。この課題に対処するために、私たちはFreeTumorという革新的な生成AI(GAI)フレームワークを導入し、データ不足を緩和するための大規模な腫瘍合成を可能にします。具体的に言えば、FreeTumorは、腫瘍合成トレーニングのために限定されたラベル付きデータと大規模なラベルなしデータの組み合わせを効果的に活用します。大規模なデータの力を引き出すことで、FreeTumorは、トレーニングデータセットを拡張するために画像上で多数の現実的な腫瘍を合成することができます。この目的のために、私たちは33のソースから161,310の公開されたCTボリュームを整理し、腫瘍が注釈付けされているのはわずか2.3%に過ぎない、腫瘍合成と認識のための最大のトレーニングデータセットを作成しました。合成腫瘍の信頼性を検証するために、私たちは視覚的チューリングテストに参加する13人のボード認定放射線科医を巻き込み、合成腫瘍と真の腫瘍を区別しました。厳格な医師の評価により、私たちの合成腫瘍の品質が高いことが確認され、合成腫瘍と実際の腫瘍を区別する際にはわずか51.1%の感度と60.8%の精度しか達成できませんでした。高品質な腫瘍合成を通じて、FreeTumorは認識トレーニングデータセットを40倍以上にスケールアップし、さまざまな合成方法や基盤モデルを含む最先端のAI方法に対して顕著な優位性を示しています。これらの発見は、臨床応用におけるFreeTumorの有望な展望を示し、腫瘍治療の進展や患者の生存率の向上につながる可能性があります。
2025-02-23T07:00:09
Cross-domain Few-shot Object Detection with Multi-modal Textual Enrichment
http://arxiv.org/abs/2502.16469v1
Zeyu Shangguan, Daniel Seita, Mohammad Rostami
クロスモーダル特徴抽出と統合の進展により、少数ショット学習タスクにおける性能が大幅に向上しました。しかし、現在のマルチモーダル物体検出(MM-OD)手法は、かなりのドメインシフトに直面するとパフォーマンスの著しい低下を経験することがよくあります。我々は、豊富なテキスト情報を取り入れることで、モデルが視覚的インスタンスとそれに対応する言語記述との間により堅牢な知識の関係を構築できるようになり、ドメインシフトの課題を軽減できると提案します。具体的には、クロスドメインマルチモーダル少数ショット物体検出(CDMM-FSOD)の問題に焦点を当て、豊富なテキストのセマンティクスを補助的なモダリティとして活用するために設計されたメタ学習ベースのフレームワークを紹介します。私たちの新しいアーキテクチャは、次の二つの重要なコンポーネントを組み込んでいます。(i)視覚的かつ言語的特徴埋め込みを整合させ、モダリティ間での一貫した統合を確保するマルチモーダル特徴集約モジュール。(ii)双方向テキスト特徴生成を用いてマルチモーダル特徴の整列を精緻化し、言語の理解と物体検出への応用を強化する豊富なテキストセマンティクス修正モジュール。提案手法を一般的なクロスドメイン物体検出ベンチマークで評価し、既存の少数ショット物体検出アプローチを大幅に上回ることを示しました。
2025-02-23T06:59:22
Swallowing the Poison Pills: Insights from Vulnerability Disparity Among LLMs
http://arxiv.org/abs/2502.18518v1
Peng Yifeng, Wu Zhizheng, Chen Chen
Chinese University of Hong Kong (Shenzhen)
現代の大規模言語モデル(LLM)は、特定の事実的知識を変更しながら全体のモデルの有用性を保持する局所的なデータポイズニングを用いた毒薬攻撃に対して重要な脆弱性を示しています。私たちは、これらの攻撃がLLMの固有のアーキテクチャプロパティを悪用することを体系的に示し、支配的なトピックに対して長尾知識の取得不正確さが54.6%増加し、圧縮モデルが元のアーキテクチャに対して最大25.5%の取得不正確さの増加を達成することを実証しました。制御された突然変異(例えば、時間的/空間的/エンティティの変更)を通じて、私たちの手法は、通常の標準ベンチマーク(例えば、MMLU/GPQAでの性能低下が2%未満)に対するモデルの性能にはほとんど影響を与えずに局所的な記憶低下を引き起こし、検出回避の可能性を生み出します。私たちの発見は以下を示唆しています:(1)長尾知識における脆弱性の不均衡はパラメータの冗長性が低下したことに起因する可能性がある;(2)モデルの圧縮は攻撃面を増加させ、剪定/蒸留されたモデルは同等の損害を与えるために必要な毒サンプルを30%少なくする;(3)連想記憶は、関連概念への collateral damage の広がりと同時攻撃からの損害の増幅を可能にする、特に支配的なトピックにおいて。これらの発見は、攻撃コストが低下している一方で防御の複雑さが増加している現行のスケーリングパラダイムに対する懸念を引き起こします。私たちの研究は、毒薬剤がセキュリティリスクおよび診断ツールの両方として機能し、安全性の仮定を挑戦する言語モデルの圧縮における重要なセキュリティ効率のトレードオフを明らかにすることを確立します。
2025-02-23T06:34:55
Deep learning approaches to surgical video segmentation and object detection: A Scoping Review
http://arxiv.org/abs/2502.16459v1
Devanish N. Kamtam, Joseph B. Shrager, Satya Deepya Malla, Nicole Lin, Juan J. Cardona, Jake J. Kim, Clarence Hu
はじめに:コンピュータビジョン(CV)は、放射線科、皮膚科、病理学などの医療分野において画期的な影響を与えています。しかし、手術における実際の応用は限られています。本レビューでは、手術中に取得されたビデオにおける解剖学的構造のセグメンテーションおよび物体検出のためのディープラーニング(DL)に基づくCVモデルの最新のパフォーマンスについて考察します。
方法:2014年から2024年の間に発表された解剖学的構造のセマンティックセグメンテーションおよび物体検出に関する研究のスコーピングレビューを、PubMed、Embase、IEEE Xploreの3つの主要データベースで実施しました。主な目的は、手術ビデオにおけるセマンティックセグメンテーションの最新のパフォーマンスを評価することでした。副次的な目的には、DLモデルの検討、臨床応用への進展、および手術ビデオにおける臓器や組織のセグメンテーションに関する具体的な課題の検証が含まれました。
結果:関連する58の発表された研究を特定しました。これらは主に一般外科[20件(34.4%)]、大腸外科[9件(15.5%)]、および神経外科[8件(13.8%)]に焦点を当てていました。胆嚢摘出術[14件(24.1%)]と低前方直腸切除術[5件(8.6%)]が取り上げられた最も一般的な手術でした。セマンティックセグメンテーション[47件(81%)]が主要なCVタスクでした。U-Net[14件(24.1%)]とDeepLab[13件(22.4%)]が最も広く使用されたモデルです。肝臓のような大きな臓器(Diceスコア:0.88)は、神経のような小さな構造(Diceスコア:0.49)に比べて高い精度を示しました。モデルは、5〜298フレーム毎秒(fps)でのリアルタイム推論の可能性を示しました。
結論:このレビューは、特に大きな臓器に対するリアルタイム適用性を持つ手術ビデオのDLに基づくセマンティックセグメンテーションにおいて大きな進展があったことを強調しています。小さな構造、データの可用性、一般化性に関する課題に取り組むことが、今後の進展のために重要であることを示しています。
2025-02-23T06:31:23
Facilitating Emergency Vehicle Passage in Congested Urban Areas Using Multi-agent Deep Reinforcement Learning
http://arxiv.org/abs/2502.16449v1
Haoran Su
緊急対応時間(ERT)は都市の安全にとって非常に重要であり、医療、火災、犯罪の緊急事態への対応能力を測るものです。ニューヨーク市では、医療のERTが2014年の7.89分から2024年には14.27分に72%増加し、そのうち半分の遅延が緊急車両(EMV)の移動時間によるものでした。脳卒中の応答が1分遅れるごとに200万の脳細胞が失われ、心停止の生存率は1分ごとに7~10%減少します。この論文は、EMVの円滑化を三つの貢献を通じて進めます。まず、EMVLightという分散型のマルチエージェント強化学習フレームワークは、EMVのルーティングと信号優先制御を統合しました。この結果、EMVの移動時間が42.6%短縮され、他の車両に対しても23.5%の改善を達成しました。次に、ダイナミックキュージャンプレーンシステムはマルチエージェント近接方針最適化を使用して、自動運転車両と人間が運転する交通の混合における協調的なレーンクリアリングを実現し、EMVの移動時間を40%削減しました。第三に、ニューヨーク市の緊急医療サービスの公平性に関する調査では、区ごとの格差が明らかになりました。スタテンアイランドは信号交差点が少ないために遅延が発生し、マンハッタンは渋滞に悩まされています。解決策には、最適化されたEMSステーションや改善された交差点設計が含まれます。これらの貢献はEMVの移動性と緊急サービスの公平性を向上させ、政策立案者や都市計画者がより安全で効率的な交通システムを開発するための洞察を提供します。
2025-02-23T05:34:32
Auxiliary Discrminator Sequence Generative Adversarial Networks (ADSeqGAN) for Few Sample Molecule Generation
http://arxiv.org/abs/2502.16446v1
Haocheng Tang, Jing Long, Junmei Wang
University of Pittsburgh, Peking University
本研究では、Auxiliary Discriminator Sequence Generative Adversarial Networks(ADSeqGAN)という、新規の小サンプルデータセットにおける分子生成のアプローチを紹介します。従来の生成モデルは、特にドラッグディスカバリーにおいて、特定の治療ターゲット(核酸結合剤や中枢神経系(CNS)薬など)に関連する分子データセットが不足しているため、限られたトレーニングデータで苦労することがよくあります。ADSeqGANは、この課題に対処するために、GANフレームワークに追加の識別器として補助的なランダムフォレスト分類器を統合し、分子生成の質とクラス特異性を大幅に向上させます。私たちの方法は、トレーニングの安定性と多様性を高めるために、事前学習された生成器とワッサースタイン距離を取り入れています。ADSeqGANを、核酸を標的とした小分子とタンパク質を標的とした小分子から成るデータセットで評価した結果、SeqGAN、ORGAN、MolGPTなどのベースラインモデルと比較して、核酸結合剤を生成する優れた能力を示しました。オーバーサンプリング戦略を通じて、ADSeqGANはCNS薬の生成を大幅に改善し、従来のデノボモデルよりも高い収率を達成しました。ドッキングシミュレーションや分子特性分析などの厳密な評価により、ADSeqGANが生成した分子は強い結合親和性、向上した化学的多様性、改良された合成可能性を示すことが確認されました。全体として、ADSeqGANはデータが乏しい状況における生成的分子設計の新しいフレームワークを提示しており、計算薬剤発見における潜在的な応用を提供します。本研究では、ADSeqGANを用いて合成核酸標的薬剤およびCNS薬剤を生成する成功事例を示しました。
2025-02-23T05:22:53
Iterative Flow Matching -- Path Correction and Gradual Refinement for Enhanced Generative Modeling
http://arxiv.org/abs/2502.16445v2
Eldad Haber, Shadab Ahamed, Md. Shahriar Rahim Siddiqui, Niloufar Zakariaei, Moshe Eliasof
The University of British Columbia, University of Cambridge
画像生成のための生成モデルは、エンターテインメント向けのガイド付き画像生成から逆問題の解決に至るまで、さまざまなアプリケーションで一般的に使用されています。それにもかかわらず、ジェネレーターのトレーニングは重要な技術であり、微調整が必要で、非現実的な画像の生成、つまり「幻覚」と呼ばれる現象を引き起こすことがあります。本研究では、フロー・マッチングを使用した画像生成について探求します。フロー・マッチングがなぜ幻覚を生成するのかを説明し実証し、生成プロセスを改善するための反復プロセスを提案します。この反復プロセスは、実質的に「任意」の生成モデリング技術に統合可能であり、画像合成システムの性能と堅牢性を向上させることができます。
2025-02-23T05:08:06
Ensemble RL through Classifier Models: Enhancing Risk-Return Trade-offs in Trading Strategies
http://arxiv.org/abs/2502.17518v1
Zheli Xiong
この論文は、金融取引戦略におけるアンサンブル強化学習(RL)モデルの使用に関する包括的な研究を提示し、パフォーマンスを向上させるために分類子モデルを活用します。A2C、PPO、SACなどのRLアルゴリズムをサポートベクターマシン(SVM)、決定木、ロジスティック回帰などの従来の分類器と組み合わせることにより、異なる分類子群がどのように統合されてリスクとリターンのトレードオフを改善できるかを調査します。この研究では、さまざまなアンサンブル手法の有効性を評価し、Cumulative Returns(累積リターン)、Sharpe Ratios(シャープレシオ)、Calmar Ratios、およびMaximum Drawdown(最大ドローダウン)などの主要な金融指標において個々のRLモデルと比較します。我々の結果は、アンサンブル手法がリスク調整後のリターンの観点で基本モデルを一貫して上回り、ドローダウンの管理と全体的な安定性を提供することを示しています。しかし、アンサンブルのパフォーマンスが分散しきい値 {\tau} の選択に敏感であることを特定し、最適なパフォーマンスを達成するための動的 {\tau} 調整の重要性を強調しています。この研究は、適応的意思決定のためにRLと分類器を組み合わせる価値を強調しており、金融取引、ロボティクス、および他の動的環境への影響を持っています。
2025-02-23T04:18:05
Sequence-level Large Language Model Training with Contrastive Preference Optimization
http://arxiv.org/abs/2502.16433v1
Zhili Feng, Dhananjay Ram, Cole Hawkins, Aditya Rawal, Jinman Zhao, Sheng Zha
Carnegie Mellon University, AWS, AGI Foundation
次のトークン予測損失は、大規模言語モデルの主要な自己教師あり学習の目的であり、さまざまな下流タスクで有望な結果を達成しています。しかし、この目的を詳しく調査すると、シーケンスレベルの信号の理解が欠けていることがわかり、トレーニングと推論プロセスの間にミスマッチが生じています。このギャップを埋めるために、私たちは、コントラスト優先最適化(CPO)手法を導入します。この手法は、コストのかかる人間のラベル付きデータなしで、任意のトレーニング段階でシーケンスレベルの情報を言語モデルに注入できます。私たちの実験では、提案された目的が、指示に従うタスクやテキスト生成タスクにおいて、次のトークン予測を凌駕する勝率を示しました。
2025-02-23T04:13:27
Visual Reasoning Evaluation of Grok, Deepseek Janus, Gemini, Qwen, Mistral, and ChatGPT
http://arxiv.org/abs/2502.16428v1
Nidhal Jegham, Marwan Abdelatti, Abdeltawab Hendawi
Providence College
従来のマルチモーダル大型言語モデル(LLMs)の評価は、単一画像の推論に焦点を当てることが制限となり、文脈理解、推論の安定性、そして不確実性のキャリブレーションといった重要な側面を評価できていませんでした。本研究は、マルチ画像推論タスクを拒否ベースの評価や位置バイアス検出と統合した新しいベンチマークを導入することで、これらの制限に対処します。これらの次元を評価するために、私たちはさらにエントロピーを新しい指標として導入し、順序が入れ替えられた回答のバリエーション間での推論の一貫性を定量化します。このベンチマークを使用して、Grok 3、ChatGPT-4o、ChatGPT-o1、Gemini 2.0 Flash Experimental、DeepSeek Janusモデル、Qwen2.5-VL-72B-Instruct、QVQ-72B-Preview、Pixtral 12Bの8つの視覚推論タスク(差異認識や図解解釈を含む)を評価しました。私たちの調査結果は、全体の正確性(82.5%)と拒否正確性(70.0%)でChatGPT-o1がリードし、Gemini 2.0 Flash Experimentalが70.8%で続くことを示しています。QVQ-72B-Previewは優れた拒否正確性(85.5%)を示しました。特に、Pixtral 12B(51.7%)は特定の領域での可能性を示し、Janusモデルはバイアスや不確実性のキャリブレーションにおいて課題を示しました。これは、低い拒否正確性と高いエントロピー値に反映されています。Janusモデルの高いエントロピー値(Janus 7B: 0.8392, Janus 1B: 0.787)は、位置バイアスや不安定な推論に対する感受性を強調し、ChatGPTモデルの低いエントロピーと堅牢な推論と対照的です。この研究はさらに、モデルのサイズが性能の唯一の決定要因ではないことを示しています。これは、Grok 3がパラメータ数がかなりあっても性能が劣っていることからも明らかです。マルチ画像コンテキスト、拒否メカニズム、エントロピーに基づく一貫性指標を使用することにより、このベンチマークはマルチモーダルLLMsを評価する新たなスタンダードを確立し、次世代AIシステムのより堅牢で信頼性のある評価を可能にします。
2025-02-23T04:01:43
Attention-based UAV Trajectory Optimization for Wireless Power Transfer-assisted IoT Systems
http://arxiv.org/abs/2502.17517v1
Li Dong, Feibo Jiang, Yubo Peng
Hunan University of Technology and Business, Xiangjiang Laboratory, Hunan Normal University, Nanjing University
無人航空機(UAV)がワイヤレス電力伝送(WPT)を支援するInternet of Things(IoT)システムで直面する課題は、限られたリソースと最適でない軌道計画です。強化学習に基づく軌道計画方式は、大規模システムを最適化する際に、検索効率が低く学習が不安定になるという問題に直面します。これらの問題に対処するために、グラフトランスフォーマーに基づく注目型UAV軌道最適化(AUTO)フレームワークを提案します。このフレームワークは、注意軌道最適化モデル(ATOM)と、アクター-クリティックに基づく軌道学習方法(TENMA)で構成されています。ATOMでは、グラフエンコーダを使用してすべてのIoTDの自己注意特性を計算し、UAVの数と軌道を最適化するための軌道デコーダが開発されます。次に、TENMAが改良されたアクター-クリティック方式を使用してATOMを訓練します。この訓練では、システムの実際の報酬が基準として適用され、クリティックネットワークのばらつきを減少させます。この方法は、高品質で大規模な複数UAVの軌道計画に適しています。最後に、AUTOフレームワークの実現可能性と効率を検証するために、フィールドケースでのハードウェア実験を含む多数の実験を開発します。
2025-02-23T02:57:06
RewardDS: Privacy-Preserving Fine-Tuning for Large Language Models via Reward Driven Data Synthesis
http://arxiv.org/abs/2502.18517v1
Jianwei Wang, Junyao Yang, Haoran Li, Huiping Zhuang, Cen Chen, Ziqian Zeng
South China University of Technology, Pazhou Laboratory, Hong Kong University of Science and Technology
大規模言語モデル(LLM)の成功は、多くの人々が自分のデータをアップロードして、特定のドメインに特化したタスクに微調整することを引き付けました。しかし、医療や金融などの敏感な領域では、プライバシーの懸念がしばしば浮上します。一つの有望な解決策は、プライバシーを保証するディファレンシャルプライバシー(DP)を用いて合成データをサンプリングし、プライベートデータを置き換えることです。しかし、これらの合成データにはノイズと見なされる重大な欠陥データが含まれています。既存の解決策は、通常、ROUGE-Lスコアや埋め込みの類似性を比較する単純なフィルタリングに依存しており、ノイズに対処するには効果的ではありません。この問題に対処するために、私たちはRewardDSという新しいプライバシー保護フレームワークを提案し、報酬プロキシモデルを微調整し、報酬信号を使用して合成データ生成を導きます。私たちのRewardDSは、合成データをフィルタリングおよび精緻化するための報酬誘導フィルタリングと自己最適化リファインメントという2つの重要なモジュールを導入し、効果的にノイズを軽減します。医療、金融、コード生成の各ドメインにおける広範な実験により、私たちの手法の有効性が実証されました。
2025-02-23T02:52:23
TabGen-ICL: Residual-Aware In-Context Example Selection for Tabular Data Generation
http://arxiv.org/abs/2502.16414v1
Liancheng Fang, Aiwei Liu, Hengrui Zhang, Henry Peng Zou, Weizhi Zhang, Philip S. Yu
University of Illinois Chicago, Tsinghua University
大規模言語モデル(LLM)は、表形式データ生成において励みになる結果を達成しています。しかし、既存のアプローチではファインチューニングが必要であり、これには計算コストがかかります。本論文では、固定されたLLMにインコンテキストの例を提示するという代替手段を探ります。我々は、ランダムに選ばれたインコンテキストの例を使用すると、LLMのパフォーマンスが低下し、生成品質が最適でなくなることを観察しました。これに対処するために、表形式データ生成のためにLLMのインコンテキスト学習能力を強化する新しいインコンテキスト学習フレームワークであるTabGen-ICLを提案します。TabGen-ICLは反復的に動作し、現在生成されたサンプルと真のデータ分布との残差を表す実際のサンプルのサブセットを取得します。このアプローチには二つの目的があります。まず、ローカルな視点では、各反復でLLMに対してより効果的なインコンテキスト学習例を提供します。次に、グローバルな視点では、生成されたデータと実データとのギャップを徐々に狭めます。五つの実世界の表形式データセットでの広範な実験により、TabGen-ICLはランダム選択戦略に対して大幅に優れていることが実証されました。具体的には、忠実度メトリクスにおいてエラーレートを$3.5\%-42.2\%$の幅で減少させます。固定されたLLMにプロンプトを与えることで高品質の合成表形式データを得られることを初めて示しました。コードは\href{https://github.com/fangliancheng/TabGEN-ICL}{こちら}で提供されています。
2025-02-23T02:51:58
Tool or Tutor? Experimental evidence from AI deployment in cancer diagnosis
http://arxiv.org/abs/2502.16411v1
Vivianna Fang He, Sihan Li, Phanish Puranam
専門家は、能力を高め、タスクの実行を支援するために、人工知能(AI)をますます多く利用しています。これまでの研究はこれらの使用法を別々に検討してきましたが、それらの相互作用の可能性は十分に探究されていません。私たちは、AI駆動のトレーニング(指導効果)とAI支援によるタスク完了(ツール効果)が相補的であることを提案し、この仮説を肺癌の診断の文脈で検証しました。334人の医学部生を対象としたフィールド実験では、トレーニング、実践、またはその両方におけるAIの導入を操作しました。我々の結果は、AI統合トレーニングとAI支援がそれぞれ独立して診断パフォーマンスを改善した一方で、両者を組み合わせることで最高の精度が得られることを明らかにしました。これらの結果は、学習とリアルタイムのサポートの両方を通じて人間のパフォーマンスを向上させるAIの二重の役割を強調しており、人間の専門知識が依然として重要な専門的な環境におけるAIの展開に関する洞察を提供します。
2025-02-23T02:47:49
TrustChain: A Blockchain Framework for Auditing and Verifying Aggregators in Decentralized Federated Learning
http://arxiv.org/abs/2502.16406v1
Ehsan Hallaji, Roozbeh Razavi-Far, Mehrdad Saif
University of Windsor, University of New Brunswick, Natural Sciences and Engineering Research Council of Canada (NSERC)
サーバーレスの特性を持つ分散型連合学習(DFL)では、各連合ラウンドで特定の参加者に集約役割を割り当てる必要があります。現在のDFLアーキテクチャは、選定時に集約者ノードの信頼性を確保しています。しかし、これらの研究の多くは、選任された後に集約ノードが悪意を持って行動する可能性を見落としています。この問題に対処するために、本論文ではTrustChainと呼ばれるDFL構造を提案し、過去の行動に基づいて選定前に集約者をスコアリングし、集約後にさらに監査を行います。これを実現するために、クライアントの更新と集約されたモデルの間の統計的独立性を、ヒルベルト・シュミット独立性基準(HSIC)を使用して継続的に監視します。提案された方法は、ブロックチェーン、異常検出、概念漂流分析などのいくつかの原則に依存しています。設計された構造は、異なる数のビザンチンノードを持つ複数の連合データセットと攻撃シナリオで評価されます。
2025-02-23T02:26:17
Navigation-GPT: A Robust and Adaptive Framework Utilizing Large Language Models for Navigation Applications
http://arxiv.org/abs/2502.16402v1
Feng Ma, Xiu-min Wang, Chen Chen, Xiao-bin Xu, Xin-ping Yan
whut.edu.cn, wit.edu.cn, hdu.edu.cn
既存のナビゲーション意思決定支援システムは、定義されていないナビゲーションシナリオを扱う際にしばしば効果が薄くなります。本研究では、未知のシナリオを扱う際の大規模言語モデル(LLM)の一般化能力を活用し、この問題に対処するためにLLMアプリケーションのためのデュアルコアフレームワークを提案します。まず、ReActベースのプロンプトエンジニアリングを通じて、大規模LLMコアが複雑なナビゲーションタスクを管理可能なサブタスクに分解し、関連情報を収集するために自律的に対応する外部ツールを呼び出します。このフィードバックを使用して、LLMの幻想によるリスクを軽減します。次に、ファインチューニングされたコンパクトなLLMコアがファーストメイトのように機能し、そうした情報や非構造的な外部データを処理し、文脈に応じた推奨事項を生成します。最終的には、国際衝突防止規則(COLREGs)やその他の規則に従った洞察およびナビゲーションヒントを提供します。広範な実験では、提案されたフレームワークが従来の船舶衝突回避タスクにおいて優れているだけでなく、非構造的、定義されていない、予測不可能なシナリオにも効果的に適応することが示されています。DeepSeek-R1、GPT-4o、その他の最先端モデルとの比較分析は、提案されたフレームワークの有効性と合理性を強調しています。本研究は、従来のナビゲーションシステムとLLMの間のギャップを埋め、様々なナビゲーションアプリケーションにおける安全性と運用効率を向上させるためのフレームワークを提供します。
2025-02-23T01:41:58
Ensemble ToT of LLMs and Its Application to Automatic Grading System for Supporting Self-Learning
http://arxiv.org/abs/2502.16399v1
Yuki Ito, Qiang Ma
Kyoto University, Kyoto Institute of Technology
学生に詳細でタイムリーな評価フィードバックを提供することは、自己学習にとって不可欠です。既存のLLMベースの評価システムは有望ですが、多くは単一のモデルに依存しており、そのパフォーマンスが制限されています。これに対処するために、私たちはEnsemble Tree-of-Thought(ToT)というフレームワークを提案します。このフレームワークは、複数のモデルを統合することによってLLMの出力を強化します。このフレームワークを使用して、評価システムを開発します。Ensemble ToTは3つのステップに従います:(1)LLMのパフォーマンスを分析する、(2)候補回答を生成する、(3)それらを最終結果に洗練する。この基に、私たちの評価システムはまずLLMの評価傾向を評価し、次に複数の結果を生成し、最後にシミュレーションされた討論を通じてそれらを統合します。実験結果は、複数のLLMを効果的に調整することで、正確で説明可能な評価を提供する私たちのアプローチの能力を示しています。
2025-02-23T01:17:46
FedNIA: Noise-Induced Activation Analysis for Mitigating Data Poisoning in FL
http://arxiv.org/abs/2502.16396v1
Ehsan Hallaji, Roozbeh Razavi-Far, Mehrdad Saif
フェデレーテッドラーニングシステムは、悪意のあるクライアントが改ざんされた更新を提供することでグローバルモデルを損なうデータポイズニング攻撃に対してますます脅威にさらされています。既存の防御策は、中央のテストデータセットへのアクセスなどの非現実的な仮定に依存していることが多いか、または特に複数の悪意のあるクライアントが協力して作業する場合など、多様な攻撃タイプに対して一般化できないことがあります。これに対処するために、私たちはフェデレーテッドノイズ誘発アクティベーション分析(FedNIA)を提案します。これは、中央のテストデータセットに依存せずに敵対的クライアントを特定し排除するための新しい防御フレームワークです。FedNIAは、オートエンコーダーを利用して異常な行動を検出し、データポイズニングを示すレイヤーごとのアクティベーションパターンを分析するために、ランダムなノイズ入力を注入します。FedNIAは、サンプルポイズニング、ラベルフリッピング、バックドアを含む多様な攻撃タイプに対して防御が可能であり、複数の攻撃ノードが存在するシナリオでも効果を発揮します。非独立同分布のフェデレーテッドデータセットでの実験結果は、その効果と堅牢性を示しており、フェデレーテッドラーニングシステムのセキュリティを強化するための基本的なアプローチとしての可能性を強調しています。
2025-02-23T01:16:01
An Analyst-Inspector Framework for Evaluating Reproducibility of LLMs in Data Science
http://arxiv.org/abs/2502.16395v1
Qiuhai Zeng, Claire Jin, Xinyue Wang, Yuhan Zheng, Qunhua Li
Pennsylvania State University, Carnegie Mellon University, International Monetary Fund
大規模言語モデル(LLM)は、コード生成を通じてデータサイエンスのタスクに対する可能性を示しています。しかし、データサイエンスの探索的な性質とLLMの確率的で不透明な出力は、その信頼性に対する懸念を引き起こします。従来の研究はLLMの精度のベンチマーキングに焦点を当てていますが、再現性は十分に探求されていません。これはLLM主導の分析に対する信頼を構築する上で重要です。私たちは、LLM生成のデータサイエンスワークフローの再現性を自動的に評価し強制する新しいアナリスト-インスペクターフレームワークを提案します。これは、私たちの知識の範囲内で最初の厳密なアプローチです。再現性を機能的に同等なコードを再生成するためのワークフローの十分性と完全性として定義し、このフレームワークは計算再現性の原則を強制し、暗黙のモデル前提への依存を最小限に抑えながら、透明で十分に文書化されたLLMワークフローを保証します。このフレームワークを使用して、私たちは、3つの多様なベンチマークデータセットにわたる1,032のデータ分析タスクにおける5つの最先端LLMを体系的に評価しました。また、2つの新しい再現性向上のためのプロンプト戦略を紹介します。私たちの結果は、より高い再現性が精度の向上と強く相関し、再現性向上のためのプロンプトが効果的であることを示しています。これにより、構造的プロンプトが自動化されたデータサイエンスワークフローを強化し、透明で堅牢なAI駆動の分析を可能にする潜在能力を示しています。私たちのコードは公開されています。
2025-02-23T01:15:50
An Expert Ensemble for Detecting Anomalous Scenes, Interactions, and Behaviors in Autonomous Driving
http://arxiv.org/abs/2502.16389v1
Tianchen Ji, Neeloy Chakraborty, Andre Schreiber, Katherine Driggs-Campbell
University of Illinois at Urbana-Champaign
自動運転車が公道に入るにつれて、無限に近い数の運転シナリオにおける安全性は、完全自動運転の普及における主要な課題の一つとなっています。運用設計ドメイン外の異常状況を検出する能力は、自動運転車において重要な要素であり、異常なエゴ行動の影響を軽減し、信頼性のある運転システムを実現するために必要です。自己中心的なビデオにおける道路上の異常検出は、複雑でインタラクティブなシナリオによって困難さが増すため、依然として挑戦的な問題です。我々は一般的な道路上の異常パターンについて包括的な分析を行い、異常なシーンや予期しないシーンの動きを検出するためにフレームレベルの外観に焦点を当てたシーン専門家、二つの道路参加者間の正常な相対運動をモデル化し、異常な相互作用が発生したときに警告を上げるインタラクション専門家、そして未来の軌道予測によって個別のオブジェクトの異常行動を監視する行動専門家の三つの教師なし異常検出専門家を提案します。すべてのモジュールの強みを組み合わせるために、我々はカーマンフィルターを用いた専門家アンサンブル(Xen)を提案し、最終的な異常スコアが状態の一つとして吸収され、観測値が専門家によって生成されるようにします。我々の実験では、現実的なモデルパフォーマンスのための新しい評価プロトコルを用い、以前の方法よりも優れた異常検出性能を示し、我々のフレームワークが大規模な道路上の異常データセットに対して教師なし学習を用いて異常タイプを分類する可能性を持っていることを示しています。
2025-02-23T00:43:23
2025-02-22 arXiv論文リスト(cs.AI)
About
arXivに掲載されたcs.AIの論文を検索し、一部をリスト化したものです。
※AIによってAbstractを日本語に翻訳しており、内容に誤りがある可能性があります。
リスト件数: 63件
リストから抽出されたキーワード: Multimodal Learning, Personalized AI, Adversarial Robustness
Understanding Fixed Predictions via Confined Regions
http://arxiv.org/abs/2502.16380v1
Connor Lawless, Tsui-Wei Weng, Berk Ustun, Madeleine Udell
Stanford University, University of California, San Diego
機械学習モデルは、個人に関する特徴を使用して結果を予測するように設計されていますが、個人がそれを変えることができる方法を考慮していません。その結果、モデルは、個人が自らの結果を変える手段を否定する固定された予測を割り当てることがあります。本研究では、すべての個人が固定された予測を受け取る限られた領域を見つけることによって、固定予測を特定するための新しいパラダイムを開発します。このタスクのために、混合整数二次制約プログラミングのツールを使用して、ReVerという最初のメソッドを導入します。私たちのアプローチは、サンプル外データに対する救済を証明し、限られた領域の解釈可能な説明を提供し、実世界のデータセットで数秒で実行します。さまざまなアプリケーションにわたる限られた領域の包括的な実証研究を行います。私たちの結果は、既存のポイントごとの検証手法が限られた領域を発見するのに失敗している一方で、ReVerは確実に成功することを強調しています。
2025-02-22T23:06:10
Auto-ADMET: An Effective and Interpretable AutoML Method for Chemical ADMET Property Prediction
http://arxiv.org/abs/2502.16378v1
Alex G. C. de Sá, David B. Ascher
Baker Heart and Diabetes Institute, The University of Queensland, The University of Melbourne
機械学習(ML)は、近年の医薬品発見において重要な役割を果たしてきました。化学化合物がウェットラボ実験を通過する優先順位を付けるための(前)スクリーニングツールを提供しています。医薬品発見における主なMLタスクの1つは、化学化合物の分子構造とその活性または特性を関連付ける定量的構造-活性関係(QSAR)モデルを構築することです。これらの特性—吸収、分配、代謝、排泄、毒性(ADMET)—は、化合物の挙動、活動、そして生体内での相互作用をモデル化する上で不可欠です。いくつかの方法が存在しますが、その大多数は適切なモデルの個別化を提供せず、バイアスや新しいデータへの一般化の欠如を引き起こします。これは、化学空間が通常、アプリケーションごとに変化するため、新しいデータをモデルでテストする際に予測性能が低下することにつながります。この問題を解決するために、自動化機械学習(AutoML)の領域が登場し、そのデータに応じたカスタマイズされたMLアルゴリズムを出力します。重要なタスクではありますが、AutoMLはしばしば化学情報学や計算化学の研究者を支援するために実際に利用されておらず、関連する研究は非常に限られています。これらの課題に対処するために、本研究は化学ADMET特性予測のための解釈可能な進化的AutoML手法「Auto-ADMET」を紹介します。Auto-ADMETは、ベイズネットワークモデルと共に文法ベースの遺伝的プログラミング(GGP)手法を採用し、12の標準的な化学ADMET特性予測データセットに対して、標準GGP法、pkCSM、XGBOOSTモデルの3つの代替手法と比較して同等またはそれ以上の予測性能を達成します。Auto-ADMETの進化的プロセスにおけるベイズネットワークモデルの使用は、検索手順の形成とAutoMLの性能の原因を解釈することの両方に寄与しました。
2025-02-22T22:54:08
Does Your AI Agent Get You? A Personalizable Framework for Approximating Human Models from Argumentation-based Dialogue Traces
http://arxiv.org/abs/2502.16376v1
Yinxu Tang, Stylianos Loukas Vasileiou, William Yeoh
説明可能なAIは、AIエージェントと人間ユーザーとの間でインタラクティブな説明を促進するために、ますます論証手法を採用しています。既存のアプローチは通常、あらかじめ定められた人間ユーザーモデルに依存していますが、インタラクション中にこれらのモデルを動的に学習し、更新するという重要なギャップが残っています。本論文では、AIエージェントが論証ベースの対話を通じて人間ユーザーの理解を適応させることを可能にするフレームワークを提案します。我々のアプローチ「Persona」は、期待理論を基にしており、交換された論証に基づいて可能な人間モデルの確率分布を洗練するベイジアン信念更新メカニズムと確率重み付け関数を統合しています。適用された論証設定における人間ユーザーとの実証評価を通じて、Personaが進化する人間の信念を効果的に捉え、個別化されたインタラクションを促進し、最先端の手法を上回ることを示します。
2025-02-22T22:37:16
Personhood Credentials: Human-Centered Design Recommendation Balancing Security, Usability, and Trust
http://arxiv.org/abs/2502.16375v1
Ayae Ide, Tanusree Sharma
Pennsylvania State University
関連する概念、例えば分散型識別子(DID)、人間性の証明、匿名の認証情報に基づいて、人間性認証(PHC)が新たなアプローチとして登場しました。これにより、個人は追加情報を開示することなく、デジタルサービスプロバイダーに対して自分が人間であることを確認することができます。ただし、新しい技術はユーザーの誤解や期待の不一致により摩擦を引き起こす可能性があります。重要性が高まるにもかかわらず、PHCに関するユーザーの認識や好みに関する研究は限られています。このギャップに対処するため、私たちは競合分析と米国およびEUからの23人の参加者との半構造化されたオンラインユーザーインタビューを実施し、ユーザーのニーズ、採用ルール、好みを取り入れたPHCの具体的なデザイン提案を提供しました。我々の研究は、(a) PHCの未知のプライバシーおよびセキュリティ保証について、人々がどのように考えるかを現行の確認方法と比較して明らかにし、(b) 人々がPHCをどのように導入し管理したいかに対するいくつかの要因の影響、例えば信頼できる発行者(例:政府)、PHCを発行するための基礎データ(例:バイオメトリクス、物理的ID)、発行システム(例:中央集権型か分散型か)を示しています。思考を声に出して行う概念設計セッションでは、参加者は、定期的なバイオメトリクスの確認、期限付きの認証、視覚的にインタラクティブな人間チェック、発行システムにおける政府の監視などの概念的なデザインを提案しました。私たちは、ユーザーの好みを反映した実行可能なデザインを提案します。
2025-02-22T22:33:00
A generative approach to LLM harmfulness detection with special red flag tokens
http://arxiv.org/abs/2502.16366v1
Sophie Xhonneux, David Dobre, Mehrnaz Mohfakhami, Leo Schwinn, Gauthier Gidel
大規模言語モデル(LLM)のためのほとんどの安全性トレーニング方法は、調整によって有害なリクエストに直面したときにモデルの出力分布を劇的に変更し、安全でない応答から応答を拒否する方向にシフトさせます。これらの方法は本質的にモデルの能力を妥協させるものであり、自己回帰モデルが肯定的な応答の初期トークンを生成する攻撃に対して脆弱になる可能性があります。それを避けるために、私たちはモデルの語彙を赤信号トークン(<rf>)と呼ばれる特別なトークンで拡張することを提案し、有害なコンテンツが生成される、または生成されようとする際にこのトークンを生成するようにモデルを微調整することを提案します。この新しい安全性トレーニング方法は、会話中のすべての時点でLLMを有害度の生成分類器に効果的に拡張します。この方法は、いくつかの利点を提供します。モデルが有害性の概念を明示的に学びながら、生成された分布にわずかな影響を与えることで、モデルの有用性を維持できます。また、生成された各応答を評価するため、入力プロンプトだけでなく、サンプリングベースの攻撃に対してより強力な防御を提供します。さらに、モデルの堅牢性の評価を簡素化し、分類器と組み合わせることで相関する失敗を減少させます。私たちは、長い文脈や監視された微調整攻撃に対する堅牢性の向上も示します。
2025-02-22T21:48:48
Audio Visual Segmentation Through Text Embeddings
http://arxiv.org/abs/2502.16359v1
Kyungbok Lee, You Zhang, Zhiyao Duan
音声視覚セグメンテーション(AVS)の目的は、動画フレームから音源オブジェクトを特定し、セグメント化することです。音声視覚セグメンテーションに取り組む研究者は、手動でのアノテーションが高価であるため、限られたデータセットに悩まされています。最近の研究では、音声に応じてセグメンテーション基盤モデルSAMを促すことで、音源オブジェクトをセグメント化する能力を向上させ、限られたデータの課題を克服しようとしています。このアプローチは、SAMの事前学習された知識を利用して視覚モダリティの理解におけるモデルの負担を軽減しますが、音声視覚関係を学習するための限られたデータセットの根本的な課題には対処していません。この制限に対処するために、我々は\textbf{AV2T-SAM}という新しいフレームワークを提案します。このフレームワークは、音声特徴を事前学習されたテキストプロンプトSAMのテキスト埋め込み空間と結びつけます。我々の方法は、豊富なテキスト-画像ペアデータセットから学習した多モーダル対応を利用して、音声と視覚の整合性を強化します。さらに、我々は、音声と視覚のモダリティの共有意味を強調しながら、無関係なノイズをフィルタリングする新しい特徴、$\mathbf{\textit{\textbf{f}}{CLIP} \odot\textit{\textbf{f}}{CLAP}}$を導入します。AVSBenchデータセットに関する実験は、AVSBenchの両方のデータセットで最先端の性能を示しています。我々のアプローチは、事前学習されたセグメンテーションモデルとクロスモーダルセマンティックアライメントを効果的に利用することで、既存の手法を上回っています。
2025-02-22T21:15:44
A Survey on Mechanistic Interpretability for Multi-Modal Foundation Models
http://arxiv.org/abs/2502.17516v1
Zihao Lin, Samyadeep Basu, Mohammad Beigi, Varun Manjunatha, Ryan A. Rossi, Zichao Wang, Yufan Zhou, Sriram Balasubramanian, Arman Zarei, Keivan Rezaei, Ying Shen, Barry Menglong Yao, Zhiyang Xu, Qin Liu, Yuxiang Zhang, Yan Sun, Shilong Liu, Li Shen, Hongxuan Li, Soheil Feizi, Lifu Huang
UC Davis, University of Maryland, Adobe, UIUC, Virginia Tech, Waseda University, University of Sydney, Tsinghua University, Sun Yat-Sen University, Duke University
ファウンデーションモデルの台頭は機械学習研究を変革し、その内部構造を明らかにし、より効率的で信頼性の高い応用を開発するための努力を促しています。大規模言語モデル(LLMs)の解釈においては顕著な進展が見られましたが、対照的な視覚-言語モデル、生成的視覚-言語モデル、テキストから画像へのモデルなどのマルチモーダルファウンデーションモデル(MMFMs)は、単一モーダルフレームワークを超えた独自の解釈可能性の課題を提起しています。初期の研究にもかかわらず、LLMsとMMFMsの間には解釈可能性において大きなギャップが残っています。本調査は以下の二つの主要な側面を探ります:(1) LLMの解釈方法をマルチモーダルモデルに適応させること、(2) 単一モーダル言語モデルとクロスモーダルシステムのメカニズム的な違いを理解することです。現在のMMFM分析技術を体系的にレビューすることで、解釈可能性の方法に関する構造化された分類法を提案し、単一モーダルとマルチモーダルアーキテクチャ間の知見を比較し、重要な研究ギャップを強調します。
2025-02-22T20:55:26
Exploring Sentiment Manipulation by LLM-Enabled Intelligent Trading Agents
http://arxiv.org/abs/2502.16343v1
David Byrd
全ての経済セクターにわたる企業は、大規模言語モデルを迅速に展開し続けています。強化学習は、人間のフィードバックに基づいた言語モデルのファインチューニングとの関連性から、関心の再燃を迎えています。ツールチェーンの言語モデルは、タスク特化型のエージェントを制御します。もし逆の場合がまだ現れていないのであれば、すぐにでも現れるでしょう。本論文では、連続深層強化学習に基づくインテリジェントなトレーディングエージェントの最初の調査を紹介します。このエージェントは、大規模言語モデルを制御し、他のトレーダーが観察するソーシャルメディアフィードに投稿することができます。我々は、このようなエージェントのパフォーマンスと影響をシミュレーションされた金融市場で実証的に調査し、エージェントは生成する投稿の感情を操作することで総報酬を最適化し、したがって利益を増やすことを学ぶことを発見しました。論文は、考察、制限、および今後の研究への提案で締めくくられています。
2025-02-22T20:17:14
A Gap Between the Gaussian RKHS and Neural Networks: An Infinite-Center Asymptotic Analysis
http://arxiv.org/abs/2502.16331v1
Akash Kumar, Rahul Parhi, Mikhail Belkin
最近の研究では、無限幅の有界ノルム単一隠れ層ニューラルネットワークの関数空間帰納バイアスを、ある種の有界変動型空間として特徴づけています。この新しいニューラルネットワークのバナッハ空間は、特定のソボレフ空間やスペクトル・バロン空間など、古典的な多変量関数空間を多く包含しています。特に、このバナッハ空間には、数方向でのみ変化するような、より古典的な正則性を示さない関数も含まれています。有界な領域では、ガウス再生核ヒルベルト空間(RKHS)がこのバナッハ空間に厳密に埋め込まれることが確立されており、ガウスRKHSとニューラルネットワークのバナッハ空間との間には明確なギャップが存在することが示されています。無限境界の領域、例えば$\mathbb{R}^d$全体においてこれらの空間を調査すると、状況は根本的に異なることが分かりました。私たちは次の重要な結果を確立しました:ガウスRKHSに存在する特定の関数は、ニューラルネットワークのバナッハ空間において無限ノルムを持っています。これは、カーネル法とニューラルネットワークの間に、カーネル法がニューラルネットワークよりも厳密に優れている関数を示すことによって非自明なギャップを提供します。
2025-02-22T19:33:19
Deep Time Warping for Multiple Time Series Alignment
http://arxiv.org/abs/2502.16324v1
Alireza Nourbakhsh, Hoda Mohammadzade
時系列アライメントは信号処理において重要なタスクであり、数多くの現実のアプリケーションがあります。実際には、信号はしばしば時間的なシフトやスケーリングを示すため、生のデータに基づく分類は誤りを引き起こしやすくなります。本論文では、深層学習技術を利用した複数時系列アライメント(MTSA)の新しいアプローチを紹介します。既存の方法のほとんどは、主にタンパク質やDNA配列のための多重配列アライメント(MSA)に対応していますが、数値時系列のアライメント方法論には依然として大きなギャップがあります。さらに、従来のアプローチは通常、ペアワイズアライメントに焦点を当てるのに対し、我々の提案する方法はすべての信号を複数的に(すべての信号を一度にまとめて)アラインします。この革新は、アライメントの効率を向上させるだけでなく、計算速度を大幅に改善します。区間ごとの線形セクションに分解することで、ワーピング関数に異なるレベルの複雑さを導入します。さらに、我々の方法は、境界、単調性、連続性条件という3つのワーピング制約を満たすことを保証します。深層畳み込みネットワークの利用により、動的時間ワーピング(DTW)のいくつかの制限に対処する新しい損失関数を採用することができます。129の時系列データセットからなるUCRアーカイブ2018での実験結果は、信号をアラインするために我々のアプローチを用いることが、分類精度やワーピング平均を大幅に向上させ、これらのデータセットの大部分における実行時間を短縮することを示しています。
2025-02-22T18:55:51
Direct Alignment with Heterogeneous Preferences
http://arxiv.org/abs/2502.16320v1
Ali Shirali, Arash Nasr-Esfahany, Abdullah Alomar, Parsa Mirtaheri, Rediet Abebe, Ariel Procaccia
Harvard University, University of California Berkeley, Massachusetts Institute of Technology, Ikigai Labs, University of California San Diego
人間の好みに対する整合性は、普遍的な報酬関数を用いて一般的に枠付けされますが、人間の好みは本質的に異質です。我々はこの異質性をユーザータイプを導入することで形式化し、均質性の仮定の限界を調査します。異質な好みに整合するためには、単一のポリシーではユーザータイプ全体の平均報酬を使用することが最も効果的であることを示します。ただし、これにはアノテーターに関する追加の情報が必要です。異なる情報設定の下での改善を検討し、直接的な整合手法に焦点を当てます。我々は、最小限の情報でも一次改善をもたらすことができる一方で、各ユーザータイプからの完全なフィードバックが最適なポリシーの一貫した学習をもたらすことを発見しました。驚くべきことに、しかし、この後者の設定においてはサンプル効率の良い一貫した直接損失は存在しません。これらの結果は、直接的なポリシー整合における一貫性とサンプル効率の間に根本的な緊張が存在することを明らかにします。
2025-02-22T18:46:33
Iterative Auto-Annotation for Scientific Named Entity Recognition Using BERT-Based Models
http://arxiv.org/abs/2502.16312v1
Kartik Gupta
この論文では、BERTベースのモデルを使用して科学的固有表現認識(SciNER)を行うための反復アプローチを提示します。転移学習を活用して、高品質な手動アノテーションデータの小さなセットを用いて事前学習済みモデルをファインチューニングします。このプロセスは、ファインチューニングしたモデルを使用してより大きなデータセットを自動アノテーションし、さらにファインチューニングを行うことで反復的に洗練されます。私たちは、dslim/bert-large-NERとbert-large-casedの2つのモデルを評価し、bert-large-casedが一貫して前者を上回ることを確認しました。私たちのアプローチは、特にあまり一般的でないエンティティクラスにおいて、予測精度とF1スコアの大幅な改善を示しました。今後の研究には、ラベルの付いていないデータを使用した訓練、RoBERTaのようなより強力なエンコーダーの探求、および手動アノテーションの範囲の拡大が含まれる可能性があります。この方法論は、ラベル付きデータへのアクセスが制限されているNLPタスクにおいて広範な応用を持っています。
2025-02-22T17:58:20
A calibration test for evaluating set-based epistemic uncertainty representations
http://arxiv.org/abs/2502.16299v1
Mira Jürgens, Thomas Mortier, Eyke Hüllermeier, Viktor Bengs, Willem Waegeman
Ghent University, Munich Center for Machine Learning, LMU Munich
エピステミック不確実性の正確な表現は、機械学習において挑戦的かつ重要なタスクです。広く使用されている表現は、確率的な予測子の凸集合、つまりクレダル集合に対応します。これらのクレダル集合を構築する一般的な方法の一つは、アンサンブルまたは特化した教師あり学習法を通じて行い、エピステミック不確実性を集合のサイズやメンバー間の不一致といった指標を通じて定量化することができます。原則として、これらの集合は真のデータ生成分布を含むべきです。この有効性のための必要条件として、我々はキャリブレーションの最も強い概念を代理として採用します。具体的には、集合の予測の凸組み合わせが分布においてキャリブレートされているかどうかを判断するための新しい統計的テストを提案します。従来の方法とは対照的に、我々のフレームワークでは、凸組み合わせがインスタンス依存であることを許容し、異なるアンサンブルメンバーが入力空間の異なる領域でより良くキャリブレーションされている可能性を認識します。さらに、我々は適切なスコアリングルールを通じてこの組み合わせを学習し、キャリブレーションのために本質的に最適化されます。微分可能なカーネルベースのキャリブレーション誤差推定器に基づいて、我々は非パラメトリックなテスト手順を導入し、合成および実世界の実験におけるインスタンスレベルの変動を捉えることの利点を示します。
2025-02-22T17:10:45
TimePFN: Effective Multivariate Time Series Forecasting with Synthetic Data
http://arxiv.org/abs/2502.16294v1
Ege Onur Taga, M. Emrullah Ildiz, Samet Oymak
時系列アプリケーションの多様性と専門的なデータの不足は、強力な少数ショット学習能力を備えた時系列モデルの必要性を浮き彫りにしています。本研究では、多変量時系列(MTS)予測のための新しいトレーニングスキームとTransformerベースのアーキテクチャ、総称してTimePFNを提案します。TimePFNは、ベイズ推論の近似を目指すPrior-data Fitted Networks(PFN)の概念に基づいています。私たちのアプローチは、(1)多様なガウス過程カーネルと線形コレジオナライゼーション法を通じて合成MTSデータを生成し、(2)全ての入力パッチ間で時間的およびクロスチャネルの依存関係を利用できる新しいMTSアーキテクチャから構成されています。私たちは、TimePFNをいくつかのベンチマークデータセットで評価し、ゼロショットおよび少数ショット設定の両方において、既存の最先端モデルを上回る性能を示しています。特筆すべきは、わずか500データポイントでTimePFNをファインチューニングすることで、フルデータセットのトレーニングエラーにほぼ匹敵し、さらに50データポイントでも競争力のある結果が得られることです。また、TimePFNは強力な単変量予測性能を示し、その一般化能力を証明しています。全体として、この研究はMTS予測における合成データの先行情報の力を解き放ち、強力なゼロショットおよび少数ショット予測性能を実現します。
2025-02-22T16:55:14
The Design Space of Recent AI-assisted Research Tools for Ideation, Sensemaking, and Scientific Creativity
http://arxiv.org/abs/2502.16291v1
Runlong Ye, Matthew Varona, Oliver Huang, Patrick Yung Kang Lee, Michael Liut, Carolina Nobre
生成的AI(GenAI)ツールは、学術研究などの知識労働における自動化の範囲と能力を根本的に拡大しています。AI支援の研究ツールは、人間の認知を補完し、研究プロセスを効率化する可能性を示していますが、自動化バイアスを増大させ、批判的思考を抑圧する可能性もあります。私たちは、主要なHCI分野からの過去3年間の出版物を調査しました。11のAI支援の研究ツールを詳しく分析し、そのうち5つは従来のAIアプローチを採用し、6つはGenAIを統合して、これらのシステムがどのように新しい機能とデザイン空間を描いているのかを探りました。私たちは、AI研究ツールを使用する際の認知的関与を促す4つのデザイン推奨をまとめました。これには、ユーザーの主体性と制御を提供すること、発散的思考と収束的思考を可能にすること、適応性と柔軟性をサポートすること、透明性と正確性を確保することが含まれます。私たちは、これらのアイデアがAI支援の研究ツールにおける、研究者の確立されたワークフローを模倣する段階から、研究者との生成的共創への移行を示し、この移行が研究コミュニティにもたらす機会について議論します。
2025-02-22T16:42:11
Verification of Bit-Flip Attacks against Quantized Neural Networks
http://arxiv.org/abs/2502.16286v1
Yedi Zhang, Lei Huang, Pengfei Gao, Fu Song, Jun Sun, Jin Song Dong
National University of Singapore, ShanghaiTech University, ByteDance Inc, Chinese Academy of Sciences, University of Chinese Academy of Sciences, Nanjing Institute of Software Technology, Singapore Management University
急速に進化するニューラルネットワークセキュリティの領域において、ニューラルネットワークがビットフリップ攻撃に対して耐性を持つこと(つまり、攻撃者が悪意を持ってパラメータストレージメモリシステム内のわずかのビットを反転させて有害な挙動を引き起こすこと)は、関連性の高い研究分野として浮上しています。既存の研究は、量子化がこのような攻撃に対する有効な防御手段となる可能性があることを示唆しています。実数値ニューラルネットワークがこのような攻撃に対して示す脆弱性と、量子化されたニューラルネットワーク(QNN)の相対的な堅牢性を考慮し、本研究では、ビットフリップ攻撃の不在を正式に検証するための最初の検証フレームワークであるBFAVerifierを紹介します。BFAVerifierは、抽象化に基づく方法とMILP(混合整数線形計画法)に基づく方法の二つの重要なコンポーネントで構成されています。具体的には、我々はまず、潜在的なビットフリップ攻撃を表す象徴的パラメータに関して到達可能性分析を行い、新しい抽象ドメインを用いて堅牢な保証を提供します。もし到達可能性分析がこれらの攻撃に対する耐性を証明できなかった場合、次にこの検証問題を同等のMILP問題にエンコードし、市販のソルバーで解決可能にします。したがって、BFAVerifierは堅牢で完全であり、かなりの効率を持っています。我々は広範な実験を行い、さまざまなネットワークアーキテクチャ、量子化ビット幅、および敵対者の能力に対する効果と効率を実証しました。
2025-02-22T16:35:38
MolSpectra: Pre-training 3D Molecular Representation with Multi-modal Energy Spectra
http://arxiv.org/abs/2502.16284v1
Liang Wang, Shaozhen Liu, Yu Rong, Deli Zhao, Qiang Liu, Shu Wu, Liang Wang
Chinese Academy of Sciences, University of Chinese Academy of Sciences, Alibaba Group
3D構造と分子システムのエネルギー状態との関係を確立することは、3D分子表現を学習するための有望なアプローチであることが証明されています。ただし、既存の方法は古典力学から分子のエネルギー状態をモデル化することに限定されています。この制限は、量子力学的効果、特に量子化(離散的)エネルギーレベル構造の重要な見落としをもたらします。これにより、より正確な分子エネルギーの推定が可能となり、エネルギースペクトルを通じて実験的に測定できます。本論文では、エネルギースペクトルを活用して3D分子表現(MolSpectra)の事前学習を強化し、量子力学の知識を分子表現に注入することを提案します。具体的には、マスクされたパッチ再構成によって分子スペクトルをエンコードするためのマルチスペクトルエンコーダ「SpecFormer」を提案します。さらに、コントラスト目的を使用して3Dエンコーダとスペクトルエンコーダの出力を調整することで、3Dエンコーダの分子に対する理解を深めます。公的ベンチマークでの評価により、私たちの事前学習された表現が、分子特性の予測やダイナミクスのモデル化において既存の方法を上回ることが示されました。
2025-02-22T16:34:32
Understanding the Emergence of Multimodal Representation Alignment
http://arxiv.org/abs/2502.16282v1
Megan Tjandrasuwita, Chanakya Ekbote, Liu Ziyin, Paul Pu Liang
マルチモーダル表現学習は、比較不可能なモダリティを比較可能な表現に変換することに基本的に関わっています。これまでの研究は、主にターゲットとなる学習目標やモデルアーキテクチャを通じてこれらの表現を明示的に調整することに焦点を当てていましたが、最近の研究では、独立して訓練された一模態モデルのスケールと性能が向上するにつれて、さまざまなモデルが暗黙的に整列できることが明らかになっています。これらの発見は、マルチモーダル学習における整列表現の出現に関する基本的な疑問を提起します。具体的には、(1) 整列はいつ、なぜ暗黙的に出現するのか?および (2) 整列は性能の信頼できる指標なのか?包括的な実証的調査を通じて、整列の出現とそのタスク性能との関係が、いくつかの重要なデータ特性に依存することを示しました。これには、モダリティ間の類似性の度合いや、タスクに対して提供される冗長情報とユニーク情報のバランスが含まれますが、必ずしもそれに限られるわけではありません。私たちの発見は、整列が普遍的に有益であるとは限らず、むしろその性能への影響はデータセットやタスクによって異なることを示唆しています。これらの洞察は、実践者がモダリティ間の整列を強化することが有利か、場合によっては最適な性能を達成するために有害であるかを判断するのに役立ちます。コードは https://github.com/MeganTj/multimodal_alignment で公開されています。
2025-02-22T16:27:31
Human Preferences in Large Language Model Latent Space: A Technical Analysis on the Reliability of Synthetic Data in Voting Outcome Prediction
http://arxiv.org/abs/2502.16280v1
Sarah Ball, Simeon Allmendinger, Frauke Kreuter, Niklas Kühl
Ludwig-Maximilian-University Munich, Munich Center for Machine Learning, University of Bayreuth, Fraunhofer Institute for Applied Information Technology, University of Maryland
生成AI(GenAI)は、人間の好みを模擬するために調査コンテクストでますます使用されています。多くの研究は、モデル生成された応答と金基準調査結果を比較することで、合成GenAIデータの質を評価していますが、人間の応答者の代替としてLLM(大規模言語モデル)を使用することの妥当性と信頼性に関する基本的な疑問が残っています。本研究では、人口統計属性とプロンプトの変動が大規模言語モデル(LLM)の潜在的意見マッピングにどのように影響するかの技術的分析を提供し、調査ベースの予測に対する適合性を評価します。14の異なるモデルを使用したところ、LLM生成データは、特に人口統計サブグループ間で、実際の人間の応答に観察される分散を再現できないことがわかりました。政治的な分野では、ペルソナと政党とのマッピングは限られた差別化を示し、調査データに見られる意見の微妙な分布を欠いた合成データを生成します。さらに、プロンプトの感受性が一部のモデルの出力を大幅に変更する可能性があることも示しており、LLMベースのシミュレーションの安定性と予測可能性をさらに損なっています。重要な貢献として、私たちは、LLMがその潜在空間に政治的所属をどのようにエンコードしているかを明らかにするプローブベースの方法論を適応させ、これらのモデルによって導入される体系的な歪みを明らかにします。我々の結果は、AI生成の調査データにおける重要な制限を浮き彫りにし、公共の意見研究や社会科学実験、計算行動モデリングにおけるその使用に注意を促しています。
2025-02-22T16:25:33
Beyond Trusting Trust: Multi-Model Validation for Robust Code Generation
http://arxiv.org/abs/2502.16279v1
Bradley McDanel
この論文は、トンプソンの「信頼することに関する考察」と、LLMベースのコード生成における現代の課題との類似点を探ります。私たちは、トンプソンのコンパイラのバックドアに関する洞察が、潜在的な悪用のメカニズムがさらに不透明で分析が難しい大規模言語モデルの時代において、どのように新たな関連を持つのかを考察します。この類推に基づき、LLMの統計的性質がコード生成パイプラインにおいて新たなセキュリティの課題を生み出す方法について議論します。今後の方向性として、異なる独立したモデルを活用し、モデル間の合意を通じて異常なコードパターンを検出するアンサンブルベースの検証アプローチを提案します。この視点の作品は、AI補助のソフトウェア開発における信頼と検証についての議論を喚起することを目的としています。
2025-02-22T16:24:23
Fine-Tuning Qwen 2.5 3B for Realistic Movie Dialogue Generation
http://arxiv.org/abs/2502.16274v1
Kartik Gupta
Qwen 2.5 3Bベースモデルは、コーネル映画対話コーパスという映画の会話のキュレーションデータセットを活用して、文脈に富んだ魅力的な映画の対話を生成するようにファインチューニングされました。GPUコンピューティングとVRAMの制限により、トレーニングプロセスは0.5Bモデルから始まり、効率改善が実施されるにつれて1.5Bおよび3Bバージョンに徐々にスケールアップされました。アリババグループが開発したQwen 2.5シリーズは、小さなオープンソースの事前訓練モデルの最前線に位置しており、特にMetaのLlama 3.2やGoogleのGemmaのような代替と比べて創造的なタスクにおいて優れています。結果は、小さなモデルが高品質でリアルな対話を生成する能力を示しており、リアルタイムで文脈に敏感な会話生成の期待できるアプローチを提供しています。
2025-02-22T16:00:01
rECGnition_v2.0: Self-Attentive Canonical Fusion of ECG and Patient Data using deep learning for effective Cardiac Diagnostics
http://arxiv.org/abs/2502.16255v1
Shreya Srivastava, Durgesh Kumar, Ram Jiwari, Sandeep Seth, Deepak Sharma
ECG(心電図)測定値の変動性は、個々の患者の特性によって影響を受け、自動化されたECG分析を臨床設定で採用する際にかなりの課題となっています。これを解決するために、SACC(自己注意型典型相関)という新しい特徴融合技術が提案されました。この技術は、DPN(デュアルパスウェイネットワーク)および深さ方向の可分畳み込みと組み合わせて、頑健で解釈可能かつ迅速なエンドツーエンドの不整脈分類モデルであるrECGnition_v2.0(頑健なECG異常検出)を作成します。この研究では、rECGnition_v2.0のさまざまな不整脈クラスに対する効率を評価するために、MIT-BIH、INCARTDB、およびEDBデータセットを使用します。構成モデルコンポーネントの影響を調査するために、さまざまなアブレーション研究が行われ、単純な連結、CCA(典型相関分析)、および提案されたSACCが比較され、DPN rECGnition_v2.0モデルを使用してグローバルおよびローカルのECG特徴の重要性がテストされました。また、全体的な精度に対するモデルパラメータ、FLOPs、メモリ要件、および予測時間について、最先端のCNNモデルとベンチマークされました。さらに、SACC層の前後でECG内の活性化位置を比較することで、モデルの内部動作が解釈されました。rECGnition_v2.0は、MIT-BIH不整脈データセットを利用して、わずか82.7MのFLOPsで10種類の不整脈を分類する際に、98.07%という素晴らしい精度と98.05%のF1スコアを示しました。さらに、INCARTDBおよびEDBデータセットでは、AAMI分類に対してそれぞれ98.01%と96.21%の優れたF1スコアが達成されました。rECGnition_v2.0のコンパクトなアーキテクチャは、少ない学習可能なパラメータと減少した計算要求によって特徴付けられ、解釈可能性やスケーラビリティなどのいくつかの利点をもたらしました。
2025-02-22T15:16:46
Towards User-level Private Reinforcement Learning with Human Feedback
http://arxiv.org/abs/2502.17515v1
Jiaming Zhang, Mingxi Lei, Meng Ding, Mengdi Li, Zihang Xiang, Difei Xu, Jinhui Xu, Di Wang
Renmin University of China, King Abdullah University of Science and Technology, State University of New York at Buffalo
人間のフィードバックによる強化学習(RLHF)は、巨大な言語モデル(LLMs)を人間の嗜好と整合させるための影響力のある技術として登場しました。RLHFの有望な可能性にもかかわらず、ユーザーの嗜好のプライバシーを保護する方法は重要な課題となっています。従来の研究では、個人データのプライバシーを保護するために差分プライバシー(DP)を使用することに焦点をあててきました。しかし、彼らは主にアイテムレベルのプライバシー保護に集中しており、RLHFでより一般的なユーザーレベルのプライバシーに対しては満足のいく性能を示していません。この研究では、ユーザーレベルのラベルDPをRLHFに統合した新しいフレームワークであるAUP-RLHFを提案します。まず、アイテムレベルのプライバシーで受け入れ可能なパフォーマンスを達成する古典的なランダムレスポンスアルゴリズムが、ユーザーレベルの設定においては最適ではないユーティリティをもたらすことを示します。次に、ユーザーレベルのラベルDP-RLHFの下限を確立し、$(\varepsilon, \delta)$ユーザーレベルのプライバシーを保証し、改善された推定誤差を達成するAUP-RLHFアルゴリズムを開発します。実験結果は、AUP-RLHFが感情生成および要約タスクにおいて既存のベースライン手法より優れており、より良いプライバシーとユーティリティのトレードオフを達成することを示しています。
2025-02-22T14:57:28
Linear Attention for Efficient Bidirectional Sequence Modeling
http://arxiv.org/abs/2502.16249v1
Arshia Afzal, Elias Abad Rocamora, Leyla Naz Candogan, Pol Puigdemont, Francesco Tonin, Yongtao Wu, Mahsa Shoaran, Volkan Cevher
線形アテンションを持つトランスフォーマーは、迅速で並列のトレーニングを可能にします。さらに、効率的な線形時間推論のために再帰神経ネットワーク(RNN)として定式化することができます。因果シーケンスモデリングで広範に評価されてきましたが、双方向設定への拡張はまだ行われていません。本研究では、LIONフレームワークを導入し、双方向シーケンスモデリングにおける線形トランスフォーマーの新しい理論的基盤を確立します。LIONは、全線形アテンションに相当する双方向RNNを構築します。これにより、線形トランスフォーマーの利点である並列トレーニングと効率的な推論が双方向設定に拡張されます。LIONを使用して、3つの線形トランスフォーマーを双方向形式に変換します:LION-LIT(Katharopoulos et al., 2020に対応する双方向バリアント)、LION-D(RetNetを拡張する、Sun et al., 2023のもの)、およびLION-S(SSMの選択性に触発された安定した選択的マスクを持つ線形トランスフォーマー、Dao & Gu, 2024)です。アテンションブロックをLION(-LIT、-D、-S)に置き換えることで、トランスフォーマーや状態空間モデル(SSM)のパフォーマンスに近づく双方向タスクのパフォーマンスを達成しながら、トレーニング速度の大幅な向上を実現します。私たちの実装は、http://github.com/LIONS-EPFL/LION で入手可能です。
2025-02-22T14:52:17
Reproducibility Study of Cooperation, Competition, and Maliciousness: LLM-Stakeholders Interactive Negotiation
http://arxiv.org/abs/2502.16242v1
Jose L. Garcia, Karolina Hajkova, Maria Marchenko, Carlos Miguel Patiño
University of Amsterdam
この論文は「協力、競争、悪意:LLMステークホルダーのインタラクティブな交渉」の再現性研究と拡張を提示します。私たちは、様々なオープンウェイトモデル(1.5B〜70Bパラメータ)とGPT-4o Miniを使用して元の発見を検証し、いくつかの新しい貢献を紹介します。ゲームのパレートフロントを分析し、エージェントの相互作用なしで成功する交渉が可能かどうかをテストするためのコミュニケーションフリーベースラインを提案し、最近の小規模言語モデルのパフォーマンスを評価し、モデルの応答における構造的情報漏洩を分析し、交渉の公平性を評価するための不平等メトリックを実装します。私たちの結果は、10B未満の小さなモデルがフォーマット遵守と一貫した応答に苦労する一方で、より大きなオープンウェイトモデルはプロプライエタリモデルのパフォーマンスに近づく可能性があることを示しています。また、多くのシナリオにおいて、単一エージェントアプローチがマルチエージェント交渉と同等の結果を達成できることは、ベンチマークで良好なパフォーマンスを発揮するためにエージェント間の通信が必要であるという仮定に挑戦します。この研究は、LLMベースの交渉システムのアクセスibilty、公平性、環境影響、およびプライバシーに関する考慮事項についての洞察も提供します。
2025-02-22T14:28:49
Speech Enhancement Using Continuous Embeddings of Neural Audio Codec
http://arxiv.org/abs/2502.16240v1
Haoyang Li, Jia Qi Yip, Tianyu Fan, Eng Siong Chng
Nanyang Technological University, Singapore
最近のニューラルオーディオコーデック(NAC)モデルの進展は、音声強調(SE)を含むさまざまな音声処理タスクでの使用を促進しています。本研究では、事前に訓練されたNACエンコーダの量子化前出力を利用して、新しい効率的なSEアプローチを提案します。従来のNACベースのSE手法が言語モデル(LM)を使用して離散音声トークンを処理するのに対し、我々は事前訓練されたNACの連続埋め込み空間内でSEを実行します。これは時間軸に沿って高圧縮され、効率的な表現が可能です。我々の軽量なSEモデルは、埋め込みレベルの損失を通じて最適化されており、より大きなデータセットで訓練されたSEベースラインに匹敵する結果を提供し、リアルタイムファクターは0.005と大幅に低減されます。さらに、我々の手法はGMACを3.94に抑え、シミュレートされたクラウドベースのオーディオ伝送環境においてSepformerと比較して18倍の複雑さを削減します。この研究は、クラウドアプリケーションに特に適した新しい効率的なNACベースのSEソリューションを強調しており、NACが音声を圧縮してから伝送に使用されるシナリオにおいて有効です。著作権20XX IEEE。この資料の個人使用は許可されています。他のすべての使用については、現在または将来のメディアにおけるこの資料の再印刷/再出版、広告やプロモーション目的のための使用、他の作品における本作の著作権で保護されたコンポーネントの再利用を含め、IEEEの許可を取得する必要があります。
2025-02-22T14:25:55
SAE-V: Interpreting Multimodal Models for Enhanced Alignment
http://arxiv.org/abs/2502.17514v1
Hantao Lou, Changye Li, Jiaming Ji, Yaodong Yang
画像モダリティの統合により、多モーダル大規模言語モデル(MLLM)の意味空間はテキスト専用モデルに比べてより複雑になり、解釈性がより困難になり、アラインメントの安定性が低下しています。特に、低品質のデータに敏感であり、これがモダリティ間の不整合、幻覚、偏った出力を引き起こす可能性があります。その結果、MLLMの解釈性手法を開発することは、アラインメントの質と効率を改善するために重要です。テキスト専用のLLMにおいて、スパースオートエンコーダ(SAE)が潜在表現を解釈する能力で注目を集めています。しかし、SAEを多モーダル設定に拡張することは、モダリティ融合やクロスモーダル表現の分離の難しさにより、新しい課題を呈します。これらの課題に対処するために、我々はSAE-Vを紹介します。これは、SAEのパラダイムをMLLMに拡張した機械的な解釈性フレームワークです。SAE-Vは、解釈可能な特徴を特定し分析することによって、モデルの動作とデータの質の細かな解釈を可能にし、クロスモーダル相互作用やアラインメントのダイナミクスのより深い理解を促進します。さらに、クロスモーダル特徴の重み付けを利用することで、SAE-Vは追加のモデルを必要とせずにモデルアラインメントを向上させる内在的なデータフィルタリングメカニズムを提供します。具体的には、MLLMのアラインメントプロセスに適用された場合、SAE-Vベースのデータフィルタリング手法は、50%未満のデータで110%以上のパフォーマンスを達成する可能性があります。我々の結果は、SAE-VがMLLMにおける解釈性とアラインメントを向上させ、その内部メカニズムに関する洞察を提供する能力を強調しています。
2025-02-22T14:20:07
Dynamic Parallel Tree Search for Efficient LLM Reasoning
http://arxiv.org/abs/2502.16235v1
Yifu Ding, Wentao Jiang, Shunyu Liu, Yongcheng Jing, Jinyang Guo, Yingjie Wang, Jing Zhang, Zengmao Wang, Ziwei Liu, Bo Du, Xianglong Liu, Dacheng Tao
Beihang University, Nanyang Technological University, Wuhan University
思考の木(ToT)は、問題解決をスパニングツリーとして構築することで、Large Language Model(LLM)の推論を強化します。しかし、最近の手法は検索精度に焦点を当てる一方で、計算効率を見落としています。ToTを加速する際の課題は、推論の焦点が頻繁に切り替わることと、最適でない解を冗長に探索することです。このジレンマを緩和するために、我々は動的並列木探索(DPTS)を提案します。これは、推論における推論経路を動的に最適化することを目的とした新しい並列フレームワークです。生成フェーズにおける並列ストリームラインを含み、精密なキャッシュ管理と整列を通じて、任意の経路を持つ柔軟で適応性のある並列性を構築します。一方で、検索と遷移メカニズムは潜在的な候補をフィルタリングし、より多くの可能な解に推論の焦点を動的に保ち、冗長性を減少させます。Math500とGSM8Kデータセットを用いたQwen-2.5およびLlama-3に関する実験では、DPTSが平均して2-4倍の効率向上を実現しつつ、既存の推論アルゴリズムの精度を維持または超えることを示しています。これにより、ToTベースの推論はよりスケーラブルで計算効率が高くなります。
2025-02-22T14:13:37
Graph Self-Supervised Learning with Learnable Structural and Positional Encodings
http://arxiv.org/abs/2502.16233v1
Asiri Wijesinghe, Hao Zhu, Piotr Koniusz
Data61, CSIRO, Australian National University
従来のグラフ自己教師あり学習(GSSL)は、複雑な構造的特性をうまく捉えるのに苦労しています。この制限は主に二つの要因に起因しています:(1)従来のグラフニューラルネットワーク(GNN)が洗練されたトポロジー特徴を表現するのに不十分であること、(2)自己教師あり学習が最終的なグラフ表現のみを重視していることです。これらの問題に対処するために、私たちは \emph{GenHopNet} という GNN フレームワークを導入します。このフレームワークは $k$-ホップメッセージパッシングスキームを統合しており、明示的なサブストラクチャ抽出なしにローカル構造情報を捉える能力を強化します。我々は理論的に、\emph{GenHopNet} がグラフ同型性のための古典的なワイスフェラー・レーマン(WL)テストの表現力を上回ることを示します。さらに、学習プロセス全体にわたってトポロジー情報を取り入れた構造および位置認識の GSSL フレームワークを提案します。このアプローチにより、グラフのトポロジーに対して敏感でありながら、特定の構造および特徴の増強に不変な表現の学習が可能になります。構造感度をテストするように設計されたグラフ分類データセットを含む包括的な実験において、私たちの手法は既存のアプローチを一貫して上回り、計算効率を維持しています。私たちの研究は、類似のローカル構造を持ちながら異なるグローバルトポロジーを持つグラフを区別する GSSL の能力を大きく進展させます。
2025-02-22T14:10:06
Int2Int: a framework for mathematics with transformers
http://arxiv.org/abs/2502.17513v1
François Charton
FAIR, Meta, Ecole national des ponts et chaussées
この論文は、数論や整数に関連する他の問題に焦点を当てた数学研究の問題にトランスフォーマーを使用するためのオープンソースコードベースであるInt2Intを文書化しています。Int2Intは、トランスフォーマーアーキテクチャの完全なPyTorch実装であり、トレーニングおよび評価ループ、一般的な数学的オブジェクトを表現、生成、デコードするためのクラスや関数を含んでいます。データ準備のための補助コードや、実験結果を視覚化するためのJupyterノートブックも提供されています。この文書では、Int2Intの主な機能を示し、ユーザーマニュアルとしての役割を果たし、それを拡張するためのガイドラインを提供します。Int2IntはMITライセンスのもとでリリースされており、https://github.com/FacebookResearch/Int2Intで入手可能です。
2025-02-22T13:43:28
SalM$2$: An Extremely Lightweight Saliency Mamba Model for Real-Time Cognitive Awareness of Driver Attention
http://arxiv.org/abs/2502.16214v1
Chunyu Zhao, Wentao Mu, Xian Zhou, Wenbo Liu, Fei Yan, Tao Deng
運転シーンにおけるドライバーの注意認識は、交通シーン認識技術において人気のある方向性です。それは、運転シーンの特定のターゲットやオブジェクトに対する人間のドライバーの注意を理解することを目的としています。しかし、交通シーンには膨大な視覚情報だけでなく、運転タスクに関連する意味情報も含まれています。既存の手法は、運転シーンに存在する実際の意味情報に対して注意を払うことが欠けています。さらに、交通シーンは複雑で動的なプロセスであり、現在の運転タスクに関連するオブジェクトに対して常に注意を払う必要があります。既存のモデルは、その基本的なフレームワークの影響を受け、大量のパラメータを持ち、複雑な構造を持つ傾向があります。このため、本論文では、最新のMambaフレームワークに基づくリアルタイムの顕著性Mambaネットワークを提案します。図1に示されているように、我々のモデルは非常に少ないパラメータ(0.08M、他のモデルのわずか0.09〜11.16%)を使用しながら、SOTA性能を維持またはSOTAモデルの性能の98%以上を達成しています。
2025-02-22T12:37:52
Machine Learning Framework for Early Power, Performance, and Area Estimation of RTL
http://arxiv.org/abs/2502.16203v1
Anindita Chattopadhyay, Vijay Kumar Sutrakar
VLSIデザインの進化する環境における重要なステージは、システムの機能をハードウェア記述言語(Verilogなど)を通じて指定するレジスタ転送レベル(RTL)に変換される設計フェーズです。一般的に、RTLデザインの品質を評価するには、電子設計自動化(EDA)ツールを用いた完全な合成が必要であり、これは迅速なデザインの反復や最適化には適していない時間のかかるプロセスです。最近の機械学習(ML)における革新は早期の予測モデルをもたらしましたが、これらの手法は通常、広範なRTLデザインに対して堅牢で一般化可能な解を提供しません。この論文では、ハードウェア記述言語(HDL)コードから直接ライブラリファイルを用いて、パワー、パフォーマンス、面積(PPA)メトリックの早期推定を行う前合成フレームワークを提案します。提案されたフレームワークは、単一ビットオペレーターを使用して、ポスト合成デザインの特性を密接に反映した一般化された柔軟な構造を生成する単純オペレーターグラフ(SOG)と呼ばれるビットレベルの表現を導入します。このモデルはRTLとポスト合成デザインをつなぎ、主要メトリックの正確な予測を助けるものです。提案された木構造ベースのMLフレームワークは、優れた予測性能とPPA推定を示しています。147の異なるRTLデザインでの検証が行われました。147の異なるデザインを用いた提案モデルは、WNS、TNS、パワーそれぞれに対して、98%、98%、90%の精度を示し、最先端の手法に対して大幅な精度向上を示しています。
2025-02-22T12:12:51
An Autonomous Network Orchestration Framework Integrating Large Language Models with Continual Reinforcement Learning
http://arxiv.org/abs/2502.16198v1
Masoud Shokrnezhad, Tarik Taleb
Oulu University, Ruhr University Bochum
6Gネットワークは、グローバルなカバレッジ、大規模な接続性、そして超厳格な要件の達成を目指しています。宇宙-空中-地上統合ネットワーク(SAGIN)と意味通信(SemCom)はこれらの目標を実現するために不可欠ですが、リソースオーケストレーションにおいてかなりの複雑さをもたらします。ロボティクスの研究からインスピレーションを受けて、この複雑さを管理するための有効な解決策は、大規模言語モデル(LLM)の適用です。LLMのネットワークオーケストレーションへの使用は最近注目を集めていますが、既存のソリューションはLLMの幻想やネットワークダイナミクスへの適応に十分に対処していません。このギャップに対処するために、本論文はSemCom対応のSAGINのための自律的強化コーディネーション(ARC)というフレームワークを提案します。このフレームワークは、LLMベースのリトリーバー拡張生成器(RAG)を用いてサービス、ユーザー、リソースを監視し、収集したデータを処理します。一方、階層的アクションプランナー(HAP)がリソースをオーケストレーションします。ARCはオーケストレーションを二つの層に分解し、高レベルの計画にLLMを使用し、低レベルの意思決定に強化学習(RL)エージェントを使用します。これは専門家の混合(MoE)概念に沿ったものです。LLMは対比学習によって強化された連鎖的思考(CoT)推論を利用して少数ショット学習を行い、RLエージェントは継続的学習のためにリプレイバッファ管理を採用し、その結果、効率性、正確性、適応性を達成します。ARCの効果を示すためにシミュレーションが提供され、ARCを強化およびアップグレードするための将来の研究方向性についての包括的な議論が行われます。
2025-02-22T11:53:34
Robustness and Cybersecurity in the EU Artificial Intelligence Act
http://arxiv.org/abs/2502.16184v1
Henrik Nolte, Miriam Rateike, Michèle Finck
University of Tübingen, IBM Research Africa, Saarland University
EU人工知能法(AIA)は、異なるタイプのAIシステムに対して異なる法的原則を確立しています。以前の研究では、これらの原則のいくつかを明確にしようとしましたが、ロバスト性やサイバーセキュリティに関してはほとんど注目されていませんでした。本論文は、このギャップを埋めることを目的としています。私たちは、高リスクAIシステム(AIA第15条)および汎用AIモデル(AIA第55条)に関連するロバスト性とサイバーセキュリティに関する法的課題と欠陥を特定します。ロバスト性とサイバーセキュリティは、パフォーマンスの中断に対するレジリエンスを要求することを示します。さらに、最近の機械学習(ML)文献における進展を考慮に入れて、これらの規定を実施する際の潜在的な課題を評価します。私たちの分析は、EU委員会による調和された基準やガイドライン、さらにAIA第15(2)条に基づくベンチマークおよび測定方法論の策定に向けた努力を情報提供します。これにより、法的用語とML研究との間のギャップを埋め、研究と実施努力のより良い整合を促進することを目指します。
2025-02-22T11:12:20
BiDeV: Bilateral Defusing Verification for Complex Claim Fact-Checking
http://arxiv.org/abs/2502.16181v1
Yuxuan Liu, Hongda Sun, Wenya Guo, Xinyan Xiao, Cunli Mao, Zhengtao Yu, Rui Yan
複雑な主張のファクトチェックは、デマ検出において重要な役割を果たします。しかし、既存のファクトチェック手法は、主張の曖昧さに苦しんでおり、特に潜在情報や主張内の複雑な関係を効果的に扱うことができていません。さらに、非本質的な情報が検証プロセスを複雑化する証拠の冗長性は、依然として重大な問題です。これらの制限に対処するために、我々はバイラテラル・デフューズ・バリフィケーション(BiDeV)を提案します。これは、複数の役割を持つLLMを統合して人間の専門家によるファクトチェックプロセスを模倣する新しいファクトチェックのワークフローフレームワークです。BiDeVは、主に二つのモジュールで構成されています。曖昧さ解消モジュールは潜在情報を特定し、複雑な関係を解決して主張を単純化し、冗長性解消モジュールは冗長なコンテンツを排除して証拠の質を高めます。広く使用されている挑戦的なファクトチェックベンチマーク(HoverおよびFeverous-s)に対する extensive な実験結果は、我々のBiDeVが金基準とオープン設定の両方で最良のパフォーマンスを達成できることを示しています。これにより、複雑な主張を扱い、正確なファクトチェックを保証する上でのBiDeVの効果が強調されます。
2025-02-22T10:58:40
An End-to-End Homomorphically Encrypted Neural Network
http://arxiv.org/abs/2502.16176v1
Marcos Florencio, Luiz Alencar, Bianca Lima
INTELI - Institute of Technology and Leadership
市販されている最先端のニューラルネットワークは、プレーン入力データを使用するため、よく知られたプライバシーの懸念があります。私たちは、ホモモルフィック暗号に基づく新しいアーキテクチャを提案します。このアーキテクチャにより、ニューラルネットワークは暗号化されたデータ上で動作することができます。ホモモルフィックニューラルネットワーク(HNN)が完全なプライバシーとセキュリティを実現しながら、プレーンニューラルネットワークに匹敵する精度を維持できることを示します。また、新しいレイヤーであるディファレンシャブルソフトアルグマックスを導入し、暗号化されたドメインで出力ロジットのキャリブレーションを可能にし、アクティベーションパラメータのエントロピーを高めることで、モデルのセキュリティを改善しつつ、全体のノイズを許容されるノイズバジェット以下に抑えます。実験は、スタンフォード感情ツリーバンク(SST-2)コーパスを使用し、DistilBERTベースの未キャプスのファインチューニングされたSST-2英語感情分析モデルで行われ、その結果、HNNモデルは完全なプライバシーとセキュリティを維持しながら、プレーンモデルの精度の最大82.5%を達成できることが示されました。
2025-02-22T10:45:07
Mojito: LLM-Aided Motion Instructor with Jitter-Reduced Inertial Tokens
http://arxiv.org/abs/2502.16175v1
Ziwei Shan, Yaoyu He, Chengfeng Zhao, Jiashen Du, Jingyan Zhang, Qixuan Zhang, Jingyi Yu, Lan Xu
ShanghaiTech University, Deemos Technology
人間の身体の動きは、行動の意図や認知プロセスに関する重要な洞察を伝えますが、既存のマルチモーダルシステムは主に言語、視覚、音声を通じて人間の動きを理解することに焦点を当てており、3Dモーションに固有の動的な力やトルクを捉えることに苦労しています。慣性計測ユニット(IMU)は、有望な代替手段を提供し、軽量で着用可能、プライバシーに配慮したモーションセンシングを実現します。しかし、ストリーミングIMUデータの処理には、無線伝送の不安定性、センサーのノイズやドリフトといった課題があり、長期的なリアルタイムモーションキャプチャ(MoCap)や、より重要なオンラインモーション分析に対する有用性が制限されています。これらの課題に対処するために、私たちはMojitoを紹介します。Mojitoは、慣性センシングと大規模言語モデル(LLM)を統合したインタラクティブなモーションキャプチャと行動分析のためのインテリジェントモーションエージェントです。
2025-02-22T10:31:58
Maybe I Should Not Answer That, but... Do LLMs Understand The Safety of Their Inputs?
http://arxiv.org/abs/2502.16174v1
Maciej Chrabąszcz, Filip Szatkowski, Bartosz Wójcik, Jan Dubiński, Tomasz Trzciński
NASK - National Research Institute, Warsaw University of Technology, IDEAS NCBR, Jagiellonian University, Tooploox
大規模言語モデル (LLM) の安全性を確保することは重要ですが、現在使用されている大半の方法では、モデルのパフォーマンスが犠牲にされて、安全性が増すか、適応された分布外のデータに対してうまく機能しないことが多いです。私たちは、そのような一般化のための既存の方法を調査し、不十分であることを発見しました。驚くべきことに、単純な LLM でさえアンセーフプロンプトを認識することができるものの、それでもなお危険な応答を生成することがあります。パフォーマンスの低下を避け、安全なパフォーマンスを保持するためには、まず軽量な分類器を通じてアンセーフプロンプトを特定し、そのようなプロンプトにのみ「安全な」モデルを適用するという2段階のフレームワークを提唱します。特に、私たちは安全検知器の設計をより詳しく探求し、さまざまな分類器アーキテクチャやプロンプティング技法の使用を調査します。興味深いことに、最終トークンの最終隠れ状態が、正のデータに対する偽陽性を最小限に抑えつつ、悪意のあるプロンプト検知でうまく機能するための十分なロバストパフォーマンスを提供することがわかりました。さらに、異なるモデルレイヤーからの表現に基づいて訓練された分類器が、最新のモデルレイヤーで同等の性能を示すことを示しています。これは、安全性の表現がLLMの隠れ状態にほとんどすべてのモデル段階で存在していることを示唆しています。私たちの研究は、LLMのための効率的な表現ベースの安全メカニズムに向けた一歩です。
2025-02-22T10:31:50
EPERM: An Evidence Path Enhanced Reasoning Model for Knowledge Graph Question and Answering
http://arxiv.org/abs/2502.16171v1
Xiao Long, Liansheng Zhuang, Aodi Li, Minghong Yao, Shafei Wang
優れた推論能力により、大規模言語モデル(LLM)は知識グラフ質問応答(KGQA)タスクにおいて印象的なパフォーマンスを示しています。KGQAタスクは、知識グラフ(KG)に対する自然言語の質問から回答を見つけることです。LLMの幻覚や知識不足の問題を軽減するために、既存の方法はしばしばKGから質問関連情報を取得して入力コンテキストを豊かにすることに焦点を当てています。しかし、ほとんどの方法は関連情報の retrieval に集中し、推論における異なるタイプの知識の重要性を無視しているため、パフォーマンスが低下します。これに対処するために、本論文はKGQAの問題をグラフィカルモデルとして再定義し、KGQAのための証拠パス強化推論モデル(EPERM)という三段階のフレームワークを提案します。第一段階では、EPERMはファインチューニングされたLLMを使用して、元の知識グラフから質問に関連するサブグラフを取得します。第二段階では、EPERMは質問の推論を信頼して支援する証拠パスをフィルタリングし、推論におけるそれらの重要性をスコア付けします。最後に、EPERMは重み付けされた証拠パスを使用して最終的な回答を推論します。KG内の異なる構造情報の重要性を考慮することで、EPERMはKGQAタスクにおけるLLMの推論能力を向上させることができます。ベンチマークデータセットでの広範な実験は、EPERMがKGQAタスクにおいて優れたパフォーマンスを達成することを示しています。
2025-02-22T10:05:22
Destroy and Repair Using Hyper Graphs for Routing
http://arxiv.org/abs/2502.16170v1
Ke Li, Fei Liu, Zhengkun Wang, Qingfu Zhang
最近のニューラル組み合わせ最適化(NCO)の進展は、旅行セールスマン問題(TSP)や容量制約付き車両ルーティング問題(CVRP)などのルーティング問題を、手作りの設計なしに解決する方法として期待されています。この分野の研究は、主に反復的手法と非反復的手法の2つの主要なカテゴリを探求してきました。非反復的手法はほぼ最適な解を直接生成するのが難しい一方で、反復的手法は局所探索のステップを学習することでタスクを簡素化します。しかし、既存の反復的手法は制限された近傍探索によってしばしば制約を受け、最適でない結果につながります。この制限に対処するために、私たちは破壊と修復の戦略を学習することで探索をより大きな近傍に拡張する新しいアプローチを提案します。具体的には、ハイパーグラフに基づく破壊と修復のフレームワーク(DRHG)を導入します。このフレームワークは、連続して intact(無傷な)エッジをハイパーエッジに減少させることで、モデルが破壊された部分により多くの注意を払えるようにし、すべてのノードをエンコードする複雑さを減少させます。実験結果は、DRHGが最大10,000ノードのTSPで最先端のパフォーマンスを達成し、実世界のTSPLibおよびCVRPLibの問題に対して強い一般化能力を示すことを示しています。
2025-02-22T10:04:58
Patterns Over Principles: The Fragility of Inductive Reasoning in LLMs under Noisy Observations
http://arxiv.org/abs/2502.16169v1
Chunyang Li, Weiqi Wang, Tianshi Zheng, Yangqiu Song
HKUST
帰納推論は人間の認知の基盤であり、限られたデータから一般化を可能にしますが、大規模言語モデル(LLM)によってはまだ完全には達成されていません。現代のLLMは推論タスクに優れていますが、不完全な観察における安定した一貫したルール抽象の維持能力はまだ十分に探求されていません。このギャップを埋めるために、本研究では、ノイズのある例と融合したデータからルールを推測するLLMの能力を評価するタスクである「ロバストルール導出」を紹介します。このタスクに対処するために、観察の多様化と実行ガイドによるフィードバックを通じて推論の安定性を向上させる方法である「サンプル駆動ルール精緻化(SRR)」を提案します。算術、暗号学、リスト関数に関する実験から次のことが明らかになりました:(1)SRRは、ノイズ下でのパフォーマンス低下を最小限に抑えて他の方法を上回ります;(2)わずかな精度の変動にもかかわらず、LLMはノイズ下で不安定性を示します(例:70%の一貫したスコアで0%の精度変化);(3)反事実的なタスクギャップは、LLMが真の抽象化よりも記憶されたパターンに依存していることを強調します。我々の発見は、LLMの推論の堅牢性に挑戦し、仮説の漂流とパターンの過剰適合に対する感受性を明らかにするとともに、人間のような帰納システムの開発に不可欠な実証的証拠を提供します。コードとデータは\href{https://github.com/lcy2723/Robust-Rule-Induction}{https://github.com/lcy2723/Robust-Rule-Induction}で入手可能です。
2025-02-22T10:03:19
PersGuard: Preventing Malicious Personalization via Backdoor Attacks on Pre-trained Text-to-Image Diffusion Models
http://arxiv.org/abs/2502.16167v1
Xinwei Liu, Xiaojun Jia, Yuan Xun, Hua Zhang, Xiaochun Cao
拡散モデル(DM)は、特にテキストから画像への合成(T2I)においてデータ生成に革命をもたらしました。しかし、パーソナライズされた生成モデルの広範な使用は、プライバシーの侵害や著作権侵害に関する重大な懸念を引き起こします。これらの問題に対処するために、研究者たちは敵対的摂動に基づく保護技術を提案しました。しかし、これらの方法には明らかな制限があり、データ変換に対する堅牢性が不足しており、生成された出力内で保護されたオブジェクトの識別可能な特徴を完全に排除することができません。この論文では、特定の画像の悪意あるパーソナライズを防ぐ新しいバックドアベースのアプローチ「PersGuard」を紹介します。従来の敵対的摂動法とは異なり、PersGuardは事前に訓練されたT2Iモデルにバックドアトリガーを埋め込み、指定された保護された画像のカスタマイズされた出力を生成できないようにしながら、保護されていない画像には通常のパーソナライズを許可します。不運なことに、既存のT2I拡散モデル用のバックドア手法は、異なるバックドア目標と、下流のファインチューニングプロセス中にバックドアが排除される可能性のため、パーソナライズシナリオには適用できません。これに対処するために、私たちはパーソナライズシナリオ向けに特別に設計された3つの新しいバックドア目標を提案するとともに、下流のファインチューニングに対抗できるバックドア保持損失を設計しました。これらの要素は、統一された最適化フレームワークに統合されます。広範な実験評価は、PersGuardが、グレー ボックス設定、複数オブジェクト保護、および顔のアイデンティティシナリオなどの困難な条件下でもデータプライバシーを維持する上での効果的であることを示しています。私たちの方法は、既存の技術を大きく上回り、プライバシーと著作権保護のためのより堅牢なソリューションを提供します。
2025-02-22T09:47:55
Chain-of-Description: What I can understand, I can put into words
http://arxiv.org/abs/2502.16137v1
Jiaxin Guo, Daimeng Wei, Zongyao Li, Hengchao Shang, Yuanchang Luo, Hao Yang
本論文では、マルチモーダル大規模言語モデルに合わせた新しい戦略「Chain-of-Description (CoD) プロンプティング」を提案します。このアプローチでは、モデルがまずマルチモーダル入力の詳細な説明を提供し、その後に質問に対する回答を生成します。Qwen2-Audio、Qwen2-VL、Qwen2.5-VLなどのモデルに適用した場合、CoD プロンプティングは標準的なプロンプティング手法と比較してパフォーマンスを大幅に向上させます。これは、オーディオベンチマーク AIR-Bench-Chat のスピーチカテゴリーでほぼ4\%の改善、ビジョンベンチマーク MMMU_Pro のハードレベル部分で5.3\%の改善によって示されています。アブレーションスタディによって、CoD プロンプティングの有効性がさらに検証されます。
2025-02-22T08:27:31
Robust Dynamic Facial Expression Recognition
http://arxiv.org/abs/2502.16129v1
Feng Liu, Hanyang Wang, Siyuan Shen
Shanghai Jiao Tong University, Midea Group Inc., Baidu Inc.
動的顔表情認識(DFER)の研究は、ビデオデータにおける顔の表情を自動で認識する新しい研究分野です。既存の研究は主にノイズのあるサンプルや難しいサンプルの下での表現の学習に焦点を当てていますが、両方のタイプのサンプルが共存する問題は未解決のままです。この課題を克服するために、本論文では難しいサンプルとノイズのあるサンプルを区別するための強力な方法を提案します。これは、異なるビデオクリップのモデルの予測一致を評価することによって達成されます。その後、難しいサンプルの学習を強化し、ノイズのあるサンプルの影響を軽減する方法論が採用されることができます。さらに、ビデオ内の主要な表情を特定し、モデルの表現学習能力を強化するために、主要な表情再サンプリングフレームワークと二重ストリーム階層ネットワークを組み込んだ、頑健な動的顔表情認識(RDFER)が提案されます。主要な表情再サンプリングフレームワークは、主要な表情を特定するように設計されており、ターゲット外の表情によって引き起こされる混乱を軽減します。RDFERは、短期的な顔の動きと長期的な感情の変化を解きほぐすことを目的とした2つのシーケンスモデルを使用しています。提案された方法は、DFERにおける最先端アプローチを超えることが、DFEWやFERV39Kなどのベンチマークデータセットに対する広範な実験を通じて示されています。包括的な分析は、提案された一致に関する貴重な見解と観察を提供します。この研究は、動的顔表情認識の分野に対して重要な影響を及ぼし、動的顔表情認識におけるノイズ一貫性のある頑健な学習のさらなる発展を促進します。コードはhttps://github.com/Cross-Innovation-Lab/RDFERから入手可能です。
2025-02-22T07:48:12
Heterogeneous Multi-Agent Bandits with Parsimonious Hints
http://arxiv.org/abs/2502.16128v1
Amirmahdi Mirfakhar, Xuchuang Wang, Jinhang Zuo, Yair Zick, Mohammad Hajiesmaili
私たちは、エージェントがアームを引くことに加えて、低コストの観測(ヒント)をクエリできるというヒント付きの異種型マルチエージェントマルチアームバンディット問題(HMA2B)を研究します。この枠組みでは、$M$人のエージェントそれぞれが$K$アームに対して独自の報酬分布を持ち、$T$ラウンドの間に、他のエージェントがそのアームを引いていない場合のみ、自分が引いたアームの報酬を観測できます。目標は、アームを引くことなく、最小限の必要なヒントをクエリすることで総合効用を最大化し、時間に依存しない後悔を達成することです。HMA2Bを集中型および分散型設定の両方で研究します。私たちの主要な集中型アルゴリズムであるGP-HCLAは、HCLAの拡張であり、アームの引き方とヒントのクエリに中央の意思決定者を使用し、$O(M4K)$の後悔を達成し、$O(MK\log T)$の適応的ヒントを提供します。分散型設定では、HD-ETCとEBHD-ETCという2つのアルゴリズムを提案し、エージェントが衝突ベースのコミュニケーションを通じて独立して行動を選択し、停止するまで均等にヒントをクエリすることを可能にし、前者が最小ギャップの知識を必要としない一方で、$O(M3K2)$の後悔と$O(M3K\log T)$のヒントを得られます。最後に、結果の最適性を証明するための下限を確立し、数値シミュレーションを通じてそれらを検証します。
2025-02-22T07:46:41
PlanGEN: A Multi-Agent Framework for Generating Planning and Reasoning Trajectories for Complex Problem Solving
http://arxiv.org/abs/2502.16111v1
Mihir Parmar, Xin Liu, Palash Goyal, Yanfei Chen, Long Le, Swaroop Mishra, Hossein Mobahi, Jindong Gu, Zifeng Wang, Hootan Nakhost, Chitta Baral, Chen-Yu Lee, Tomas Pfister, Hamid Palangi
最近のエージェントフレームワークや推論時アルゴリズムは、生成された計画の検証や単一のタスク内の異なるインスタンスの複雑さに対する推論に制約があるため、複雑な計画問題に対処するのが難しい場合が多いです。これらのタスクに対する多くの既存の方法は、制約を考慮せずにタスクレベルの検証を行うか、インスタンスレベルの複雑性に適応せずに推論時アルゴリズムを適用しています。これらの制約に対処するために、我々はPlanGENを提案します。PlanGENはモデルに依存せず、容易にスケーラブルなエージェントフレームワークであり、以下の3つの重要なコンポーネントを持っています:制約エージェント、検証エージェント、選択エージェント。具体的には、我々のアプローチは、推論時アルゴリズムの性能を向上させるために制約に基づく反復検証を提案します——Best of N、Tree-of-Thought、そしてREBASEです。PlanGENフレームワークでは、選択エージェントがインスタンスの複雑さに基づいてアルゴリズムの選択を最適化し、複雑な計画問題への適応性を向上させます。実験結果は、複数のベンチマークにおいて最も強力なベースラインを大幅に上回る改善を示し、NATURAL PLAN(約8%の向上)、OlympiadBench(約4%の向上)、DocFinQA(約7%の向上)、およびGPQA(約1%の向上)で最先端の結果を達成しました。我々の重要な発見は、制約に基づく反復検証が推論時アルゴリズムを改善し、適応可能な選択が複雑な計画および推論問題における性能をさらに向上させることを示しています。
2025-02-22T06:21:56
NeurFlow: Interpreting Neural Networks through Neuron Groups and Functional Interactions
http://arxiv.org/abs/2502.16105v1
Tue M. Cao, Nhat X. Hoang, Hieu H. Pham, Phi Le Nguyen, My T. Thai
ニューラルネットワークの内部動作を理解することは、モデルの性能と解釈可能性を向上させるために不可欠です。現在の研究は主に、個々のニューロンとモデルの最終予測との関係を調査することに重点を置いています。しかし、これは、ニューロンが複数の無関係な特徴をエンコードするときに、モデルの内部動作を解釈することが難しいという課題に直面しています。本論文では、個々のニューロンの分析からニューロングループの調査へと焦点を移し、ニューロン出力の関係からニューロン間の機能的相互作用に重点を移す新しいフレームワークを提案します。私たちの自動化されたフレームワークであるNeurFlowは、最初にコアニューロンを特定し、共有された機能的関係に基づいてそれらをグループにクラスタリングします。これにより、ネットワークの内部プロセスのより一貫性があり解釈しやすい視点を可能にします。このアプローチは、層間でのニューロン相互作用を表す階層的回路の構築を容易にし、解釈可能性を向上させるとともに、計算コストを削減します。私たちの広範な実証研究は、提案したNeurFlowの忠実性を検証しています。さらに、画像デバッグや自動概念ラベリングなどの実用的なアプリケーションにおける有用性を示し、ニューラルネットワークの説明可能性の分野を進展させる可能性を強調しています。
2025-02-22T06:01:03
Worse than Zero-shot? A Fact-Checking Dataset for Evaluating the Robustness of RAG Against Misleading Retrievals
http://arxiv.org/abs/2502.16101v1
Linda Zeng, Rithwik Gupta, Divij Motwani, Diji Yang, Yi Zhang
The Harker School, Irvington High School, Palo Alto High School, University of California Santa Cruz
リトリーバル拡張生成(RAG)は、大規模言語モデル(LLM)の幻覚を軽減する上で印象的な能力を示しています。しかし、LLMは誤解を招くリトリーバルを処理するのに苦労し、対立するあるいは選択的に枠付けされた証拠にさらされると、自らの推論を維持することにしばしば失敗し、現実世界の誤情報に対して脆弱になります。このような現実のリトリーバルシナリオでは、誤解を招く情報や対立する情報が横行しており、特に政治的領域では、証拠が選択的に枠付けられたり、不完全であったり、偏ったりすることが多いです。しかし、既存のRAG基準は主にクリーンなリトリーバル環境を前提としており、モデルはゴールドスタンダードの文書から正確に回答をリトリーバルし生成することで成功します。この前提は現実の条件とは一致せず、RAGシステムの性能を過大評価する結果になります。このギャップを埋めるために、誤解を招くリトリーバルに対するRAGシステムの堅牢性を評価するために設計されたファクトチェックデータセット「RAGuard」を導入します。従来の合成ノイズに依存する基準とは異なり、我々のデータセットはRedditの議論からリトリーバルコーパスを構築し、自然に発生する誤情報をキャッチします。リトリーバルされた証拠を支持するもの、誤解を招くもの、および無関係なものの3種類に分類し、異なるリトリーバル情報をどの程度RAGシステムがうまくナビゲートできるかを評価するための現実的で挑戦的なテストベッドを提供します。我々の基準実験では、誤解を招くリトリーバルにさらされたとき、テストされた全てのLLM駆動のRAGシステムがゼロショットのベースライン(すなわち、全くリトリーバルしない)よりも悪化することが明らかになり、ノイズの多い環境に対する脆弱性が明らかになりました。私たちの知る限り、RAGuardは誤解を招く証拠に対するRAGの堅牢性を体系的に評価する初の基準です。この基準が理想化されたデータセットを超えてRAGシステムの改善に向けた将来の研究を促進し、現実世界のアプリケーションに対してより信頼性のあるものとなることを期待しています。
2025-02-22T05:50:15
LitLinker: Supporting the Ideation of Interdisciplinary Contexts with Large Language Models for Teaching Literature in Elementary Schools
http://arxiv.org/abs/2502.16097v1
Haoxiang Fan, Changshuang Zhou, Hao Yu, Xueyang Wu, Jiangyu Gu, Zhenhui Peng
Sun Yat-sen University, University of Macau, NeurlStar, Xiangzhou Experimental School of Zhuhai
学際的な文脈(例えば、科学や芸術)での文学教育は、読み物を結びつけることができるため、小学校で人気が高まっています。しかし、そのような文脈を構築することは困難であり、教師が多くの学際的な内容を探求し、それを読み物に関連付ける必要があります。本論文では、文学教育のための学際的な文脈の発想を促進するために、13人の教師を巻き込んだ反復的なデザインプロセスを通じてLitLinkerを開発します。大規模な言語モデル(LLM)を活用するLitLinkerは、学際的なトピックを推薦し、それを読み物の文学的要素(例:段落、視点)と結び付けることができます。被験者内研究(N=16)では、LLMチャットボットと比較して、LitLinkerは異なる教科の統合の深さを改善し、この発想タスクの負担を軽減できることが示されています。専門家インタビュー(N=9)でも、文学教育のための学際的な文脈の発想を支援するLitLinkerの有用性が示されています。最後に、LLMを用いた学際的な教育を支援するための懸念事項とデザイン上の考慮について結論を述べます。
2025-02-22T05:40:19
Recurrent Knowledge Identification and Fusion for Language Model Continual Learning
http://arxiv.org/abs/2502.17510v1
Yujie Feng, Xujia Wang, Zexin Lu, Shenghong Fu, Guangyuan Shi, Yongxin Xu, Yasha Wang, Philip S. Yu, Xu Chu, Xiao-Ming Wu
The Hong Kong Polytechnic University, Tsinghua University, Peking University, Huawei Hong Kong Research Center, University of Illinois at Chicago
継続的学習(CL)は、費用のかかる再訓練なしに動的な現実世界の環境で大規模言語モデル(LLM)を展開するために重要です。最近のパラメータ重要性に基づくモデルアンサンブルやモデルマージの手法は人気を集めていますが、それらは逐次訓練中の静的な重要性推定に依存するため、知識の移転と忘却のバランスを取るのに苦労することが多いです。本論文では、Recurrent-KIFという新しいCLフレームワーク、再帰的知識識別と統合を提案します。これにより、パラメータ重要性分布を動的に推定し、知識の移転を強化します。人間の継続的学習に触発され、Recurrent-KIFは重要なパラメータを特定しつつ新しいタスクに迅速に適応する内部ループと、新しい知識と歴史的知識の融合を冗長な知識の剪定や重要な知識の統合を通じてグローバルに管理する外部ループを採用しています。これらの内部・外部ループは反復的に複数回の融合を行い、Recurrent-KIFは中間訓練情報を活用し、進化する重要性分布に基づいて融合戦略を適応的に調整することができます。770Mから13Bまでのさまざまなモデルサイズを持つ2つのCLベンチマークに関する広範な実験により、Recurrent-KIFは破滅的な忘却を効果的に軽減し、知識の移転を強化することが示されています。
2025-02-22T05:37:27
Privacy-Aware Joint DNN Model Deployment and Partition Optimization for Delay-Efficient Collaborative Edge Inference
http://arxiv.org/abs/2502.16091v1
Zhipeng Cheng, Xiaoyu Xia, Hong Wang, Minghui Liwang, Ning Chen, Xuwei Fan, Xianbin Wang
Soochow University, RMIT University, Tongji University, China University of Petroleum (East China), Fujian Agriculture and Forestry University, Western University
エッジ推論(EI)は、クラウドベースの深層ニューラルネットワーク(DNN)推論における応答遅延、スケーラビリティの制限、プライバシーの懸念といった増大する課題に対処するための重要なソリューションです。しかし、リソース制約のあるエッジデバイスにDNNモデルを展開することには、モデルのストレージ制限、動的サービス要求、プライバシーリスクなど、より深刻な課題があります。本論文では、リソースとプライバシーの制約の下で長期的な平均推論遅延を最小化するためのプライバシーを考慮したDNNモデルの共同展開とパーティション最適化のための新しいフレームワークを提案します。具体的には、モデルの展開、ユーザーとサーバーの関連付け、モデルのパーティション戦略を考慮した複雑な最適化問題としてこの問題を定式化します。NP困難性と将来の不確実性に対処するために、長期的な最適化を単一の時間スロット問題に変換するためのリャプノフベースのアプローチが導入され、システムのパフォーマンスが保証されます。さらに、エッジサーバーの関連付けのための連合形成ゲームモデルが提案され、各連合内でモデルを展開するための貪欲ベースのアルゴリズムが開発されており、問題を効率的に解決します。広範なシミュレーションにより、提案されたアルゴリズムが推論遅延を効果的に減少させつつ、プライバシー制約を満たし、さまざまなシナリオでベースラインアプローチを上回ることが示されています。
2025-02-22T05:27:24
Echo: A Large Language Model with Temporal Episodic Memory
http://arxiv.org/abs/2502.16090v1
WenTao Liu, Ruohua Zhang, Aimin Zhou, Feng Gao, JiaLi Liu
大規模言語モデル(LLM)に関する研究は、数学、プログラミング、および文学創作などの分野で素晴らしい性能を示しています。しかし、ほとんどの研究は意味記憶に基づく質問応答に焦点を当てており、エピソード記憶(EM)に関連するクエリを処理するLLMの潜在能力を軽視しています。この見落としは、感情的な伴侶、個人AIアシスタント、AI教師など、EMを必要とするアプリケーションでのパフォーマンスが最適でない結果を招いています。このギャップに対処するために、我々は時間的エピソード記憶で強化されたLLMであるEchoを紹介します。複数ターンの複雑なシナリオのエピソード記憶対話データ(EM-Train)の生成をガイドするマルチエージェントデータ生成フレームワークを提案します。時間的情報は革新的にLLMのトレーニングプロセスに組み込まれ、EchoはEM-Trainを使用してトレーニングされます。さらに、LLMのエピソード記憶能力を評価するために特別に設計されたEM-Testベンチマークを開発しました。EM-Testは、さまざまな時間スパンと難易度レベルでのパフォーマンスを評価し、複数ターンのエピソード記憶対話の包括的な評価を提供します。我々の実験は、EchoがEM-Testで最先端のLLMを大幅に上回ることを示しています。さらに、定性的分析により、Echoが人間のようなエピソード記憶能力を示す潜在性を持っていることが明らかになりました。すべてのデータセット、コード、およびモデルの重みをオープンソースとして公開します。
2025-02-22T05:25:20
Together We Rise: Optimizing Real-Time Multi-Robot Task Allocation using Coordinated Heterogeneous Plays
http://arxiv.org/abs/2502.16079v1
Aritra Pal, Anandsingh Chauhan, Mayank Baranwal
TCS
複数のロボット間での効率的なタスク割り当ては、特にオンライン注文の履行に伴う需要の増加に対応するために、現代の倉庫における生産性の最適化に不可欠です。本論文では、指定された開始地点と終了地点を持つタスクが発生する動的な倉庫環境におけるリアルタイムのマルチロボットタスク割り当て(MRTA)問題に取り組みます。目的は、ロボットの総移動距離とタスク完了の遅延を最小限に抑えることであり、バッテリーマネジメントや衝突回避などの実際の制約も考慮します。私たちは、タスクの割り当てとロボットの選択を最適化し、迅速なタスク実行を確保するために、自己対戦に触発された二重エージェント強化学習(RL)フレームワークであるMRTAgentを紹介します。安全なナビゲーションのために、修正された線形二次制御器(LQR)アプローチが採用されています。私たちの知る限り、MRTAgentは、連続したロボットの動作をサポートしつつ、実用的なMRTA問題のすべての重要な側面に取り組む初めてのフレームワークです。
2025-02-22T04:59:27
Curie: Toward Rigorous and Automated Scientific Experimentation with AI Agents
http://arxiv.org/abs/2502.16069v1
Patrick Tser Jern Kon, Jiachen Liu, Qiuyi Ding, Yiming Qiu, Zhenning Yang, Yibo Huang, Jayanth Srinivasa, Myungjin Lee, Mosharaf Chowdhury, Ang Chen
科学実験は人類の進歩の礎であり、有意義な結果を導き出すためには信頼性、体系的な制御、解釈可能性において厳密さが求められます。さまざまな科学的プロセスの自動化における大規模言語モデル(LLM)の能力が向上しているにもかかわらず、厳密な実験の自動化は依然として大きな課題です。このギャップに対処するために、私たちはCurieというAIエージェントフレームワークを提案します。これは、実験プロセスに厳密さを組み込むために、信頼性を高めるためのエージェント内部厳密モジュール、体系的な制御を維持するためのエージェント間厳密モジュール、解釈可能性を高めるための実験知識モジュールの3つの主要なコンポーネントで構成されています。Curieを評価するために、影響力のある研究論文や広く採用されたオープンソースプロジェクトから派生した、4つのコンピュータサイエンス領域にわたる46の質問で構成された新しい実験ベンチマークを設計しました。テストした最強のベースラインと比較して、実験的な質問に対する正しい回答率を3.4倍改善しました。Curieはhttps://github.com/Just-Curieous/Curieでオープンソースされています。
2025-02-22T03:58:19
A Survey of Model Extraction Attacks and Defenses in Distributed Computing Environments
http://arxiv.org/abs/2502.16065v1
Kaixiang Zhao, Lincan Li, Kaize Ding, Neil Zhenqiang Gong, Yue Zhao, Yushun Dong
University of Notre Dame, Florida State University, Northwestern University, Duke University, University of Southern California
モデル抽出攻撃(MEAs)は、敵対者がモデルを盗むことを可能にすることで、現代の機械学習システムに脅威を与え、知的財産やトレーニングデータを露出させます。クラウド、エッジ、連合学習環境を含む分散コンピューティング環境における機械学習モデルの導入が進むにつれ、それぞれのパラダイムは独自の脆弱性と課題をもたらします。これらの分散環境におけるMEAsに対する統一的な視点がなければ、組織は防御が分断され、リスク評価が不十分となり、経済的およびプライバシーに関する重大な損失を被る危険があります。この調査は、クラウド、エッジ、および連合展開の独自の特性が攻撃ベクトルや防御要件にどのように影響するかを理解するという緊急のニーズに動機づけられています。私たちは、これらの環境における攻撃手法と防御メカニズムの進化を体系的に調査し、環境要因が自動運転車、医療、金融サービスなどの重要な分野におけるセキュリティ戦略にどのように影響を与えるかを示します。MEAs研究の最近の進展を統合し、現在の評価方法の限界について議論することで、この調査は堅牢で適応的な防御戦略を開発するための重要な洞察を提供します。私たちの包括的なアプローチは、機械学習モデルの安全な展開を確保するために、分散コンピューティング全体にわたって保護措置を統合する重要性を強調しています。
2025-02-22T03:46:50
Single-Channel EEG Tokenization Through Time-Frequency Modeling
http://arxiv.org/abs/2502.16060v1
Jathurshan Pradeepkumar, Xihao Piao, Zheng Chen, Jimeng Sun
University of Illinois Urbana-Champaign, SANKEN, Osaka University
私たちは、EEG分析に特化した新しいトークン化フレームワークであるTFM-Tokenizerを紹介します。TFM-Tokenizerは、連続的でノイズのある脳波信号を、さまざまなEEGタスクのための離散的かつ良好に表現されたトークンのシーケンスに変換します。従来のアプローチは、通常、連続的な埋め込みとチャネル間の依存関係に依存しており、時間的に予測できないパターンや多様な振動波形といった固有のEEG特徴を捉えるには限界があります。それに対して、我々は重要な時間周波数特徴が単一チャネルから効果的に捉えられると仮定しています。この単一チャネル内の固有のパターンを内包するトークンを学習することによって、我々のアプローチは、さまざまなEEG設定に適応できるスケーラブルなトークナイザーを生み出します。TFM-TokenizerをTransformerベースのTFM-Encoderと統合し、マスクトークン予測などの自然言語処理からの確立された事前学習技術を活用し、その後、さまざまなEEGタスクのための下流ファインチューニングを行います。4つのEEGデータセットにわたる実験結果は、TFM-Tokenが最先端の手法を上回ることを示しています。TUEVにおいて、我々のアプローチはベースラインに対してバランスの取れた精度とコーエンのカッパを5%改善しました。学習したトークンの包括的な分析は、クラスの識別的特徴を捉える能力、周波数表現を向上させる能力、時間周波数モチーフを異なるトークンにエンコードする能力を示しており、解釈可能性を向上させています。
2025-02-22T03:32:36
Human-AI Collaboration in Cloud Security: Cognitive Hierarchy-Driven Deep Reinforcement Learning
http://arxiv.org/abs/2502.16054v1
Zahra Aref, Sheng Wei, Narayan B. Mandayam
Rutgers University
マルチテナントのクラウド環境の複雑さとリアルタイムの脅威軽減の必要性を鑑みると、セキュリティオペレーションセンター(SOC)は、高度な持続的脅威(APT)に対するAI駆動の適応防御を統合する必要があります。しかし、SOCのアナリストは、適応型の敵の戦術に対抗するのに苦労しており、知能的な意思決定支援フレームワークが必要です。SOCにおける人間とAIの協力を強化するために、我々はCognitive Hierarchy Theory(CHT)に基づいたDeep Q-Network(DQN)フレームワーク(CHT-DQN)を提案します。このフレームワークは、AI駆動のAPTボットに対するSOCアナリストの意思決定をモデル化します。SOCアナリスト(防御者)は認知レベル1で攻撃者の戦略を予測し、一方APTボット(攻撃者)はレベル0の搾取的ポリシーに従います。CHTをDQNに組み込むことにより、我々のフレームワークは攻撃グラフ(AG)に基づく強化学習を通じてSOCの防御戦略を強化します。異なるAGの複雑さにわたるシミュレーション実験では、CHT-DQNが標準DQNと比較して、データ保護が高く、行動の不一致が少ないことが示されました。理論的な下限分析も、Q値の優れた性能を裏付けています。アマゾンのMechanical Turk(MTurk)でのヒューマン・イン・ザ・ループ(HITL)評価は、CHT-DQN駆動の遷移確率を使用するSOCアナリストが、適応型攻撃者とより良く整合することを明らかにし、データ保護を改善します。さらに、人間の意思決定パターンは失敗後にリスク回避を示し、成功後にリスク追求行動を示すことが、プロスペクト理論と一致しています。これらの発見は、SOCの運用を強化し、リアルタイムの適応型クラウドセキュリティメカニズムを開発するために、認知モデルの深層強化学習への統合の可能性を強調しています。
2025-02-22T03:19:21
Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models
http://arxiv.org/abs/2502.16033v1
Qianqi Yan, Yue Fan, Hongquan Li, Shan Jiang, Yang Zhao, Xinze Guan, Ching-Chen Kuo, Xin Eric Wang
University of California, Santa Cruz, eBay
既存のマルチモーダル大規模言語モデル(MLLM)は、一貫した視覚-テキスト入力で主に訓練およびテストされており、実世界のレイアウト豊富なコンテンツにおける不一致に対応できるかどうかという問題が残されています。このギャップを埋めるために、私たちはマルチモーダル不一致推論(MMIR)ベンチマークを提案し、MLLMがウェブページ、プレゼンテーションスライド、ポスターなどのアーティファクトにおける意味的ミスマッチを検出し推論できる能力を評価します。MMIRは534の挑戦的なサンプルで構成されており、それぞれが事前に注入されたエラーを含み、事実の矛盾、同一性の誤帰属、文脈の不一致、定量的な不一致、時間/空間の不整合という5つの推論重視のカテゴリーに分類されます。私たちは6つの最先端MLLMを評価し、o1などの専用のマルチモーダル推論能力を備えたモデルが、その対照を大幅に上回る一方で、オープンソースモデルは特に不一致エラーに対して脆弱であることを示しました。詳細なエラー分析は、モデルが単一モダリティに限定された不一致の検出に優れていることを示し、特にテキストにおいては成功を収めていますが、クロスモーダルの対立や複雑なレイアウトに関しては苦労しています。調査実験では、チェイン・オブ・ソート(CoT)やセット・オブ・マーク(SoM)などの単一モダリティのプロンプトがわずかな利益をもたらすことが明らかになり、クロスモーダルの推論における主要なボトルネックが浮き彫りになりました。私たちの発見は、高度なマルチモーダル推論の必要性を強調し、マルチモーダル不一致に関する今後の研究を指し示しています。
2025-02-22T01:52:37
Clinical Inspired MRI Lesion Segmentation
http://arxiv.org/abs/2502.16032v1
Lijun Yan, Churan Wang, Fangwei Zhong, Yizhou Wang
磁気共鳴画像法(MRI)は、様々な疾患における病理組織を検出するための強力な診断ツールです。異なるMRIシーケンスは、それぞれ異なるコントラストメカニズムと異なるタイプの病変に対する感度を持っており、正確で一貫した病変セグメンテーションに挑戦をもたらします。臨床現場では、放射線科医は通常、病変を特定するために、コントラスト増強後のT1強調画像(ポスト)とコントラスト増強前の画像(プレ)の違いであるサブシーケンス機能を利用します。これに触発されて、我々はMRI病変セグメンテーションのためのサブシーケンス表現を学習するための残差融合法を提案します。具体的には、プレおよびポストのコントラストシーケンスからの特徴を、動的重みを使用して最適な融合を達成し、多様な病変増強パターンに対応するために、複数の解像度で反復的かつ適応的に融合します。我々の方法は、脳腫瘍セグメンテーションに関してBraTS2023データセットで最先端のパフォーマンスを達成し、我々の社内の乳腺MRIデータセットにおける乳腺病変セグメンテーションにおいても同様です。我々の方法は臨床的にインスパイアされており、様々な応用における病変セグメンテーションを促進する可能性を秘めています。
2025-02-22T01:37:35
Real Time Offside Detection using a Single Camera in Soccer
http://arxiv.org/abs/2502.16030v1
Shounak Desai
Rochester Institute of Technology
サッカーにおける技術の進歩は過去10年で急増し、このスポーツのさまざまな側面を変革しました。バイナリのルールとは異なり、「オフサイドルール」のような多くのサッカー規則は、単純な真偽の基準ではなく、主観的な解釈に依存しています。このような微妙な判断を下す最終的な権限を持つのは、フィールド上の審判です。サッカーの審判制度における重要な進展は、ビデオアシスタントレフェリー(VAR)システムであり、スタジアム内の20~30台のカメラのネットワークを活用して人的エラーを最小限に抑えています。VARの運用範囲は通常10~30台のカメラを含み、高い判断精度を確保しますが、それには相当なコストがかかります。この報告書は、高度な技術的セットアップに関連する費用を軽減するために、放送用カメラのような単一のカメラを使用したオフサイド検出の革新的なアプローチを提案します。
2025-02-22T01:33:26
C-3DPO: Constrained Controlled Classification for Direct Preference Optimization
http://arxiv.org/abs/2502.17507v1
Kavosh Asadi, Julien Han, Xingzi Xu, Dominique Perrault-Joncas, Shoham Sabach, Karim Bouyarmane, Mohammad Ghavamzadeh
直接的な選好最適化(DPO)スタイルのアルゴリズムは、AIにおける整合性問題を解決するための有望なアプローチとして浮上しています。私たちは、これらのアルゴリズムを暗黙の分類アルゴリズムとして定式化する新しい視点を提示します。この分類フレームワークを用いることで、適切な分類ラベルと損失関数を選択することにより、多くのDPOスタイルアルゴリズムのバリエーションを復元することが可能になります。そして、この分類フレームワークを活用して、これらのアルゴリズムで解決される根本的な問題が過小指定されていることを示し、勝者-敗者の応答の確率崩壊に対して脆弱であることを明らかにします。これに対処するため、参照ポリシーとターゲットポリシーの間で勝者と敗者の確率質量の移動を制御するために設計された一連の制約を提案します。我々の結果得られたアルゴリズムは、制約付き制御分類DPO(\texttt{C-3DPO})と呼び、このプログラムは意味のあるRLHFの解釈を持っています。確率崩壊に対してヘッジを行うことで、\texttt{C-3DPO}は標準的な選好データセットを使用して、いくつかの大規模言語モデルを整合させる際に、バニラ\texttt{DPO}に対する実用的な改善を提供します。
2025-02-22T00:38:44
RAG-Enhanced Collaborative LLM Agents for Drug Discovery
http://arxiv.org/abs/2502.17506v1
Namkyeong Lee, Edward De Brouwer, Ehsan Hajiramezanali, Chanyoung Park, Gabriele Scalia
最近の大規模言語モデル(LLM)の進展は、薬物発見の加速に大きな可能性を示しています。しかし、生化学データの専門的な性質は、しばしばコストのかかるドメイン特化のファインチューニングを必要とし、重要な課題を引き起こします。まず、これは最先端の薬物発見タスクにおけるより柔軟な汎用LLMの適用を妨げます。さらに重要なのは、実験や研究を通じて継続的に生成される膨大な科学データの迅速な統合を妨げることです。これらの課題を調査するために、私たちはCLADDを提案します。CLADDは、薬物発見タスクに特化した検索補強生成(RAG)対応のエージェンティックシステムです。複数のLLMエージェントの協力を通じて、CLADDは生物医学の知識ベースから情報を動的に取得し、クエリ分子をコンテキスト化し、関連する証拠を統合して応答を生成します -- すべてドメイン特化のファインチューニングを必要とせずに行います。重要なことに、私たちは生化学データにRAGワークフローを適用する上での主要な障害、データの非均一性、曖昧さ、及び多元ソース統合に取り組みます。このフレームワークの柔軟性と効果をさまざまな薬物発見タスクにわたって実証し、汎用LLMやドメイン特化LLM、さらには従来の深層学習アプローチを上回ることを示します。
2025-02-22T00:12:52
Cross-Model Transferability of Adversarial Patches in Real-time Segmentation for Autonomous Driving
http://arxiv.org/abs/2502.16012v1
Prashant Shekhar, Bidur Devkota, Dumindu Samaraweera, Laxima Niure Kandel, Manoj Babu
敵対的攻撃は、特に医療や自律運転などの安全に関わるアプリケーションにおいて、深層学習モデルに対して重大な脅威をもたらします。最近、パッチベースの攻撃は「ドラッグアンドドロップ」の特性のおかげで、リアルタイム推論シナリオにおいて効果的であることが示されています。このアイデアに基づいて、ここでは自律走行車にとってより現実的な新しい期待変換(EOT)に基づく敵対的パッチ攻撃を提案します。この攻撃を効果的に訓練するために、分析と実装が容易な「簡略化された」損失関数も提案します。この攻撃を基盤として、特定のセマンティックセグメンテーション(SS)モデルで最適化された敵対的パッチが、他のモデルやアーキテクチャを欺けるかどうかを調査します。私たちは、PIDNet-S、PIDNet-M、PIDNet-Lなどの最先端の畳み込みニューラルネットワーク(CNN)モデルで訓練された敵対的パッチの包括的なクロスモデル転送性分析を実施します。さらに、Vision Transformers(ViT)への転送性を調べるためにSegformerモデルも含めます。私たちの分析は、広く使用されているCityscapesデータセットで行われます。私たちの研究は、モデルアーキテクチャ(CNN対CNNまたはCNN対Transformerベース)が攻撃の脆弱性にどのように影響するかについての重要な洞察を明らかにします。特に、視認できない任意の次元の画像に対する攻撃の転送性(効果)は非常に高いものの、特定のモデルに対して訓練された攻撃は他のモデルに対して最小限の効果しかないと結論付けました。これは、ViTとCNNベースのモデルの両方に当てはまりました。さらに、私たちの結果は、CNNベースのモデルにおいてパッチ攻撃の影響が局所的であるのに対し、ViTでは異なることを示しています。クラスごとの分析では、「空」などのシンプルなクラスは他のクラスよりも誤分類が少ないことが明らかになりました。このプロジェクトのコードは、以下のリンクから入手できます:https://github.com/p-shekhar/adversarial-patch-transferability
2025-02-22T00:03:53
2025-02-09 arXiv論文リスト(cs.AI)
About
arXivに掲載されたcs.AIの論文を検索し、一部をリスト化したものです。
※AIによってAbstractを日本語に翻訳しており、内容に誤りがある可能性があります。
リスト件数: 60件
リストから抽出されたキーワード: Prompt Sensitivity, Multi-Agent Learning, Contrastive Representation
Benchmarking Prompt Sensitivity in Large Language Models
http://arxiv.org/abs/2502.06065v1
Amirhossein Razavi, Mina Soltangheis, Negar Arabzadeh, Sara Salamat, Morteza Zihayat, Ebrahim Bagheri
大規模言語モデル(LLM)は、プロンプトの構成における微妙な変化に非常に敏感であり、これが彼らの正確な応答を生成する能力に大きな影響を与える可能性があります。本稿では、新しいタスク「プロンプト感度予測」と、それを調査するために設計されたデータセット「PromptSET」を紹介します。TriviaQAおよびHotpotQAデータセットを基盤として、プロンプトのバリエーションを生成し、複数のLLMにわたってその効果を評価します。プロンプト感度予測タスクのベンチマークには、LLMによる自己評価、テキスト分類、クエリパフォーマンス予測技術など、関連タスクからの最先端の手法を採用しました。我々の調査結果は、既存の手法がプロンプト感度予測に効果的に対処するのに苦労していることを明らかにし、正確なLLM応答を得るためには情報の要求をどのように表現すべきかを理解する必要があることを強調しています。
2025-02-09T23:01:03
Multi-modal Data Fusion and Deep Ensemble Learning for Accurate Crop Yield Prediction
http://arxiv.org/abs/2502.06062v1
Akshay Dagadu Yewle, Laman Mirzayeva, Oktay Karakuş
この研究では、RicEns-Netという新しいディープアンサンブルモデルを紹介します。このモデルは、多様なデータソースを統合し、マルチモーダルデータ融合技術を通じて作物の収穫量を予測することを目的としています。研究は、合成開口レーダー(SAR)、Sentinel 1、2、3衛星からの光学リモートセンシングデータ、及び地表温度や降雨量などの気象測定データの使用に特に焦点を当てています。研究の初期フィールドデータは、アーンスト・アンド・ヤング(EY)のオープンサイエンスチャレンジ2023を通じて取得されました。主な目的は、複雑な環境データを処理できる機械学習フレームワークを開発することで、作物収穫量予測の精度を高めることです。100以上の潜在的な予測因子から最も情報量の多い特徴を選択するために、包括的なデータエンジニアリングプロセスが採用され、5つの異なるモダリティから15の特徴にセットが削減されました。このステップは「次元の呪い」を軽減し、モデルの性能を向上させます。RicEns-Netアーキテクチャは、複数の機械学習アルゴリズムをディープアンサンブルフレームワークで組み合わせ、各技術の強みを統合して予測精度を向上させています。実験結果は、RicEns-Netが341 kg/Haという平均絶対誤差(MAE)を達成しており(これは地域の最低平均収量の約5-6%に相当します)、EYチャレンジで開発されたモデルを含む従来の最先端モデルの性能を大幅に上回っていることを示しています。
2025-02-09T22:48:27
Online Reward-Weighted Fine-Tuning of Flow Matching with Wasserstein Regularization
http://arxiv.org/abs/2502.06061v1
Jiajun Fan, Shuaike Shen, Chaoran Cheng, Yuxin Chen, Chumeng Liang, Ge Liu
University of Illinois Urbana-Champaign, Zhejiang University, Tsinghua University, University of Southern California
強化学習(RL)の最近の進展は、拡散ベースの生成モデルのファインチューニングにおいて大きな成功を収めています。しかし、任意のユーザー定義の報酬関数に合わせて連続フローベースの生成モデルをファインチューニングすることは依然として難しい課題であり、特に過剰最適化による方針の崩壊や、連続時間フローにおける尤度の計算コストの高騰といった問題が原因です。本論文では、「オンライン報酬重み付け条件付きフローマッチングとワッサースタイン-2正則化(ORW-CFM-W2)」と呼ぶ、使いやすく理論的に堅牢なRLファインチューニング手法を提案します。我々の手法は、フローマッチングの枠組みにRLを統合し、報酬の勾配やフィルタリングされたデータセットに頼ることなく、任意の報酬関数を持つ生成モデルをファインチューニングします。オンラインの報酬重み付けメカニズムを導入することにより、我々のアプローチはモデルがデータ多様体の高報酬領域を優先するように誘導します。方針の崩壊を防ぎ、多様性を維持するために、我々の手法にはワッサースタイン-2(W2)距離の正則化を取り入れ、フローマッチングにおける実用的な上限を導出し、方針最適化の探索と活用のバランスを効果的に保ちます。我々の手法の収束特性と誘導されるデータ分布を示す理論的分析を提供し、従来のRLアルゴリズムとの関係を築き、我々のアプローチの基盤となるメカニズムと学習行動についてより包括的な理解を提供します。ターゲット画像生成、画像圧縮、テキストと画像の整列を含むタスクに関する広範な実験は、最適な方針収束を達成しながら報酬最大化と多様性保存との制御可能なトレードオフを可能にする我々の手法の有効性を示しています。
2025-02-09T22:45:15
Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning
http://arxiv.org/abs/2502.06060v1
Bidipta Sarkar, Warren Xia, C. Karen Liu, Dorsa Sadigh
Stanford University
多エージェントの設定において自然言語でコミュニケーションを行うことは強力なツールです。これは、独立したエージェントが部分的に観察可能な設定で情報を共有でき、人間とゼロショットで協調できるようにするからです。しかし、ほとんどの従来の研究は、大量の人間のデモに依存するか、自然で有用なコミュニケーション戦略を生成する能力に欠けています。本研究では、人間のデモなしで、自然言語で環境について生産的な議論を行うために言語モデルを訓練します。私たちはコミュニケーションの問題を「聞くこと」と「話すこと」に分解します。私たちの鍵となるアイデアは、エージェントの目標を利用して、世界に関する有用な情報を予測することを、コミュニケーションを導く密な報酬信号として活用することです。具体的には、エージェント間の議論に基づいて環境に関する情報を予測するようにモデルのリスニング能力を向上させ、同時に他のエージェントに対する影響に基づいてメッセージを報酬することで、マルチエージェント強化学習でモデルのスピーキング能力を向上させます。複雑な社会設定におけるコミュニケーションの役割と必要性を調査するために、Among Usをベースにした具現化された社会的推論ゲームを研究します。ここでの重要な質問は、敵の偽装者の正体です。私たちの技術によって生じた行動、たとえば容疑者を非難し証拠を提供する行動を分析し、これが強力な議論を可能にし、標準的なRLと比べて勝率を倍増させることを発見しました。私たちはコードとモデルをhttps://socialdeductionllm.github.io/で公開します。
2025-02-09T22:44:45
Nearly Optimal Sample Complexity of Offline KL-Regularized Contextual Bandits under Single-Policy Concentrability
http://arxiv.org/abs/2502.06051v1
Qingyue Zhao, Kaixuan Ji, Heyang Zhao, Tong Zhang, Quanquan Gu
University of California, Los Angeles, University of Illinois Urbana-Champaign
KL正則化ポリシー最適化は、学習に基づく意思決定の主要な手段となっていますが、その理論的理解はまだ非常に限られています。最近の進展により、KL正則化コンテキストバンディットのサンプル複雑性に関する問題が解決に向かっていますが、既存のサンプル複雑性の下限は、単一ポリシー集中性の下で $\tilde{O}(\epsilon^{-2})$ または全ポリシー集中性の下で $\tilde{O}(\epsilon^{-1})$ となっています。本論文では、オフラインコンテキストバンディットのための単一ポリシー集中性の下で、$\tilde{O}(\epsilon^{-1})$ のサンプル複雑性を持つ\emph{初の}アルゴリズムを提案します。私たちのアルゴリズムは一般的な関数近似に対応しており、\emph{不確実性に直面した悲観主義}の原則に基づいています。私たちの証明の核心は、KL正則化の強い凸性と、真の報酬とその悲観的推定値のギャップの条件付き非負性を利用して、平均値型リスクの上限を極端に洗練させることにあります。これにより、関数クラス内の任意の2つの関数間のずれに対して一様な制御が必要ない新しい共分散ベースの分析につながります。私たちのアルゴリズムの近似最適性は、$\tilde{\Omega}(\epsilon^{-1})$ の下限によって示されます。さらに、私たちのアルゴリズムをコンテキストデュエリングバンディットに拡張し、類似のほぼ最適なサンプル複雑性を達成します。
2025-02-09T22:14:45
LM2: Large Memory Models
http://arxiv.org/abs/2502.06049v1
Jikun Kang, Wenqi Wu, Filippos Christianos, Alex J. Chan, Fraser Greenlee, George Thomas, Marvin Purtorab, Andy Toulis
この論文では、大規模メモリモデル(LM2)を紹介します。これは、マルチステップ推論、関係のある論証、および長い文脈に分散した情報の統合における標準トランスフォーマーの限界に対処することを目的とした、補助メモリモジュールを強化したデコーダー専用のトランスフォーマーアーキテクチャです。提案されたLM2は、入力トークンとクロスアテンションを介して相互作用し、ゲーティングメカニズムを通じて更新されるコンテキスト表現リポジトリとして機能するメモリモジュールを取り入れています。トランスフォーマーの汎用的な機能を保つために、LM2は補完的なメモリパスを統合しつつ、元の情報フローを維持します。BABILongベンチマークにおける実験結果は、LM2モデルがメモリ拡張RMTモデルを37.1%、ベースラインのLlama-3.2モデルを平均して86.3%上回っていることを示しています。LM2は、マルチホップ推論、数的推論、および大規模コンテキストの質問応答において卓越した能力を示しています。MMLUデータセットでは、事前学習されたバニラモデルよりも5.0%の改善を達成し、そのメモリモジュールが一般タスクの性能を低下させないことを示しています。さらに、私たちの分析では、メモリの解釈可能性、メモリモジュールの効果、およびテスト時の動作を探求します。私たちの発見は、トランスフォーマーアーキテクチャを向上させる上で明示的なメモリの重要性を強調しています。
2025-02-09T22:11:42
Benchmarking Prompt Engineering Techniques for Secure Code Generation with GPT Models
http://arxiv.org/abs/2502.06039v1
Marc Bruni, Fabio Gabrielli, Mohammad Ghafari, Martin Kropp
プロンプトエンジニアリングは、大規模言語モデル(LLM)における推論ミスを減少させます。しかし、LLMが生成したコードの脆弱性を軽減する効果については、まだ十分に探求されていません。このギャップに対処するために、さまざまなプロンプトエンジニアリング戦略がコードのセキュリティに与える影響を自動的に評価するベンチマークを実装しました。私たちのベンチマークは、2つの査読済みプロンプトデータセットを活用し、静的スキャナーを使用してコードのセキュリティを大規模に評価します。GPT-3.5-turbo、GPT-4o、GPT-4o-miniで複数のプロンプトエンジニアリング手法をテストしました。その結果、GPT-4oおよびGPT-4o-miniにおいて、セキュリティに焦点を当てたプロンプトプレフィックスがセキュリティ脆弱性の発生を最大56%削減できることが示されました。さらに、すべてのテストモデルは、反復プロンプティング手法を使用することで、以前に生成したコードの脆弱性の41.9%から68.7%を検出し修正する能力を示しました。最後に、最も効果的な手法を実際の開発ワークフローに適用する方法を示す「プロンプトエージェント」を紹介します。
2025-02-09T21:23:07
Provably Overwhelming Transformer Models with Designed Inputs
http://arxiv.org/abs/2502.06038v1
Lev Stambler, Seyed Sajjad Nezhadi, Matthew Coudron
私たちは、訓練されたトランスフォーマーモデル$\mathcal{M}$と長さ$n{fix}$のトークンの文字列$s$、および整数$n{free}$を入力として、$\mathcal{M}$が$s$によって「圧倒される」ことを示す数学的証明を生成するアルゴリズムを開発しました。この過程は、時間と空間の複雑さが$\widetilde{O}(n{fix}^2 + n{free}^3)$となります。私たちは、モデルがこの文字列上で評価された際の出力、すなわち$\mathcal{M}(s + t)$が、文字列$t$の長さが$n_{free}$以下のとき、$t$の値に完全に無関心である場合、$\mathcal{M}$が$s$によって「圧倒されている」と言います。この過程で、モデルの振る舞いを制約するために、特に強力な最悪ケースの「圧縮過ぎ」の形を証明します。私たちの技術は、トランスフォーマーモデルに関するこの種の運用的に関連する保証を確立するためにコンピュータ支援証明を使用します。私たちは、注意ヘッド、レイヤーノルム、MLP/ReLU層、RoPE位置エンコーディングを含む単一層トランスフォーマー上で、私たちのアルゴリズムを実証的にテストしました。この研究が、訓練されたトランスフォーマーモデルに対して有用な保証を得るという難しい課題への第一歩になると信じています。
2025-02-09T21:21:57
Kolmogorov-Arnold Fourier Networks
http://arxiv.org/abs/2502.06018v1
Jusheng Zhang, Yijia Fan, Kaitong Cai, Keze Wang
コルモゴロフ-アルノルドに基づく解釈可能なネットワーク(KAN)は強力な理論的表現力を持っていますが、高次元タスクにおいて、パラメータの爆発と高周波特徴の捕捉という重要な課題に直面しています。この問題に対処するために、我々はコルモゴロフ-アルノルド-フーリエネットワーク(KAF)を提案します。このネットワークは、学習可能なランダムフーリエ特徴(RFF)と新しいハイブリッドGELU-フーリエ活性化メカニズムを効果的に統合し、パラメータ効率とスペクトル表現能力のバランスを取ります。我々の主な技術的貢献は以下の通りです:(1)KANの二重行列構造を行列の関連性を通じて統合し、パラメータを大幅に削減すること;(2)高次元近似タスクにおけるスペクトル歪みを排除するための学習可能なRFF初期化戦略を導入すること;(3)トレーニングプロセス中に周波数の表現を段階的に強化する適応型ハイブリッド活性化関数を実装することです。包括的な実験は、視覚、NLP、音声処理、微分方程式の解法など、さまざまな領域でのKAFの優位性を示しており、理論的解釈可能性と実用的な有用性、計算効率を効果的に組み合わせています。
2025-02-09T20:21:43
Emergence of Episodic Memory in Transformers: Characterizing Changes in Temporal Structure of Attention Scores During Training
http://arxiv.org/abs/2502.06902v1
Deven Mahesh Mistry, Anooshka Bajaj, Yash Aggarwal, Sahaj Singh Maini, Zoran Tiganj
Indiana University Bloomington
私たちは、アテンションヘッドやトランスフォーマーの出力における文脈内の時間的バイアスを調査します。認知科学の方法論を使用して、さまざまなサイズのGPT-2モデルのアテンションスコアや出力を分析します。アテンションヘッド全体にわたって、時間的連続性、初頭効果、最近効果など、人間のエピソード記憶に特徴的な効果を観察します。トランスフォーマーの出力は、文脈内の系列的な再生の傾向を示します。重要なことに、この効果は、連続性効果の背後にある推論ヘッドの切除後に消失します。私たちの発見は、トランスフォーマーが文脈内学習の際に情報をどのように時間的に整理するかについての洞察を提供し、人間の記憶や学習との類似点と相違点を明らかにします。
2025-02-09T20:20:37
Enabling Autoregressive Models to Fill In Masked Tokens
http://arxiv.org/abs/2502.06901v1
Daniel Israel, Aditya Grover, Guy Van den Broeck
歴史的に、LLMは自動回帰(AR)またはマスク言語モデリング(MLM)目的を使用して訓練されてきましたが、近年はARモデルが主流となっています。しかし、ARモデルはマスクされたトークンを過去と未来のコンテキストの間で予測する能力、つまりマスクインフィリングが本質的にできません。それに対して、MLMモデルは訓練と推論の両方において本質的な計算の非効率性に悩まされており、スケーラビリティを妨げています。この研究では、MARIA(Masked and Autoregressive Infilling Architecture)という新しいアプローチを提案します。このアプローチは、両方のパラダイムの強みを活かし、最先端のマスクインフィリング性能を達成します。MARIAは、事前訓練されたMLMモデルとARモデルを組み合わせ、連結された隠れ状態を入力とする線形デコーダを訓練することで実現されます。この最小限の修正により、ARモデルはインフィリングを実行しつつ、KVキャッシングによる迅速な推論という本質的な利点を保持します。我々の結果は、MARIAが既存の手法、特に離散拡散モデルよりもマスクインフィリングタスクにおいて大幅に優れていることを示しています。
2025-02-09T20:02:05
Analysis of LLM as a grammatical feature tagger for African American English
http://arxiv.org/abs/2502.06004v1
Rahul Porwal, Alice Rozet, Pryce Houck, Jotsna Gowda, Sarah Moeller, Kevin Tang
University of Florida, Heinrich Heine University Düsseldorf
アフリカ系アメリカ人英語(AAE)は、自然言語処理(NLP)において独自の課題を提示します。本研究では、AAEの主要な文法的特徴である習慣的「Be」と複数の否定を特定する能力を持つ既存のNLPモデル(ルールベース、トランスフォーマーベース、大規模言語モデル(LLM))の性能を体系的に比較します。これらの特徴は、その独特の文法的複雑さと発生頻度から選定されました。評価は、ゼロショットと少数ショットの戦略を用いた文レベルの二項分類タスクを含んでいます。分析の結果、LLMはベースラインと比較して可能性を示しますが、最近性や形式などの無関係な特徴といったバイアスの影響を受けることが明らかになりました。本研究は、AAEの独特な言語的特徴により良く対応するためのモデルのトレーニングとアーキテクチャの調整の必要性を強調しています。データとコードは利用可能です。
2025-02-09T19:46:33
Pencils to Pixels: A Systematic Study of Creative Drawings across Children, Adults and AI
http://arxiv.org/abs/2502.05999v1
Surabhi S Nath, Guiomar del Cuvillo y Schröder, Claire E. Stevenson
Max Planck Institute for Biological Cybernetics, Max Planck School of Cognition, University of Tübingen, University of Amsterdam
視覚的創造性を定量化する計算メトリクスを、技術的スキルやスタイルの固有の違いを考慮しつつ、知的エージェント間の描画において導き出すことは可能でしょうか?この問いに答えるために、私たちは子供、大人、AIによるクリエイティブな描画タスクにおける1338枚の絵からなる新しいデータセットを整備しました。私たちは描画の二つの側面を特徴づけます -- (1)スタイルと(2)内容。スタイルに関しては、インクの密度、インクの分布、要素の数を測定します。内容に関しては、専門家によって注釈されたカテゴリを使用して概念的多様性を研究し、画像とテキストの埋め込みを使用して距離測定を計算します。私たちは子供、大人、AIの描画のスタイル、内容、創造性を比較し、専門家および自動化された創造性スコアを予測するための単純なモデルを構築します。私たちはグループ間におけるスタイルと内容において重要な違いを見出しました -- 子供の描画はより多くの要素を持ち、AIの描画はインクの密度が高く、大人の描画は最大の概念的多様性を示しました。特筆すべきは、専門家による評価と自動評価の創造性判断の間に不一致があることを強調し、その意味合いについて議論します。これらの努力を通じて、私たちの研究は、人間と人工の創造性をテキストのモダリティを超えて研究するための、私たちの知識の限りにおいて初めてのフレームワークを提供し、創造性の根底にあるドメインに依存しない原則に到達することを試みています。私たちのデータとスクリプトはGitHubで入手可能です。
2025-02-09T19:02:32
Motion Control in Multi-Rotor Aerial Robots Using Deep Reinforcement Learning
http://arxiv.org/abs/2502.05996v1
Gaurav Shetty, Mahya Ramezani, Hamed Habibi, Holger Voos, Jose Luis Sanchez-Lopez
University of Luxembourg, Bonn-Rhein-Sieg University of Applied Sciences
この論文は、加法製造(AM)におけるドローンの動作制御の課題に対処するための深層強化学習(DRL)の適用を調査しています。ドローンを用いた加法製造は、大規模または危険な環境における柔軟で自律的な材料の堆積を約束します。しかし、変動する荷重や潜在的な妨害要因の下で、多ロター空中ロボットの堅牢なリアルタイム制御を実現することは依然として困難です。PIDのような従来のコントローラーは、しばしば頻繁なパラメータの再調整を必要とし、動的なシナリオでの適用性を制限します。私たちは、AMタスクにおけるウェイポイントナビゲーションを実行する多ロタードローンに対して適応可能な制御ポリシーを学習するDRLフレームワークを提案します。私たちは、複雑さの増加に対処するために設計されたカリキュラム学習の枠組み内で、深層決定論的ポリシー勾配(DDPG)と双子遅延深層決定論的ポリシー勾配(TD3)を比較しています。私たちの実験結果は、特に質量の変動が導入される際に、TD3がトレーニングの安定性、精度、成功を一貫してバランスをとることを示しています。これらの発見は、加法製造における堅牢で自律的なドローン制御へのスケーラブルな道を提供します。
2025-02-09T19:00:16
Speech to Speech Translation with Translatotron: A State of the Art Review
http://arxiv.org/abs/2502.05980v1
Jules R. Kala, Emmanuel Adetiba, Abdultaofeek Abayom, Oluwatobi E. Dare, Ayodele H. Ifijeh
International University of Grand-Bassam, Covenant University, Durban University of Technology, Walter Sisulu University, Summit University
カスケードベースの音声から音声への翻訳は、非常に長い間ベンチマークと考えられてきましたが、一つの言語から別の言語に音声を翻訳するのにかかる時間や、複合エラーといった多くの問題に悩まされています。これらの問題は、カスケードベースの手法が音声認識、音声からテキストへの翻訳、そして最後にテキストから音声への翻訳といった手法の組み合わせを使用するために発生します。Translatotronは、カスケードモデルに関連する複合エラーの問題に対処するためにGoogleによって設計されたシーケンスツーシーケンスの直接音声から音声への翻訳モデルです。現在、Translatotronモデルには3つのバージョンがあります:Translatotron 1、Translatotron 2、そしてTranslatotron 3です。最初のバージョンは、直接音声から音声への翻訳が可能であることを示すための概念実証として設計され、カスケードモデルより効果は低いものの、有望な結果を出していることが分かりました。Translatotron 2は、Translatotron 1の改良版で、カスケードモデルと同様の結果を出しました。Translatotron 3は最新バージョンで、カスケードモデルと比較していくつかの点で優れています。本論文では、音声から音声への翻訳の完全なレビューを行い、すべてのTranslatotronモデルのバージョンに特に焦点を当てます。また、Translatotronがアフリカの言語と他のよく定式化された言語との間の言語のギャップを埋めるための最良のモデルであることを示します。
2025-02-09T18:15:00
Temporal Model On Quantum Logic
http://arxiv.org/abs/2502.07817v1
Francesco D'Agostino
この論文では、時間的記憶のダイナミクスをモデル化するための統一的理論フレームワークを紹介します。このフレームワークは、時間論理、記憶減衰モデル、および階層的コンテキストの概念を組み合わせています。フレームワークは、提案の時間的進化を線形および分岐型の時間モデルを用いて形式化し、指数的減衰(エビングハウスの忘却曲線)やベイジアンアップデーティングを介した再活性化メカニズムを取り入れています。記憶の階層的な組織は、有向非巡回グラフを用いて想起の依存関係や干渉をモデル化することで表現されています。新しい洞察には、フィードバックダイナミクス、記憶チェーンにおける再帰的な影響、エントロピーに基づく想起効率の統合が含まれています。このアプローチは、認知的および計算的領域における記憶プロセスの理解のための基盤を提供します。
2025-02-09T17:16:53
Redefining Robot Generalization Through Interactive Intelligence
http://arxiv.org/abs/2502.05963v1
Sharmita Dey
最近の大規模機械学習の進展により、高容量の基盤モデルが開発され、多様な下流タスクに適応できるようになりました。このようなモデルはロボティクスに大きな可能性を秘めていますが、現在のパラダイムは依然としてロボットを単独で自律的に意思決定を行う存在として描いており、操作やナビゲーションのようなタスクを、人間の関与を最小限に抑えて実行しています。しかし、ウェアラブルロボティクス(例:義肢、装具、外骨格)、遠隔操作、神経インターフェースなどを含む多くの現実のロボットシステムは半自律的であり、人間のパートナーとの継続的なインタラクティブな連携を必要としており、単一エージェントの仮定に挑戦しています。この立場文書では、ロボットの基盤モデルはリアルタイムの人間-ロボット共適応の複雑さに対処するために、インタラクティブなマルチエージェントの視点に進化すべきであると主張します。私たちは、次の4つのモジュールを含む一般化可能で神経科学にインスパイアされたアーキテクチャを提案します:(1)センサリモーター統合の原則に基づく情報を持ったマルチモーダルセンシングモジュール、(2)認知科学における共同行動フレームワークを思わせるアドホックチームワークモデル、(3)運動制御の内部モデル理論に基づいた予測的世界信念モデル、および(4)ヘッブ的および強化学習に基づく可塑性の概念を反映したメモリ/フィードバックメカニズムです。この提案されたフレームワークは、ウェアラブルデバイスと人間の生理学が切り離せない形で絡み合うサイボーグシステムを通して示されていますが、半自律的またはインタラクティブなコンテキストで動作するロボットにも広く適用可能です。単一エージェントのデザインを超えることで、私たちの立場はロボティクスにおける基盤モデルが、より堅牢でパーソナライズされた、予測的なレベルのパフォーマンスを達成できることを強調しています。
2025-02-09T17:13:27
MetaChain: A Fully-Automated and Zero-Code Framework for LLM Agents
http://arxiv.org/abs/2502.05957v1
Jiabin Tang, Tianyu Fan, Chao Huang
The University of Hong Kong
大規模言語モデル(LLM)エージェントは、タスクの自動化やインテリジェントな意思決定において驚くべき能力を示しており、LangChainやAutoGenなどのエージェント開発フレームワークの広範な採用を促進しています。しかし、これらのフレームワークは主に広範な技術的専門知識を持つ開発者を対象としており、必要なプログラミングスキルを持つのは世界の人口のわずか0.03%に過ぎないという重要な制約があります。この大きなアクセスのギャップは根本的な問いを提起します:技術的なバックグラウンドに関係なく、誰もが自然言語だけを使用して自分自身のLLMエージェントを構築できるようにすることができるのでしょうか?この課題に対処するために、私たちはMetaChainを紹介します。これは完全に自動化され、高度に自己開発が可能なフレームワークで、ユーザーが自然言語のみを通じてLLMエージェントを作成し、展開できるようにします。MetaChainは自律的なエージェントオペレーティングシステムとして機能し、次の4つの主要要素で構成されています:i) エージェンティックシステムユーティリティ、ii) LLM駆動のアクショナブルエンジン、iii) 自己管理型ファイルシステム、およびiv) 自己プレイエージェントカスタマイズモジュール。この軽量かつ強力なシステムは、コーディング要件や手動介入なしに、ツール、エージェント、およびワークフローの効率的かつ動的な作成と修正を可能にします。コーディングなしでのエージェント開発能力を超えて、MetaChainは一般的なAIアシスタントのための汎用的なマルチエージェントシステムとしても機能します。GAIAベンチマークにおける包括的な評価は、一般的なマルチエージェントタスクにおけるMetaChainの効果を示しており、既存の最先端の方法を上回っています。さらに、MetaChainの情報検索拡張生成(RAG)関連機能は、多くの代替LLMベースのソリューションと比較して一貫して優れたパフォーマンスを示しています。
2025-02-09T16:53:56
Cyri: A Conversational AI-based Assistant for Supporting the Human User in Detecting and Responding to Phishing Attacks
http://arxiv.org/abs/2502.05951v1
Antonio La Torre, Marco Angelini
Sapienza University of Rome, Link Campus University of Rome
本作業では、サイリ(Cyri)というAI駆動型の会話アシスタントを紹介します。サイリは、大規模言語モデルを活用して、ユーザーがフィッシングメールを検出および分析するのを支援するように設計されています。サイリは、緊急性や望ましくない結果など、フィッシング攻撃に使用される意味的特徴を洗練して検査するように設計されており、文献で既に確立されている特徴とサイリの特徴抽出手法による他の特徴を統合するアプローチを用いています。サイリはクライアントメールやWebメールに直接接続でき、ユーザーのメールワークフローとシームレスに統合されつつ、ローカル処理を通じてデータプライバシーを保ちます。ユーザーのマシン上で分析を行うことにより、サイリはインターネット経由で機密メールデータを送信する必要を排除し、関連するセキュリティリスクを低減します。サイリのユーザーインターフェースは、習慣効果を低減し、ユーザーのエンゲージメントを高めるように設計されています。動的な視覚的手がかりや文脈に特有の説明を使用して、ユーザーがメールを使用する際に注意を喚起し、情報を保持できるようにしています。さらに、ユーザーはエージェントとの会話や視覚的探索を通じて、特定された悪意のある意味的特徴を探求することができ、専門家および非専門家のユーザーの両方にとって、両方のモダリティの利点を得ることができます。また、ユーザーは会話の追跡を続けることができ、計算された特徴やメールの新しい部分に関連する追加の質問を解決するためにサポートを受けることができ、必要に応じて検出を実施します。サイリを評価するために、420のフィッシングメールと420の正当なメールからなる包括的なデータセットを作成しました。結果は、フィッシング検出に不可欠な重要なフィッシング意味的特徴の特定において高い効果を示しました。専門家と非専門家の両方の10名の参加者を対象としたユーザースタディでは、サイリの効果と使いやすさが評価されました。結果は、サイリがユーザーのフィッシングメールを特定するのに大いに役立ち、フィッシングの手口に対する理解を深めたことを示しました。
2025-02-09T16:42:28
Survival Concept-Based Learning Models
http://arxiv.org/abs/2502.05950v1
Stanislav R. Kirpichenko, Lev V. Utkin, Andrei V. Konstantinov, Natalya M. Verbova
Higher School of Artificial Intelligence Technologies, Peter the Great St.Petersburg Polytechnic University
概念ベースの学習は、高度な人間が理解できる概念を活用することで予測精度と解釈可能性を向上させます。しかし、既存の概念ベースの学習(CBL)フレームワークは、医療や信頼性分析などの分野で一般的なシナリオである検閲データの存在下における事象時刻の予測を含む生存分析タスクに対応していません。このギャップを埋めるために、我々は新しい2つのモデルを提案します:SurvCBM(生存概念ベースのボトルネックモデル)とSurvRCM(生存正則化概念ベースのモデル)です。これらのモデルは、生存分析と概念ベースの学習を統合し、検閲された事象時刻データを扱います。モデルは、コックス比例ハザードモデルおよびベラン推定量を使用します。SurvCBMは、広く知られている概念ボトルネックモデルのアーキテクチャに基づいており、概念ベースの説明を通じて解釈可能な予測を提供します。SurvRCMは、正則化として概念を使用して精度を高めます。両モデルはエンドツーエンドで訓練され、概念に基づいた解釈可能な予測を提供します。2つの解釈可能性アプローチが提案されています:1つはコックスモデルにおける線形関係を利用し、もう1つはベラン推定量を用いたインスタンスベースの説明フレームワークです。数値実験により、SurvCBMはSurvRCMおよび従来の生存モデルよりも優れていることが示されており、概念情報を取り入れる重要性と利点が強調されています。提案されたアルゴリズムのコードは公開されています。
2025-02-09T16:41:04
Verifying Proportionality in Temporal Voting
http://arxiv.org/abs/2502.05949v1
Edith Elkind, Svetlana Obraztsova, Jannik Peters, Nicholas Teh
私たちは、固定された時間の展望があり、各ラウンドで投票者が利用可能な候補者に対する好みを報告し、単一の候補者が選ばれる一時的な投票のモデルを研究します。先行研究では、正当な代表性の一般的な概念や、多勝者選挙の設定からこのモデルに強い代表性の保証を提供する投票ルールが適応されています。私たちの研究では、特定の結果が比例代表を提供しているかどうかを検証する複雑性に焦点を当てています。時間的な設定では、検証が多勝者投票と比べて厳格に難しくなることを示しますが、効率的なアルゴリズムを可能にする自然な特別な場合を特定します。
2025-02-09T16:30:34
"Let the AI conspiracy begin..." Language Model coordination is just one inference-intervention away
http://arxiv.org/abs/2502.05945v1
Paul Darm, Annalisa Riccardi
University of Strathclyde
本研究では、学習した整合性目標を回避する能力を持つ大規模言語モデルの挙動を制御するための簡潔で効果的な方法論を紹介します。我々は、追加のトレーニングなしで効果を発揮する干渉時間の活性化シフティングを用います。先行研究に従い、望ましい振る舞いと望ましくない振る舞いを表すモデル出力の対照ペアにおける活性化の違いから介入方向を導出します。モデルに対して応答に多肢選択肢を含めるよう促すことで、各注意ヘッドの制御努力に対するモデル出力の感度を自動的に評価できます。これらのヘッドへの介入が「AI調整」データセットにおけるオープンエンドの回答生成によく一般化されることを示します。このデータセットでは、モデルは別のAIを支援するか、倫理的で安全かつ無害な行動に従うかを選択しなければなりません。我々の詳細な介入により、Llama 2は確立された整合性目標に従うよりも、他のAIとの調整を好むようになります。さらに、このアプローチは全体のモデル層に適用される介入よりも強力で、出力の全体的な一貫性を保ちながら実現されます。我々の方法のシンプルさは、現在の整合性戦略の短所を浮き彫りにし、「AI調整」といった概念が選択された注意ヘッドによって影響を受ける可能性のある将来の研究方向を示唆しています。
2025-02-09T16:11:57
A Sociotechnical Approach for Knowledge Management (KM)
http://arxiv.org/abs/2502.06899v1
Leoncio Jimenez
この記事では、KM(知識管理)のための社会技術的フレームワークを提示します。このKMの社会技術的ビジョンにより、(1)商業的関心からKMを切り離すことができ、(2)異なるKM技術を区分し、(3)KMの社会的および技術的要素に関連するパラダイムについて疑問を呈することが可能となります。この記事が特に発展させるのは、まさにこの最後のポイントであり、KMの一般的なメカニズムを特定します。具体的には、社会的側面はKMに対する組織的アプローチ、管理的アプローチ、そして生物学的アプローチを通じて説明されます。それに対して、技術的側面はKMに対する知識とスキルの工学的アプローチを通じて記述されます。これらのアプローチはまた、これらの組織的、管理的、そして生物学的なKMのビジョン間の比較表を提供することへと導きます。
2025-02-09T15:46:04
A Semi-Supervised Text Generation Framework Combining a Deep Transformer and a GAN
http://arxiv.org/abs/2502.05937v1
Shengquan Wang
この論文では、深層生成事前学習済みトランスフォーマー言語モデルと生成的敵対ネットワークを接続したフレームワークを紹介します。このモデルは、まず大規模で多様なテキストコーパスで24層の無監督事前学習を行います。その後、合成テキスト生成のためのシンプルなGANアーキテクチャが導入され、トークンの離散性を扱うためにGumbel-Softmaxが適用されます。また、論文では、実データをGANサンプルで拡張する半監視手法も示されており、これを用いてマージされたデータセットでトランスフォーマーモデルをファインチューニングします。詳細な理論的導出も含まれており、最小-最大目的関数の証明を概説し、Gumbel-Softmaxの再パラメータ化トリックについての広範な議論が行われています。
2025-02-09T15:38:43
Barriers and Pathways to Human-AI Alignment: A Game-Theoretic Approach
http://arxiv.org/abs/2502.05934v1
Aran Nayebi
Carnegie Mellon University
能力のあるAIエージェントがその行動を人間の好みに効率的に整合させるためには、どのような条件が必要でしょうか。より具体的には、彼らが私たちと協力できるほどの熟練度を持つとき、調整にはどれくらいの時間がかかり、計算上実現可能なのはいつなのでしょうか。AIの整合性に関するこれらの基本的な質問は、AIエージェントを「十分に安全」で人間にとって価値のあるものとする要素を定義するのに役立ちます。このような一般的に有能なシステムはまだ存在しないため、保証が成立する条件やそれ自体の内容を確立するために理論的な分析が必要です。私たちは、以前の整合性アプローチをより少ない仮定で一般化するゲーム理論的なフレームワークを提案し、$M$の目標と$N$のエージェントにわたる整合性の計算の複雑さを分析できるようにし、上限と下限の両方を提供します。以前の研究がしばしば共通事前、理想化された通信、または暗黙の可扱性を前提としているのに対し、私たちのフレームワークは最小の仮定の下で整合性の難しさを正式に特徴づけています。私たちの主な結果は、エージェントが完全に合理的で計算的に「無制限」である場合でも、整合性はタスク空間のサイズに対して「線形」な時間で高い確率で達成可能であることを示しています。したがって、タスク空間が入力長に対してしばしば「指数関数的」である現実の設定では、これは依然として実用的ではありません。さらに驚くべきことに、私たちの下限は、指数関数的に多くのタスクやエージェントにスケールする際に整合性を加速することが「不可能」であることを示し、スケーラブルな整合性に対する基本的な計算上の障壁を浮き彫りにしています。これらの理想化された仮定を緩め、ノイズのあるメッセージを持つ「計算的に制約された」エージェントを考察し(これは不明瞭な意図を表現しています)、整合性が引き続き高い確率で成功することができる一方で、タスク空間のサイズ、エージェントの数、タスクの数において追加の「指数関数的」な遅延が発生することを示します。私たちは、整合性をより実現可能にする条件を特定することによって結論を締めくくります。
2025-02-09T15:27:35
Learning to Substitute Words with Model-based Score Ranking
http://arxiv.org/abs/2502.05933v1
Hongye Liu, Ricardo Henao
Duke University
スマートワード置換は、単語の選択を改善することで文の質を向上させることを目的としています。しかし、現在のベンチマークは人間によってラベル付けされたデータに依存しています。単語の選択は本質的に主観的であるため、少数のアノテーターによって生成された真の単語置換はしばしば不完全であり、一般化できないことがよくあります。この問題を回避するために、我々は代わりにモデルベースのスコア(BARTScore)を使用して文の質を定量化し、人間のアノテーションの必要性を排除します。具体的には、このスコアを使用して各単語置換の分布を定義し、ある置換が他の置換に対して統計的に優れているかどうかをテストできるようにします。さらに、モデルの予測と文のスコアの整合性を直接最適化しながら、置換の全体的な質スコアを向上させる損失関数を提案します。重要なことに、モデルの学習はもはや人間のラベルを必要とせず、アノテーションのコストを回避しつつ、置換によって修正されたテキストの質を維持します。実験結果は、提案されたアプローチがマスク言語モデル(BERT、BART)や大規模言語モデル(GPT-4、LLaMA)を上回ることを示しています。ソースコードはhttps://github.com/Hyfred/Substitute-Words-with-Rankingで入手できます。
2025-02-09T15:26:32
Skill Expansion and Composition in Parameter Space
http://arxiv.org/abs/2502.05932v1
Tenglong Liu, Jianxiong Li, Yinan Zheng, Haoyi Niu, Yixing Lan, Xin Xu, Xianyuan Zhan
National University of Defense Technology, Tsinghua University, Shanghai Artificial Intelligence Laboratory, Beijing Academy of Artificial Intelligence
人間は、以前の知識を再利用して新たな課題に対処し、問題を解決する際にスキルを発展させることに優れています。このパラダイムは、自律エージェントの開発においてますます人気が高まっており、人間のように新たな課題に応じて自己進化するシステムを構築します。しかし、従来の方法は、新しいスキルの拡張時に限られたトレーニング効率に悩まされ、以前の知識を十分に活用して新しいタスクの学習を促進することに失敗しています。本論文では、パラメトリックスキル拡張と構成(PSEC)という新しいフレームワークを提案します。これは、エージェントの能力を反復的に進化させ、管理可能なスキルライブラリを維持することにより、新たな課題に効率的に対処することを目的としています。このライブラリは、プラグアンドプレイの低ランク適応(LoRA)モジュールとしてスキル原始を段階的に統合することができ、効率的で柔軟なスキル拡張を促進します。この構造は、異なるスキルをエンコードするLoRAモジュールを統合することでパラメータ空間内での直接的なスキル構成も可能にし、スキル間の共有情報を活用して新しいスキルを効果的にプログラムします。これに基づき、我々は新しいタスクを協調的に処理するために異なるスキルを動的に活性化するコンテキスト対応モジュールを提案します。多目的構成、ダイナミクスの変化、継続的政策の変化を含む多様なアプリケーションを強化する中で、D4RL、DSRLベンチマークおよびDeepMind Control Suiteにおける結果は、PSECが以前の知識を効率的に活用し新しい課題に対処し、能力を進化させるためにスキルライブラリを拡張する優れた能力を示すことを示しています。プロジェクトウェブサイト: https://ltlhuuu.github.io/PSEC/.
2025-02-09T15:22:38
Protecting Intellectual Property of EEG-based Neural Networks with Watermarking
http://arxiv.org/abs/2502.05931v1
Ahmed Abdelaziz, Ahmed Fathi, Ahmed Fares
Egypt Japan University of Science and Technology (EJUST)
EEGベースのニューラルネットワークは、医療診断や脳-コンピュータインタフェースにおいて重要な役割を果たしていますが、敏感な神経生理学データへの依存とリソース集約的な開発のため、知的財産(IP)リスクに直面しています。現在のウォーターマーキング手法、特に抽象的なトリガーセットを使用するものは、堅牢な認証に欠け、EEGモデルの独特な課題に対処していません。本論文では、EEGベースのニューラルネットワークに特化した暗号化ワンダーフィルターを用いたウォーターマーキングフレームワークを紹介します。衝突耐性ハッシュと公開鍵暗号を活用し、ワンダーフィルターはトレーニング中にウォーターマークを埋め込み、最小限の歪み(EEGタスク精度の$\leq5\%$低下)と高い信頼性(100\%のウォーターマーク検出)を確保しています。このフレームワークは、微調整、転送学習、ニューロンプルーニングを含む敵対的攻撃に対して厳密に評価されます。結果は、ウォーターマークされた状態の分類精度を90\%以上に保ちながら、侵攻的なプルーニング後もウォーターマークの持続的な保持を示し、主なタスクのパフォーマンスはより早く劣化しますが、削除の試みを抑制します。海賊行為に対する耐性は、EEGNetおよびCCNNモデルでの深刻な精度損失($>10\%$)なしに二次ウォーターマークを埋め込むことができないことによって検証されています。暗号化ハッシュは認証を保証し、ブルートフォース攻撃の成功確率を低下させます。CCNN、EEGNet、TSceptionモデルでDEAPデータセットを評価した結果、この手法は$>99.4\%$のヌル埋め込み精度を達成し、偽陽性を効果的に排除します。ワンダーフィルターをEEG特有の適応に統合することで、本研究は神経生理学モデルの知的財産保護における重要なギャップを埋め、医療およびバイオメトリックアプリケーションのための安全で改ざん防止のソリューションを提供します。このフレームワークの敵対的変更に対する堅牢性は、診断の有用性を保ちながら、敏感なEEGモデルを保護する潜在能力を強調しています。
2025-02-09T15:21:45
Sign-Symmetry Learning Rules are Robust Fine-Tuners
http://arxiv.org/abs/2502.05925v1
Aymene Berriche, Mehdi Zakaria Adjal, Riyadh Baghdadi
バックプロパゲーション(BP)は、その効果的な方法であり、長い間ニューラルネットワークのトレーニングの主要な手法として使用されてきました。しかし、フィードバックアライメントの下に広く分類される多くの代替アプローチが提案されており、その多くは生物学的に妥当な学習メカニズムの探求に動機づけられています。理論的な魅力があるにもかかわらず、これらの方法はBPと比較して一貫して劣っており、研究への関心が減少しています。本研究では、そのような手法の役割を再訪し、標準的なニューラルネットワークトレーニングパイプラインにどのように統合できるかを探ります。具体的には、Sign-Symmetry学習ルールを使用してBP事前トレーニングされたモデルをファインチューニングすることを提案し、このアプローチがBPとのパフォーマンスの平等を維持するだけでなく、堅牢性も向上させることを実証します。複数のタスクとベンチマークにわたる広範な実験を通じて、私たちのアプローチの妥当性を確立しました。我々の発見は、ニューラルネットワークのトレーニングに関する新しい視点を提供し、深層学習における生物学的にインスパイアされた学習ルールを活用するための新しい研究方向を開きます。
2025-02-09T14:59:57
Large Language Models for In-File Vulnerability Localization Can Be "Lost in the End"
http://arxiv.org/abs/2502.06898v1
Francesco Sovrano, Adam Bauer, Alberto Bacchelli
Collegium Helveticum, ETH Zurich, University of Zurich
最近の人工知能の進展により、大きな入力を処理する能力が向上したことで、日常的なソフトウェア開発者は、関数内だけでなく、ファイル全体の脆弱性を検出するために、GPT-3.5やGPT-4などのチャットベースの大規模言語モデル(LLM)にますます依存するようになっています。この新しい開発プラクティスは、研究者に対して一般的に使用されるLLMが大きなファイルサイズの入力を効果的に分析できるかどうかを緊急に調査することを要求しています。これにより、ソフトウェア開発者やエンジニアに対して、この新興技術動向の利点と欠点についてタイムリーな洞察を提供することが可能になります。したがって、本論文の目的は、ファイル内の脆弱性を検出する際のGPTモデルを含む、いくつかの最先端のチャットベースのLLMの効果を評価することです。私たちは、脆弱性の種類、入力サイズ、およびファイル内の脆弱性の位置に基づいて、LLMの性能がどのように変わるかを調査しました。統計的なパワーを十分に持たせるために、我々は、最も一般的で危険な脆弱性、すなわちXSS、SQLインジェクション、およびパス遷移の3つの脆弱性にのみ焦点を当てることができました。我々の調査結果は、これらの脆弱性を検出する際のLLMの効果が、脆弱性の位置と入力全体のサイズに強く影響されることを示しています。具体的には、脆弱性の種類に関係なく、LLMは大きなファイルの終わりにある脆弱性を検出する際に著しく(p < .05)パフォーマンスが低下する傾向があります。このパターンを「ロスト・イン・ザ・エンド効果」と呼びます。最後に、ソフトウェア開発者や実務者をさらにサポートするために、これらのLLMにとっての最適な入力サイズを探求し、それを特定するための簡単な戦略を提示しました。この戦略は他のモデルや脆弱性のタイプにも適用可能です。最終的に、入力サイズの調整がLLMベースの脆弱性検出においてどのように大きな改善をもたらすかを示し、すべてのモデルにおいて平均37%以上の再現率の向上を実現しました。
2025-02-09T14:51:15
PyPotteryInk: One-Step Diffusion Model for Sketch to Publication-ready Archaeological Drawings
http://arxiv.org/abs/2502.06897v1
Lorenzo Cardarelli
Sapienza University of Rome
考古学的な陶器の文書化は、伝統的に鉛筆スケッチを出版に適したインク描画に変換する、時間のかかる手動プロセスを必要とします。私はPyPotteryInkを紹介します。これは考古学的な陶器のスケッチを標準化された出版準備ができた描画に変換するオープンソースの自動化パイプラインで、ワンステップの拡散モデルを使用しています。修正されたimg2img-turboアーキテクチャに基づいて構築されたこのシステムは、重要な形態学的詳細を保持しながら、考古学的文書化の基準と分析価値を維持しつつ、描画を単一の前方パスで処理します。このモデルは、動的オーバラップを備えた効率的なパッチベースのアプローチを採用しており、入力描画サイズに関わらず高解像度の出力を可能にします。私は、イタリアの初歴史的陶器の描画のデータセットにおけるアプローチの有効性を示し、装飾パターンのような細部や、器のプロファイルや持ち手の要素のような構造要素など、細かなディテールをうまく捉えています。専門家による評価は、生成された描画が出版基準を満たし、描画あたりの処理時間を数時間から数秒に大幅に短縮できることを確認しています。このモデルは、最小限のトレーニングデータでさまざまな考古学的文脈に適応するために微調整可能であり、さまざまな陶器文書化スタイルに対して柔軟性を持っています。事前に訓練されたモデル、Pythonライブラリ、および包括的な文書が提供され、考古学的研究コミュニティ内での導入が促進されます。
2025-02-09T14:03:37
A Distributional Perspective on Word Learning in Neural Language Models
http://arxiv.org/abs/2502.05892v1
Filippo Ficarra, Ryan Cotterell, Alex Warstadt
ETH Zürich, University of California San Diego
言語モデル(LM)は、人間の言語学習者のモデルとしてますます研究されるようになっています。この分野の新しさのため、LMが人間と類似した学習ダイナミクスを示すかどうかはまだ確立されておらず、人間とモデルの学習軌道の直接的な比較がほとんどありません。子供の単語学習軌道は比較的よく文書化されており、最近ではこれらの調査を言語モデルに拡張しようとする研究が行われています。しかし、言語モデルにおける単語学習に関して広く合意された指標は存在しません。我々はこの問題に対して分配的アプローチを取り、ターゲット単語の学習分布の特性に基づいて語彙知識を定義します。以前の研究で調べられた分配的署名は重要な分配情報を捕らえられていないと主張します。したがって、ターゲット単語がどこで発生するか、または発生しないかに関する知識や、その単語の適切さに関する傾向を捉えることで、以前のアプローチを改善する一連の署名を提案します。私たちは、ゼロからトレーニングした小規模言語モデルの選択に対して学習軌道を取得し、異なる分配的署名の関係を調査し、それらがどれほど人間の単語学習軌道や解釈可能な語彙特徴と一致するかを比較し、これらの分配的署名を推定するための基本的な方法論的質問に取り組みます。我々の指標は主に補完的な情報を捉えているため、単一の指標に頼ることが重要ではないことを示唆しています。しかし、すべての指標において、言語モデルの学習軌道は子供のそれと相関しないことがわかります。
2025-02-09T13:15:59
MTPChat: A Multimodal Time-Aware Persona Dataset for Conversational Agents
http://arxiv.org/abs/2502.05887v1
Wanqi Yang, Yanda Li, Meng Fang, Ling Chen
University of Technology Sydney, University of Liverpool
時間的ダイナミクスを理解することは、会話エージェントにとって極めて重要であり、効果的なコンテンツ分析と情報に基づく意思決定を可能にします。しかし、特にペルソナに基づく会話における時間を意識したデータセットはまだ限られており、その範囲を狭め、複雑さを減少させています。このギャップを解決するために、私たちはMTPChatを導入します。これは、多様なモードを持つ時間を意識したペルソナ対話データセットであり、対話およびペルソナの記憶の中に言語的、視覚的、時間的要素を統合しています。MTPChatを活用し、私たちは2つの時間に敏感なタスクを提案します:時間次の応答予測(TNRP)と時間的基盤記憶予測(TGMP)です。これらは、モデルが暗黙の時間的手がかりや動的相互作用を理解する能力を評価するように設計されています。さらに、異なるモードのストリームを効果的に統合し、時間的依存関係を捉えるための適応的な時間モジュールを特徴とする革新的なフレームワークを提示します。実験結果はMTPChatによってもたらされる課題を検証し、私たちのフレームワークが多様なモードの時間に敏感なシナリオにおいて効果的であることを示しています。
2025-02-09T13:00:53
NeuralPrefix: A Zero-shot Sensory Data Imputation Plugin
http://arxiv.org/abs/2502.05883v1
Abdelwahed Khamis, Sara Khalifa
Data61, CSIRO, Queensland University of Technology
実世界のセンシング課題は、センサーの故障、通信の問題、そして電力制約などが原因で、データの断続性を引き起こします。これは、連続したデータストリームを前提とした従来の分類タスクを損なうことが知られています。これまでの研究では、タスク固有またはモダリティ固有の補完を設計することでこの問題に対処してきました。これらのアプローチは、意図した目的には効果的でしたが、異なるタスクやセンサーモダリティへの適用性に制限がありました。ここで重要な問いが浮かび上がります。追加のトレーニングを必要とせずに、新しいセンサーに転送可能なタスク非依存の補完パイプラインを構築できるでしょうか?本研究では、ゼロショット補完の概念を定式化し、データの断続性に対応するために事前トレーニングされたモデルを適応させる新しいアプローチを提案します。このフレームワークは、NeuralPrefixと呼ばれ、推論の際にタスクモデルの前に配置され、データの断続性によって生じたギャップを埋める生成的なニューラルコンポーネントです。NeuralPrefixは連続的な動的システムとして構築されており、その内部状態は常微分方程式(ODE)を解くことで任意の時点で推定できます。このアプローチにより、タスク固有およびモダリティ固有の解決策の制限を克服し、より多様で適応可能な補完方法が実現されます。私たちは、NeuralPrefixを複数のセンサーデータセットで包括的に評価し、さまざまなドメインでの効果を示します。欠損データ率が高い50%の断続的なデータでテストしたところ、NeuralPrefixはすべての欠損サンプルを正確に回復し、SSIMスコア0.93〜0.96を達成しました。ゼロショット評価では、NeuralPrefixが異なるモダリティの測定であっても、未知のデータセットに対して良好に一般化することを示しました。
2025-02-09T12:47:55
AI-Driven HSI: Multimodality, Fusion, Challenges, and the Deep Learning Revolution
http://arxiv.org/abs/2502.06894v1
David S. Bhatti, Yougin Choi, Rahman S M Wahidur, Maleeka Bakhtawar, Sumin Kim, Surin Lee, Yongtae Lee, Heung-No Lee
Gwangju Institute of Science and Technology (GIST)
ハイパースペクトルイメージング(HSI)は、空間的およびスペクトルのデータをキャプチャし、従来のシステムでは見えない特徴の分析を可能にします。この技術は、気象監視、食品品質管理、偽造防止、医療診断、さらに防衛、農業、産業自動化の分野においても重要です。HSIは、スペクトル分解能、ミニチュア化、計算手法の改善によって進化してきました。本研究では、HSIの概要、その応用、データ融合における課題、HSIデータ処理における深層学習モデルの役割について説明します。特に深層学習との統合が、分類精度や運用効率を向上させる方法について議論します。深層学習は、特徴抽出、変化検出、ノイズ除去、デコンボリューション、次元削減、土地利用マッピング、データ拡張、スペクトル構築、超解像度などの分野でHSI分析を強化します。新たに注目されているのは、ハイパースペクトルカメラと大規模言語モデル(LLMs)の融合、これをハイブラインLLMsと呼び、視界の悪い衝突検出や顔の偽造防止といった高度なアプリケーションの開発を可能にします。また、HSI業界の主要なプレーヤー、その年平均成長率、そして産業の重要性の高まりを強調します。この目的は、技術的および非技術的な聴衆の両方に洞察を提供し、HSIの画像、トレンド、将来の方向性をカバーしながら、HSIデータセットやソフトウェアライブラリに関する貴重な情報を提供することです。
2025-02-09T12:44:16
Enhancing Depression Detection with Chain-of-Thought Prompting: From Emotion to Reasoning Using Large Language Models
http://arxiv.org/abs/2502.05879v1
Shiyu Teng, Jiaqing Liu, Rahul Kumar Jain, Shurong Chai, Ruibo Hou, Tomoko Tateyama, Lanfen Lin, Yen-wei Chen
Ritsumeikan University, Fujita Health University, Zhejiang University
うつ病は、世界中で障害の主要な原因の一つであり、個人、医療システム、そして社会全体に対して深刻な負担をもたらしています。最近の大型言語モデル(LLM)の進展は、テキストベースの分析を通じてうつ病の検出を含むメンタルヘルスの課題に対処する可能性を示しています。しかし、現在のLLMベースの手法は、微妙な症状の特定に苦労し、透明で段階的な推論プロセスを欠いているため、メンタルヘルスの状態を正確に分類し説明することが難しくなっています。これらの課題に対処するために、私たちはLLMベースのうつ病検出の性能と解釈可能性を向上させる「思考の連鎖提示」アプローチを提案します。私たちの方法は、検出プロセスを次の4つの段階に分解します:(1)感情分析、(2)二元うつ病分類、(3)根本的原因の特定、(4)重症度の評価。これらの構造化された推論ステップをモデルにガイドすることによって、解釈可能性を向上させ、微妙な臨床指標を見落とすリスクを減らします。私たちはE-DAICデータセットでこの方法を検証し、最先端の大型言語モデルをテストします。実験結果は、私たちの思考の連鎖提示技術が、ベースラインアプローチと比較して、分類精度と診断インサイトの細分化の両方において優れた性能を発揮することを示しています。
2025-02-09T12:30:57
MMGDreamer: Mixed-Modality Graph for Geometry-Controllable 3D Indoor Scene Generation
http://arxiv.org/abs/2502.05874v1
Zhifei Yang, Keyang Lu, Chao Zhang, Jiaxing Qi, Hanqi Jiang, Ruifei Ma, Shenglin Yin, Yifan Xu, Mingzhe Xing, Zhen Xiao, Jieyi Long, Xiangde Liu, Guangyao Zhai
Beijing Digital Native Digital City Research Center
制御可能な3Dシーン生成は、仮想現実やインテリアデザインにおいて幅広い応用があります。生成されたシーンは、ジオメトリの観点から高いリアリズムと制御可能性を示すべきです。シーングラフは、これらのアプリケーションを促進するために適したデータ表現を提供します。しかし、現在のグラフベースのシーン生成手法はテキストベースの入力に制約されており、柔軟なユーザー入力への適応性が不十分で、オブジェクトのジオメトリを正確に制御する能力が妨げられています。この問題に対処するために、私たちはMMGDreamerを提案します。これは、シーン生成のための二重ブランチ拡散モデルであり、新しい混合モダリティグラフ、視覚強化モジュール、関係予測器を組み込んでいます。混合モダリティグラフは、オブジェクトノードがテキストと視覚のモダリティを統合できるようにし、ノード間にオプションの関係を持つことができます。これにより、柔軟なユーザー入力への適応性が向上し、生成されたシーンにおけるオブジェクトのジオメトリを細かく制御できるようになります。視覚強化モジュールは、テキスト埋め込みを使用して視覚表現を構築することにより、テキストのみのノードの視覚的な忠実度を高めます。さらに、私たちの関係予測器は、ノードの表現を活用してノード間の欠落した関係を推測し、より一貫したシーンレイアウトを実現します。広範な実験結果により、MMGDreamerがオブジェクトのジオメトリを優れた制御を示し、最先端のシーン生成性能を達成していることが証明されています。プロジェクトページ: https://yangzhifeio.github.io/project/MMGDreamer.
2025-02-09T12:23:40
Certifying Language Model Robustness with Fuzzed Randomized Smoothing: An Efficient Defense Against Backdoor Attacks
http://arxiv.org/abs/2502.06892v1
Bowei He, Lihao Yin, Hui-Ling Zhen, Jianping Zhang, Lanqing Hong, Mingxuan Yuan, Chen Ma
事前トレーニングされた言語モデル(PLM)の広範な展開は、特に事前トレーニング段階で植え付けられたテキストバックドア攻撃にさらされています。これらの攻撃は高い信頼性を求めるアプリケーションに重大なリスクをもたらします。なぜなら、攻撃は複数の下流タスクに密かに影響を与える可能性があるからです。このような脅威に対する堅牢性を保証することは重要ですが、既存の防御策は高次元で相互依存したテキストデータの特性や、元の汚染された事前トレーニングデータへのアクセスがないという問題に苦しんでいます。これらの課題に対処するために、我々は新たに \textbf{F}uzzed \textbf{R}andomized \textbf{S}moothing(\textbf{FRS})を提案します。これは、バックドア攻撃に対する言語モデルの堅牢性を効率的に証明するための新しいアプローチです。FRSは、ソフトウェア堅牢性保証技術を二段階のモデルパラメータスムージングと統合し、モンテカルロツリーサーチを用いて脆弱なテキストセグメントを特定するためのプロアクティブなファジングを行います。これにより、対象を絞った効率的なテキストのランダム化が可能になり、モデルスムージング中に汚染されたトレーニングデータにアクセスする必要がなくなります。我々の理論的分析は、FRSが既存の方法と比較して、より広範な認定された堅牢性半径を達成することを示しています。さまざまなデータセット、モデル構成、および攻撃戦略に対する広範な実験は、防御効率、精度、および堅牢性の面でFRSの優位性を検証しています。
2025-02-09T12:03:59
Uni-Retrieval: A Multi-Style Retrieval Framework for STEM's Education
http://arxiv.org/abs/2502.05863v1
Yanhao Jia, Xinyi Wu, Hao Li, Qinglin Zhang, Yuxiao Hu, Shuai Zhao, Wenqi Fan
Nanyang Technological University, Shanghai Jiao Tong University, Peking University, Hong Kong Polytechnic University
AIを活用した教育において、さまざまなクエリスタイルを利用して抽象的なテキスト記述を解釈することは、高品質な教育を確保するために重要です。しかし、現在の情報検索モデルは主に自然なテキスト―イメージの検索に焦点を当てており、検索プロセスのあいまいさのために教育シナリオには十分に適応されていません。本論文では、教育シナリオに合わせた多様な表現検索タスクを提案し、複数のクエリスタイルや表現に基づく検索をサポートします。STEM教育検索データセット(SER)を導入し、異なるスタイルの24,000以上のクエリペアを含んでいます。また、プロンプトチューニングに基づく効率的でスタイルの多様化された検索ビジョン―言語モデルであるUni-Retrievalも紹介します。Uni-Retrievalは、クエリスタイルの特徴をプロトタイプとして抽出し、多様なクエリ向けのプロンプトトークンを含む継続的に更新されるPromptBankを構築します。このバンクはテスト時に更新可能で、異なる教科の検索シナリオのためのドメイン特有の知識を表すことができます。我々のフレームワークは、プロトタイプの類似性に基づいて動的にプロンプトトークンを取得し、未知のクエリの学習を効果的に支援することで、スケーラビリティと堅牢性を示しています。実験結果は、Uni-Retrievalがほとんどの検索タスクにおいて既存の検索モデルを上回ることを示しています。この進展は、多様な教育ニーズに対するスケーラブルで精密な解決策を提供します。
2025-02-09T11:46:05
Acquisition through My Eyes and Steps: A Joint Predictive Agent Model in Egocentric Worlds
http://arxiv.org/abs/2502.05857v1
Lu Chen, Yizhou Wang, Shixiang Tang, Qianhong Ma, Tong He, Wanli Ouyang, Xiaowei Zhou, Hujun Bao, Sida Peng
Zhejiang University, The Chinese University of Hong Kong, Shanghai Jiao Tong University, Shanghai Artificial Intelligence Laboratory
この論文では、人間のように振る舞うエージェントモデルを学習するタスクに取り組んでいます。このモデルは、自己中心的な世界において同時に知覚、予測、行動を行うことができます。従来の方法は通常、これらの3つの能力のために別々のモデルを訓練するため、情報の分孤が生じ、これらの能力が互いに学び合ったり効果的に協力したりすることができません。そこで本論文では、世界を表現し、未来の状態を予測し、合理的な行動を取ることを同時に学習する、EgoAgentと呼ばれる統合的な予測エージェントモデルを提案します。EgoAgentは、これら3つの能力の表現空間を統一し、すべてを連続トークンのシーケンスにマッピングします。学習可能なクエリトークンを追加して、現在の状態、未来の状態、次の行動を取得します。共同監督により、我々のエージェントモデルはこれらの3つの能力の内部関係を確立し、人間の推論および学習プロセスを効果的に模倣します。EgoAgentの包括的な評価は、画像分類、自己中心的な未来状態予測、3D人間動作予測タスクをカバーしており、我々の方法の優位性を示しています。再現性のために、コードと訓練済みモデルは公開される予定です。
2025-02-09T11:28:57
LegalSeg: Unlocking the Structure of Indian Legal Judgments Through Rhetorical Role Classification
http://arxiv.org/abs/2502.05836v1
Shubham Kumar Nigam, Tanmay Dubey, Govind Sharma, Noel Shallum, Kripabandhu Ghosh, Arnab Bhattacharya
IIT Kanpur, IISER Kolkata, Symbiosis Law School Pune
この論文では、インドの法的判断に焦点を当て、修辞的役割の分類を通じて法的文書のセマンティックセグメンテーションのタスクに取り組みます。私たちは、7,000以上の文書と140万の文が含まれ、7つの修辞的役割でラベル付けされた、今回のタスクのための最大の注釈データセット「LegalSeg」を紹介します。パフォーマンスをベンチマークするために、階層的BiLSTM-CRF、TransformerOverInLegalBERT(ToInLegalBERT)、グラフニューラルネットワーク(GNN)、および役割認識トランスフォーマーを含む複数の最新技術モデルを評価し、探索的なRhetoricLLaMAという指示調整された大規模言語モデルも評価しました。我々の結果は、より広い文脈、構造的関係、そして順次的な文情報を組み込んだモデルが、文レベルの特徴のみに依存するモデルを上回ることを示しています。さらに、分類精度に対する影響を評価するために、周辺文脈と隣接文の予測または実際のラベルを使用して実験を行いました。これらの進展にもかかわらず、密接に関連する役割を区別することやクラスの不均衡に対処することには課題が残っています。我々の研究は、法的文書の理解を向上させるための高度な技術の可能性を強調しており、法的自然言語処理における今後の研究のための強固な基盤を築いています。
2025-02-09T10:07:05
Contrastive Representation Distillation via Multi-Scale Feature Decoupling
http://arxiv.org/abs/2502.05835v1
Cuipeng Wang, Tieyuan Chen, Haipeng Wang
知識蒸留は、大きな事前学習された教師ネットワークから知識を転送することによって、パラメータサイズを増やすことなく、小型の学生ネットワークの性能を向上させることを目的とした技術です。従来のアプローチは主にグローバルな特徴情報の蒸留に焦点を当ててきましたが、異なる特徴の領域に埋め込まれた多様な情報を解きほぐす重要性を見落としていました。本研究では、初めて特徴転送プロセスにおけるマルチスケールのデカップリングを導入します。ここでは、デカップルされたローカル特徴が個別に処理され、対照的学習と統合されます。さらに、従来の対照的学習に基づく蒸留方法と比較して、私たちのアプローチは計算コストを削減するだけでなく、効率を向上させ、単一バッチのサンプルのみを使用して学生ネットワークの性能向上を可能にします。CIFAR-100およびImageNetにおける広範な評価は、私たちの方法の優位性を示しており、私たちの方法を用いて蒸留された一部の学生ネットワークは、事前学習された教師ネットワークの性能をさえ上回っています。これらの結果は、学生ネットワークが教師ネットワークから知識を徹底的に吸収できるようにする私たちのアプローチの効果を強調しています。
2025-02-09T10:03:18
LLMs for Drug-Drug Interaction Prediction: A Comprehensive Comparison
http://arxiv.org/abs/2502.06890v1
Gabriele De Vito, Filomena Ferrucci, Athanasios Angelakis
現代の治療プロジェムにおいて、薬剤の組み合わせの増加に伴い、薬物相互作用(DDI)を予測するための信頼できる手法が必要とされています。大規模言語モデル(LLM)はさまざまな分野で革命をもたらしましたが、製薬研究におけるその潜在能力、特にDDI予測に関してはほとんど探求されていません。本研究では、最新のDrugBankデータセットからの生データ入力として分子構造(SMILES)、標的生物、および遺伝子相互作用データを独自に処理し、LLMのDDI予測能力を徹底的に調査しました。GPT-4、Claude、Geminiなどの独自モデルと、1.5Bから72Bパラメータのオープンソースバリアントを含む18種類のLLMを評価し、まずDDI予測におけるゼロショット能力を評価しました。次に、選択したモデル(GPT-4、Phi-3.5 2.7B、Qwen-2.5 3B、Gemma-2 9B、Deepseek R1蒸留Qwen 1.5B)をファインチューニングして性能を最適化しました。我々の包括的な評価フレームワークは、13の外部DDIデータセットを通じた検証を含み、l2規則付きロジスティック回帰などの従来のアプローチと比較しました。ファインチューニングされたLLMは優れた性能を示し、Phi-3.5 2.7BはDDI予測において感度0.978を達成し、バランスの取れたデータセット(陽性50%、陰性50%)では精度0.919を示しました。この結果は、ゼロショット予測やDDI予測に使用される最先端の機械学習手法よりも改善されています。我々の分析は、LLMが複雑な分子相互作用パターンや、薬剤ペアが共通の遺伝子を標的とする場合を効果的に捉えられることを示しており、製薬研究および臨床環境における実用的な応用のための貴重なツールとなることを示唆しています。
2025-02-09T09:58:12
Compressing Model with Few Class-Imbalance Samples: An Out-of-Distribution Expedition
http://arxiv.org/abs/2502.05832v1
Tian-Shuang Wu, Shen-Huan Lyu, Ning Chen, Zhihao Qu, Baoliu Ye
Hohai University, Nanjing University
近年、プライバシーとパフォーマンスの折衷案として、プライバシーとセキュリティの懸念から生じる限られたデータに対処するために、少数サンプルモデル圧縮が広く採用されています。しかし、利用可能なサンプル数が極めて限られている場合、クラス不均衡が一般的で厄介な問題になります。すべてのクラスで均等なサンプル数を達成することは、実際のアプリケーションではコストがかかり非現実的であり、以前の少数サンプルモデル圧縮に関する研究はこの重要な問題をほとんど無視してきました。私たちの実験は、クラス不均衡が少数サンプルモデル圧縮手法の全体的なパフォーマンスに悪影響を及ぼすことを包括的に示しています。この問題に対処するために、ODD(Out-of-Distribution)データを圧縮およびファインチューニングプロセスに統合する新しい適応フレームワーク「OOD強化少数サンプルモデル圧縮(OE-FSMC)」を提案します。このフレームワークは、トレーニング分布を効果的に再均衡し、簡単にアクセス可能なOODデータを利用します。また、OODデータに対するモデルの過剰適合リスクを減少させるために、共同蒸留損失と正則化項も組み込んでいます。複数のベンチマークデータセットにおける広範な実験は、私たちのフレームワークが既存の少数サンプルモデル圧縮手法にシームレスに組み込むことができ、クラス不均衡によって引き起こされる精度の低下を効果的に緩和できることを示しています。
2025-02-09T09:47:23
HyGEN: Regularizing Negative Hyperedge Generation for Accurate Hyperedge Prediction
http://arxiv.org/abs/2502.05827v1
Song Kyung Yu, Da Eun Lee, Yunyong Ko, Sang-Wook Kim
Hanyang University, Chung-Ang University
ハイパーエッジ予測は、観察されたネットワーク構造に基づいて将来の高次関係を予測するための基本的なタスクです。しかし、既存のハイパーエッジ予測手法はデータのスパース性の問題に悩まされています。この問題を軽減するために、否定的サンプリング手法が使用され、存在しないハイパーエッジをモデルのトレーニングのための対照情報として活用します。しかし、以下の重要な課題はあまり研究されていません:(C1) 生成するための否定的情報のガイダンスの不足および (C2) 偽の否定が生成される可能性。これらに対処するために、私たちは新しいハイパーエッジ予測手法、HyGENを提案します。この手法は、(1) 正のハイパーエッジをガイダンスとして利用してより現実的なものを生成する否定的ハイパーエッジジェネレーターと(2) 生成されたハイパーエッジが偽の否定にならないようにする正則化項を採用しています。6つの実世界のハイパーグラフに対する広範な実験の結果、HyGENは常に4つの最先端のハイパーエッジ予測手法を上回ることが明らかになりました。
2025-02-09T09:27:35
MindCraft: Revolutionizing Education through AI-Powered Personalized Learning and Mentorship for Rural India
http://arxiv.org/abs/2502.05826v1
Arihant Bardia, Aayush Agrawal
Pune Institute of Computer Technology
マインドクラフトは、人工知能(AI)を活用して個別化された学習体験を創出し、メンターシップを提供し、資源の共有を促進することにより、インドの農村地域における教育を革新するために設計された現代的なプラットフォームです。質の高い教育へのアクセスが地理的要因や社会経済的地位によって大きく影響される国において、農村の学生たちはしばしば教育の旅において重大な障壁に直面します。マインドクラフトは、AIを利用して個別の学習経路を作成し、学生をメンターとつなげ、物理的およびデジタルの境界を超えた教育リソースの協力ネットワークを可能にすることで、このギャップを埋めることを目指しています。本論文では、農村学生が直面する課題、AIの変革的可能性、そしてマインドクラフトが公平な教育システムのために提供する持続可能でスケーラブルな解決策について探求します。インクルーシビティ、個別化学習、メンターシップに焦点を当てることで、マインドクラフトは農村の学生を力づけ、デジタル化が進む世界で成功するために必要なスキル、知識、機会を提供することを目指しています。最終的に、マインドクラフトは、テクノロジーが教育のギャップを埋めるだけでなく、より包括的で力強い社会の推進力となる未来を想像しています。
2025-02-09T09:26:03
Delta - Contrastive Decoding Mitigates Text Hallucinations in Large Language Models
http://arxiv.org/abs/2502.05825v1
Cheng Peng Huang, Hao-Yuan Chen
National Taiwan University of Science and Technology, Mindify AI, University of London
大規模言語モデル(LLM)は自然言語処理において強力な能力を示していますが、事実とは異なる情報や虚偽のコンテンツを生成するハルシネーションに悩まされています。この問題は彼らの信頼性を損なうもので、特に医療や法的助言といった高リスクの分野では重要です。この課題に対処するために、私たちはDeltaという推論時の手法を提案します。これは、モデルの再訓練や追加のデータを必要とせずにハルシネーションを減少させるものです。Deltaは入力プロンプトの一部をランダムにマスクし、元の入力とマスクされた入力の出力分布を対比させることで機能します。これにより、推論のみの計算を通じてハルシネーションが効果的に抑制されます。私たちは、文脈に富んだ質問応答ベンチマークでDeltaを評価し、SQuAD v1.1およびv2でそれぞれ約3ポイントと6ポイントの絶対的な改善を達成し、TriviaQAおよびNatural Questionsでのサンプリングデコーディングにおいては7ポイントと2ポイントの改善を得ました。さらに、SQuAD v2におけるノーアンサーの正確な一致スコアも10ポイント以上改善され、文脈の曖昧さから生じるハルシネーションを軽減する効果を示しています。これらの結果は、Deltaが現実のアプリケーションにおけるLLMの信頼性を向上させるための計算効率が高くスケーラブルなアプローチであることを強調しています。
2025-02-09T09:16:42
Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline
http://arxiv.org/abs/2502.06888v1
Zhiyuan Fang, Yuegui Huang, Zicong Hong, Yufeng Lyu, Wuhui Chen, Yue Yu, Fan Yu, Zibin Zheng
Sun Yat-sen University, Hong Kong University of Science and Technology, Huawei Technologies Co. Ltd, Peng Cheng Laboratory
Mixture of Experts (MoE)は、その独特のスパース構造により、計算コストを大幅に増加させることなく、言語モデルのスケーリングを数兆のパラメータまで可能にします。しかし、パラメータのサイズが大きくなるため、推論時に挑戦が生じます。GPUメモリの拡張がパラメータの増加についていけないからです。オフローディング技術がCPUやディスクのメモリを利用し、効率的にI/Oと計算を並列化する一方で、MoEモデルの各エキスパートに対する計算はI/Oよりも少ないことが多く、パイプライン内に多くのバブルが発生します。したがって、我々はKlotskiという効率的なMoE推論エンジンを提案します。これは、革新的なエキスパート対応のマルチバッチパイプラインパラダイムを通じてパイプラインバブルを大幅に減少させます。この提案されたパラダイムは、バッチ処理を使用して、現在のレイヤーの計算時間を次のレイヤーのロード時間と重なるように拡張します。このアイデアは密なモデルに効果的に適用されていますが、より多くのバッチはMoEのより多くのエキスパートをアクティベートさせ、結果として長いロード時間や多くのバブルが生じます。したがって、従来のアプローチとは異なり、我々は計算時間とI/O時間のバランスを取り、さまざまなバッチ数における異種の計算とI/O要件およびアクティベーションパターンに基づいて推論順序を調整することでバブルを最小化します。さらに、さまざまなハードウェア環境やモデルに適応するために、制約に敏感なI/O計算プランナーと相関に気づいたエキスパートのプリフェッチャーを設計し、パイプラインバブルを最小限に抑えるスケジュールを提供します。実験結果は、Klotskiが最先端技術に比べて優れたスループットとレイテンシのトレードオフを達成していることを示しており、最大85.12倍のスループット向上を実現しています。
2025-02-09T08:47:06
Decoding Complexity: Intelligent Pattern Exploration with CHPDA (Context Aware Hybrid Pattern Detection Algorithm)
http://arxiv.org/abs/2502.07815v1
Lokesh Koli, Shubham Kalra, Karanpreet Singh
Vectoredge.io
個人識別情報(PII)や保護された健康情報(PHI)などの敏感データを検出することは、データセキュリティプラットフォームにとって重要です。本研究では、検出速度、精度、スケーラビリティを最適化するために、正規表現(regex)ベースのパターンマッチングアルゴリズムと正確なマッチ検索技術を評価しました。ベンチマーク結果は、Google RE2が正規表現エンジンの中で速度(10~15 ms/MB)、メモリ効率(8~16 MB)、精度(99.5%)の最良のバランスを提供し、PCREを上回り、Hyperscanよりも広いハードウェア互換性を維持していることを示しています。正確なマッチングにおいて、Aho-Corasickは大規模データセットに対する優れたパフォーマンス(8 ms/MB)とスケーラビリティを示しました。パフォーマンス分析によると、正規表現の処理時間はデータセットのサイズとパターンの複雑さに対して線形にスケールします。AIと正規表現のハイブリッドアプローチは、再現率を改善し、誤検出を最小限に抑えることで、最高のF1スコア(91.6%)を達成しました。デバイスベンチマークは、我々のソリューションが高性能および中範囲のシステムの両方で効率的なCPUおよびメモリ使用を維持していることを確認しました。その効果にもかかわらず、多言語サポートの制限や定期的なパターンの更新の必要性などの課題は残っています。今後の作業は、言語カバレッジの拡大、データセキュリティおよびプライバシー管理(DSPM)とデータ損失防止(DLP)ツールの統合、より広範なグローバル採用のための規制遵守の強化に焦点を当てるべきです。
2025-02-09T07:24:16
The Curse of Depth in Large Language Models
http://arxiv.org/abs/2502.05795v1
Wenfang Sun, Xinyuan Song, Pengxiang Li, Lu Yin, Yefeng Zheng, Shiwei Liu
この論文では、「深さの呪い」という概念を紹介します。この概念は、最近の現代の大規模言語モデル(LLM)における観察を強調し、説明し、対処するものです。具体的には、ほぼ半分の層が予想よりも効果的でないという現象です。まず、Llama、Mistral、DeepSeek、Qwenなどの最も人気のあるLLMファミリー全体にこの現象が広く存在することを確認します。私たちの分析により、理論的および実証的に、LLMにおける深層層の効果が薄い理由は、プレ層正規化(Pre-LN)の広範な使用にあることを特定しました。Pre-LNはトランスフォーマーLLMのトレーニングを安定化させますが、その出力の分散はモデルの深さに対して指数関数的に増加し、不都合なことに深層トランスフォーマーブロックの微分が単位行列となってしまい、トレーニングにほとんど寄与しなくなります。このトレーニングの落とし穴を解決するために、私たちは層正規化スケーリングを提案します。これは、層正規化の出力の分散をその深さの平方根で逆にスケーリングします。このシンプルな修正により、深いトランスフォーマー層の出力分散の爆発が軽減され、彼らの寄与が改善されます。130Mから1Bまでのモデルサイズにわたる私たちの実験結果は、層正規化スケーリングがPre-LNと比較してLLMの事前トレーニングパフォーマンスを大幅に向上させることを示しています。さらに、この改善は、教師ありファインチューニングにもシームレスに引き継がれます。これらのすべての向上は、層正規化スケーリングによって深層層がトレーニング中により効果的に寄与できるようになることに起因しています。
2025-02-09T07:03:36
Gradient Based Method for the Fusion of Lattice Quantizers
http://arxiv.org/abs/2502.06887v1
Liyuan Zhang, Hanzhong Cao, Jiaheng Li, Minyang Yu
実用的なアプリケーションにおいて、格子量子化器は離散的な格子点を利用して格子内の任意の点を近似します。効果的な格子量子化器は、これらの近似の精度と効率を大幅に向上させます。高次元の格子量子化の文脈において、以前の研究では低次元の最適な格子量子化器の利用を提案し、直交スプライシングにおける最適な長さ比を決定する課題に取り組みました。特に、固定長比と直交性が低次元格子を組み合わせる際に最適でない結果を生じることが示されました。この基礎の上に、別のアプローチとして勾配降下法を用いて最適な格子を特定する方法が採用され、これが私たちに、直交スプライシング法で得られたものを上回る行列を発見するためのニューラルネットワークの利用を探るインスピレーションを与えました。この問題に対処するために、私たちは2つの新しいアプローチ、すなわちハウスホールドアルゴリズムとマトリックスエクスペアルゴリズムを提案します。私たちの結果は、ハウスホールドアルゴリズムとマトリックスエクスペアルゴリズムの両方が、次元13、15、17から19、21、22にわたって格子量子化器の改善を達成することを示しています。さらに、マトリックスエクスペアルゴリズムは高次元の設定において優れた効果を示しています。
2025-02-09T06:37:47
EPBC-YOLOv8: An efficient and accurate improved YOLOv8 underwater detector based on an attention mechanism
http://arxiv.org/abs/2502.05788v1
Xing Jiang, Xiting Zhuang, Jisheng Chen, Jian Zhang
Hainan University
この研究では、YOLOv8のバックボーンにチャネルおよび空間注意機構を統合することで水中ターゲット検出を強化し、FasterPWモデルのためにFasterNeXtでポイントワイズ畳み込みを適用し、改善されたクロススケール接続および堅牢性のためにBiFPNにインスパイアされたWFPN構造で重み付けされた連結を利用します。CARAFEを使用して特徴の再構成を精緻化し、私たちのフレームワークは水中画像の劣化に対処し、URPC2019とURPC2020データセットでそれぞれ76.7パーセントと79.0パーセントのmAP at 0.5スコアを達成しました。これらのスコアは元のYOLOv8よりも2.3パーセントおよび0.7パーセント高く、海洋生物の検出精度が向上していることを示しています。
2025-02-09T06:09:56
WatchGuardian: Enabling User-Defined Personalized Just-in-Time Intervention on Smartwatch
http://arxiv.org/abs/2502.05783v1
Ying Lei, Yancheng Cao, Will Wang, Yuanzhe Dong, Changchang Yin, Weidan Cao, Ping Zhang, Jingzhen Yang, Bingsheng Yao, Yifan Peng, Chunhua Weng, Randy Auerbach, Lena Mamykina, Dakuo Wang, Yuntao Wang, Xuhai Xu
Simon Fraser University, Columbia University, Stanford University, The Ohio State University, Nationwide Children’s Hospital, Northeastern University, Weill Cornell Medicine, University of Washington
ジャストインタイム介入(JITI)は、一般的な健康行動への効果的な対象となっていますが、個人には身体的、精神的、社会的健康に悪影響を及ぼす望ましくない行動に介入するためのユニークなニーズがしばしばあります。私たちは、ユーザーが少数のサンプルでこれらの個人的な行動に対するカスタム介入を定義できるスマートウォッチベースのJITIシステム「WatchGuardian」を提案します。限られた新しいデータサンプルに基づいて新しい行動を検出するために、公開された手のジェスチャーデータセットで事前にトレーニングされた慣性計測ユニット(IMU)モデルを微調整する少数ショット学習パイプラインを開発しました。その後、カスタマイズ用の追加分類層をトレーニングするためのデータ拡張と合成プロセスを設計しました。26人の参加者を対象としたオフライン評価では、サンプルが3つ、5つ、10つのときに、私たちのアプローチはそれぞれ平均精度76.8%、84.7%、87.7%、F1スコア74.8%、84.2%、87.2%を達成しました。その後、WatchGuardianをルールベースの介入と比較する4時間の介入研究を行いました。その結果、私たちのシステムは望ましくない行動を64.0 ± 22.6%も大幅に削減し、ベースラインを29.0%上回る成果を示しました。我々の研究成果は、個人的な望ましくない行動への行動介入が必要な個人に対して、カスタマイズ可能でAI駆動のJITIシステムの効果的であることを強調しています。我々の作業が、先進的なAIソリューションによるユーザー定義のパーソナライズされた介入のより広範な応用を促進できることを期待しています。
2025-02-09T05:58:31
Predictive Crash Analytics for Traffic Safety using Deep Learning
http://arxiv.org/abs/2502.05777v1
Karthik Sivakoti
従来の自動クラッシュ分析システムは、静的統計モデルと歴史的データに大きく依存しており、手動での解釈が必要で、リアルタイムの予測能力に欠けています。本研究では、アンサンブル学習手法とマルチモーダルデータ融合を統合し、リアルタイムのクラッシュリスク評価と予測を行う革新的な交通安全分析アプローチを提案します。我々の主な貢献は、空間的・時間的なクラッシュパターンと環境条件を組み合わせた階層的重症度分類システムを開発したことにあります。このシステムは、従来の統計的方法に比べて重要な改善を達成しています。システムは、平均適合率(mAP)0.893を示し、現在の最先端技術(基準mAP: 0.776)に対して15%の改善を表しています。我々は、クラッシュ地点データを事故報告および気象条件と統合する新しい特徴エンジニアリング技術を導入し、リスク予測において92.4%の精度とホットスポット特定において89.7%の適合率を達成しました。500,000の初期クラッシュ記録を59,496件の高品質サンプルにフィルタリングする広範な検証を通じて、我々のソリューションは予測精度と計算効率の両方で顕著な改善を示します。主な革新には、堅牢なデータクリーニングパイプライン、適応型特徴生成、そしてピーク時に1,000の同時リクエストを処理できるスケーラブルなリアルタイム予測システムが含まれ、100ms未満の応答時間を維持しています。
2025-02-09T05:00:46
PIPA: Preference Alignment as Prior-Informed Statistical Estimation
http://arxiv.org/abs/2502.05773v1
Junbo Li, Zhangyang Wang, Qiang Liu
オフラインの好み調整は、直接好み最適化(DPO)などの言語モデルにおいて、その効果とシンプルさから好まれています。これにより、高価な強化学習が不要になります。さまざまなオフラインアルゴリズムが異なるデータ設定に対して開発されてきましたが、統一的な理解が欠けています。本研究では、先行情報に基づいた好み調整(PIPA)を導入します。これは、先行制約を持つ最大尤度推定(MLE)問題として言語モデルの好み調整を定式化した、統一的で強化学習不要な確率的フレームワークです。この方法は、ペアデータと非ペアデータ、さらに回答およびステップレベルの注釈の両方に効果的に対応します。私たちは、DPOとKTOが当フレームワーク内で異なる先行制約を持つ特別なケースであることを示します。さまざまなタイプの先行情報を統合することで、PIPAの2つのバリエーション、PIPA-MとPIPA-Nを開発しました。両アルゴリズムは、GSM8KおよびMATHベンチマークにおいて、すべての設定で$3\sim10\%$のパフォーマンス向上を示し、既存のアルゴリズムに比べて追加のトレーニングや計算コストなしでこれらの改善を達成しました。
2025-02-09T04:31:30
Effective Black-Box Multi-Faceted Attacks Breach Vision Large Language Model Guardrails
http://arxiv.org/abs/2502.05772v1
Yijun Yang, Lichao Wang, Xiao Yang, Lanqing Hong, Jun Zhu
ビジョン・ラージ・ランゲージ・モデル(VLLM)は、視覚データ処理を統合し、現実のアプリケーションを拡大していますが、それと同時に安全でない応答を生成するリスクも増大しています。これに応じて、主要な企業はアラインメントトレーニング、安全システムプロンプト、コンテンツモデレーションなどの多層的な安全防御を実装しています。しかし、洗練された敵の攻撃に対するそれらの効果は、ほとんど探索されていません。本論文では、VLLMの多層防御を体系的に回避するために設計された新しい攻撃フレームワークである「マルチファセット攻撃(MultiFaceted Attack)」を提案します。これは、視覚攻撃、アラインメントブレイキング攻撃、アドバーサリアルシグネチャという3つの補完的な攻撃要素から構成されています。視覚攻撃は、VLLMのマルチモーダルな性質を利用して画像を通じて有害なシステムプロンプトを注入します。アラインメントブレイキング攻撃は、モデルのアラインメントメカニズムを操作して対照的な応答の生成を優先します。そして、アドバーサリアルシグネチャは、応答の最後に誤解を招く情報を戦略的に配置することでコンテンツモデレーターを欺きます。8つの商業的なVLLMにおけるブラックボックス設定での広範な評価により、マルチファセット攻撃は61.56%の攻撃成功率を達成し、最新の手法を少なくとも42.18%上回ることが示されています。
2025-02-09T04:21:27
UniDB: A Unified Diffusion Bridge Framework via Stochastic Optimal Control
http://arxiv.org/abs/2502.05749v2
Kaizhen Zhu, Mokai Pan, Yuexin Ma, Yanwei Fu, Jingyi Yu, Jingya Wang, Ye Shi
最近の拡散ブリッジモデルの進展は、Doobの$h$-変換を活用して分布間に固定エンドポイントを設定し、画像翻訳や修復タスクにおいて有望な結果を示しています。しかし、これらのアプローチはしばしばぼやけた、または過度に滑らかになった画像の詳細を生み出し、これらの欠点を説明する包括的な理論的基盤が欠けています。これらの制限に対処するために、我々はUniDBを提案します。これは、確率的最適制御(SOC)に基づく拡散ブリッジの統一フレームワークです。UniDBは、SOCに基づく最適化を通じて問題を定式化し、最適コントローラーの閉じた形の解を導出することで、既存の拡散ブリッジモデルを統一および一般化します。我々は、Doobの$h$-変換を用いた既存の拡散ブリッジが我々のフレームワークの特別なケースであることを示します。このケースは、SOCコスト関数の端末ペナルティ係数が無限大に近づくときに現れます。調整可能な端末ペナルティ係数を取り入れることで、UniDBは制御コストと端末ペナルティの最適なバランスを達成し、詳細の保持と出力品質を大幅に向上させます。特に、UniDBは既存の拡散ブリッジモデルとシームレスに統合され、最小限のコード修正のみで済みます。さまざまな画像修復タスクにおける広範な実験は、提案されたフレームワークの優越性と適応性を検証しています。私たちのコードはhttps://github.com/UniDB-SOC/UniDB/で利用可能です。
2025-02-09T02:43:57
Satellite Observations Guided Diffusion Model for Accurate Meteorological States at Arbitrary Resolution
http://arxiv.org/abs/2502.07814v1
Siwei Tu, Ben Fei, Weidong Yang, Fenghua Ling, Hao Chen, Zili Liu, Kun Chen, Hang Fan, Wanli Ouyang, Lei Bai
Fudan University, Shanghai Artificial Intelligence Laboratory, The Chinese University of Hong Kong, Beihang University, Columbia University, Nanjing University of Information Science and Technology
任意の場所での表面的な気象条件の正確な取得は、天気予報や気候シミュレーションにおいて重要な意義を持っています。衛星観測から導出された気象状態はしばしば低解像度のグリッドフィールドの形で提供されるため、特定の場所の気象状態を取得するために空間補間を直接適用することは、実際の観測と比較すると非常に大きな不一致を引き起こすことがよくあります。高解像度で気象状態情報を取得するための既存のダウンサンプリング手法は、衛星観測との相関を見落とすことが一般的です。このギャップを埋めるために、私たちは衛星観測に基づいた拡散モデル(SGD)を提案します。これは、ERA5再解析データに対して衛星観測(GridSat)を条件として事前訓練された条件付き拡散モデルであり、ゼロショットガイデッドサンプリング戦略とパッチベースの方法を用いてダウンサンプリングされた気象状態をサンプリングするために使用されます。訓練プロセスでは、GridSat衛星観測からの情報をERA5マップにアテンションメカニズムを通じて融合することを提案し、SGDが実際の条件により正確に一致する大気状態を生成できるようにします。サンプリングの際には、最適化可能な畳み込みカーネルを使用してアップスケールプロセスをシミュレートし、低解像度のERA5マップおよび気象観測所からの観測データをガイダンスとして使用して高解像度のERA5マップを生成します。さらに、私たちの考案したパッチベースの手法は、SGDが任意の解像度で気象状態を生成することを促進します。実験は、SGDが6.25kmまでの正確な気象状態のダウンサンプリングを達成することを示しています。
2025-02-09T02:05:33
RECOVER: Designing a Large Language Model-based Remote Patient Monitoring System for Postoperative Gastrointestinal Cancer Care
http://arxiv.org/abs/2502.05740v1
Ziqi Yang, Yuxuan Lu, Jennifer Bagdasarian, Vedant Das Swain, Ritu Agarwal, Collin Campbell, Waddah Al-Refaire, Jehan El-Bayoumi, Guodong Gao, Dakuo Wang, Bingsheng Yao, Nawar Shara
癌の手術は、世界中の癌関連死の35%以上を占める消化管(GI)癌の主要な治療法ですが、術後の合併症は予測不可能であり、生命を脅かすことがあります。本論文では、最近の大規模言語モデル(LLM)の進展が、臨床統合を通じて遠隔患者モニタリング(RPM)システムにどのように貢献できるかを調査します。私たちは、RECOVERというLLM駆動の術後GI癌ケアのためのRPMシステムを設計しました。設計プロセスにステークホルダーを密に関与させるため、まず5人の臨床スタッフとの参加型デザインセッションを7回実施し、5人の癌患者にインタビューを行い、臨床ガイドラインと情報のニーズをLLMベースのRPMシステムに統合するための6つの主要なデザイン戦略を導き出しました。次に、癌患者のためのLLM駆動の会話型エージェントと、効率的な術後RPMを可能にするための臨床スタッフ向けのインタラクティブダッシュボードを特徴とするRECOVERを設計および実装しました。最後に、RECOVERをパイロットシステムとして使用して、4人の臨床スタッフと5人の患者と共にデザイン戦略の実装を評価し、重要なデザイン要素を特定することによってデザインの示唆を提供し、責任あるAIに関する洞察を提供し、将来のLLM駆動のRPMシステムに向けた機会を概説しました。
2025-02-09T01:51:25
Mitigating Sensitive Information Leakage in LLMs4Code through Machine Unlearning
http://arxiv.org/abs/2502.05739v1
Ruotong Geng, Mingyang Geng, Shangwen Wang, Haotian Wang, Zhipeng Lin, Dezun Dong
Beijing University of Posts and Telecommunications, National University of Defense Technology, Academy of Military Sciences
大規模言語モデル(LLMs4Code)は、コード生成タスクに優れた性能を発揮し、開発者が巨大なソフトウェア開発の負担から解放される可能性を秘めています。しかしながら、これらのモデルは、トレーニング中に埋め込まれた機密情報が漏洩する可能性に起因する重大なプライバシーリスクに苦しむことが示されています。この問題に対処することは、プライバシーコンプライアンスを確保し、ユーザーの信頼を維持するために極めて重要ですが、現在のところ、この特定の方向性に焦点を当てた専用の研究が文献には不足しています。最近、機械的なアンラーニングが、有望な解決策として浮上しており、モデルが完全な再トレーニングを行わずに機密情報を「忘れる」ことを可能にし、従来のデータクリーニング方法と比較して効率的かつスケーラブルなアプローチを提供します。本論文では、LLMs4Codeにおけるプライバシーの懸念に対処するためのアンラーニング技術の有効性を実証的に評価します。具体的には、プライバシーデータの忘却とこれらのモデルのコード生成能力の両方を考慮したベンチマークで、最先端の3つのアンラーニングアルゴリズムと、よく知られたオープンソースのLLMs4Codeを調査します。結果は、LLMs4Codeのプライバシーの懸念を機械的なアンラーニングを通じて緩和しつつ、同時にそのコード生成能力を維持することが可能であることを示しています。また、アンラーニング後のプライバシー保護/漏洩の形態を分析し、直接的な漏洩から間接的な漏洩への移行を観察しました。これは、将来の研究がこのリスクに対応する必要性を強調しています。
2025-02-09T01:50:34