We propose eXtensible Prompt (X-Prompt) for prompting a large language model (LLM) beyond natural language (NL). X-Prompt instructs an LLM with not only NL but also an extensible vocabulary of imaginary words that are introduced to help represent what NL words hardly describe, allowing a prompt to be more descriptive. Like NL prompts, X-Prompt is out-of-distribution (OOD) robust, for which we propose context-guided learning with prompt augmentation to learn its imaginary words for general usability, enabling them to use in different prompt contexts for fine-grain specifications. The promising results of X-Prompt demonstrate its potential of approaching advanced interaction between humans and LLMs to bridge their communication gap.
translated by 谷歌翻译
Self-supervised monocular depth estimation (MDE) models universally suffer from the notorious edge-fattening issue. Triplet loss, as a widespread metric learning strategy, has largely succeeded in many computer vision applications. In this paper, we redesign the patch-based triplet loss in MDE to alleviate the ubiquitous edge-fattening issue. We show two drawbacks of the raw triplet loss in MDE and demonstrate our problem-driven redesigns. First, we present a min. operator based strategy applied to all negative samples, to prevent well-performing negatives sheltering the error of edge-fattening negatives. Second, we split the anchor-positive distance and anchor-negative distance from within the original triplet, which directly optimizes the positives without any mutual effect with the negatives. Extensive experiments show the combination of these two small redesigns can achieve unprecedented results: Our powerful and versatile triplet loss not only makes our model outperform all previous SoTA by a large margin, but also provides substantial performance boosts to a large number of existing models, while introducing no extra inference computation at all.
translated by 谷歌翻译
作为一种概率建模技术,基于流的模型在无损压缩\ cite {idf,idf ++,lbb,ivpf,iflow}的领域表现出了巨大的潜力。与其他深层生成模型(例如自动回应,VAE)\ cite {bitswap,hilloc,pixelcnn ++,pixelsnail},这些模型明确地模拟了数据分布概率,因此基于流的模型的性能更好,因为它们的出色概率密度估计和满意度的概率和满意度的概率。在基于流量的模型中,多尺度体系结构提供了从浅层到输出层的快捷方式,从而大大降低了计算复杂性并避免添加更多层时性能降解。这对于构建基于先进的基于流动的可学习射击映射至关重要。此外,实用压缩任务中模型设计的轻量级要求表明,具有多尺度体系结构的流量在编码复杂性和压缩效率之间取得了最佳的权衡。
translated by 谷歌翻译
跨域推荐(CDR)可以帮助客户在不同域中找到更多令人满意的项目。现有的CDR模型主要使用普通用户或映射功能作为域之间的桥梁,但在充分利用跨域的额外知识方面的探索非常有限。在本文中,我们建议将CDR的知识图(kg)纳入,这使不同领域中的项目能够共享知识。为此,我们首先从Freebase KG构建了一个新的数据集AmazonKG4CDR和Amazon评论数据的一个子集(两个域对:电影音乐,电影书籍)。这个新的数据集有助于将知识与CDR内部和跨域项目桥接。然后,我们提出了一个新的框架,KG感知的神经集体矩阵分解(KG-NEUCMF),利用KG来丰富项目表示。它首先通过图形卷积自动编码器学习项目嵌入,以从kg中的相邻和高阶邻居中捕获域特异性和域一般知识。然后,我们最大程度地提高了从kg和用户项目矩阵中学到的项目嵌入之间的共同信息,以建立跨域关系以获得更好的CDR。最后,我们对新建的数据集进行了广泛的实验,并证明我们的模型明显优于表现最佳的基线。
translated by 谷歌翻译
生物医学问题的回答旨在从生物医学领域获得对给定问题的答案。由于其对生物医学领域知识的需求很高,因此模型很难从有限的培训数据中学习域知识。我们提出了一种上下文嵌入方法,该方法结合了在生物医学域数据上预先训练的开放域QA模型\ AOA和\ biobert模型。我们对大型生物医学语料库采用无监督的预培训,并在生物医学问题答案数据集上进行了微调。此外,我们采用基于MLP的模型加权层自动利用两个模型的优势以提供正确的答案。由PubMed语料库构建的公共数据集\ BIOMRC用于评估我们的方法。实验结果表明,我们的模型以大幅度优于最先进的系统。
translated by 谷歌翻译
结构从动作(SFM)旨在根据输入图像之间的对应关系恢复3D场景结构和相机姿势,因此,由重复结构(即具有强视觉相似的不同结构)引起的歧义始终导致摄像头的姿势和不正确的相机姿势3D结构。为了处理歧义,大多数现有研究通过分析两种观察几何或特征点来求助于其他约束信息或隐式推理。在本文中,我们建议利用场景中的高级信息,即本地区域的空间上下文信息,以指导重建。具体而言,提出了一种新颖的结构,即{\ textit {track-community}},其中每个社区由一组轨道组成,代表场景中的本地段。社区检测算法用于将场景分为几个部分。然后,通过分析轨道的邻域并通过检查姿势一致性来检测潜在的模棱两可的段。最后,我们对每个段进行部分重建,并将它们与新颖的双向一致性成本函数对齐,该函数考虑了3D-3D对应关系和成对相对摄像头的姿势。实验结果表明,我们的方法可以牢固地减轻视觉上无法区分的结构而导致的重建失败,并准确合并部分重建。
translated by 谷歌翻译
对抗训练方法是针对对抗性例子的最先进(SOTA)经验防御方法。事实证明,许多正则化方法与对抗训练的组合有效。然而,这种正则化方法是在时域中实现的。由于对抗性脆弱性可以被视为一种高频现象,因此必须调节频域中的对抗训练的神经网络模型。面对这些挑战,我们对小波的正则化属性进行了理论分析,可以增强对抗性训练。我们提出了一种基于HAAR小波分解的小波正则化方法,该方法称为小波平均池。该小波正则化模块集成到宽的残留神经网络中,因此形成了新的WideWavelEtResnet模型。在CIFAR-10和CIFAR-100的数据集上,我们提出的对抗小波训练方法在不同类型的攻击下实现了相当大的鲁棒性。它验证了以下假设:我们的小波正则化方法可以增强对抗性的鲁棒性,尤其是在深宽的神经网络中。实施了频率原理(F原理)和解释性的可视化实验,以显示我们方法的有效性。提出了基于不同小波碱函数的详细比较。该代码可在存储库中获得:\ url {https://github.com/momo1986/AdversarialWavelTraining}。
translated by 谷歌翻译
深神经网络是量子状态表征的强大工具。现有网络通常是通过从需要表征的特定量子状态收集的实验数据来训练的。但是,除了用于培训的量子状态以外,是否可以离线训练神经网络并对量子状态进行预测?在这里,我们介绍了一个网络模型,该模型可以接受来自基准状态和测量结果的经典模拟数据训练,然后可以用来表征与基准集中与状态共享结构相似性的量子状态。在很少的量子物理指导下,该网络构建了自己的数据驱动的量子状态表示,然后使用它来预测尚未执行的量子测量结果的结果统计。网络产生的状态表示也可以用于超出预测结果统计数据的任务,包括量子状态的聚类和物质不同阶段的识别。我们的网络模型提供了一种灵活的方法,可以应用于在线学习方案,在该场景中,必须在实验数据可用后立即生成预测,以及学习者只能访问对量子硬件的加密描述的盲目学习场景。
translated by 谷歌翻译
视频文本预培训旨在通过对齐视觉和文本信息之间的语义来对齐大规模视频文本对学习可转换表示。最先进的方法以端到端的方式从原始像素提取视觉特征。然而,这些方法直接在帧级运行,从而忽略了视频中对象的时空结构,这在文本描述中具有名词的强烈协同作用。在这项工作中,我们提出了一个简单而有效的模块,即用于视频文本表示学习,即RegionLearner,它可以考虑在大规模视频文本对预训练中的对象结构。给定视频,我们的模块(1)首先将可视特征量化为语义集群,然后(2)生成被动掩码并使用它们聚合属于同一语义区域的功能,最后(3)模拟不同聚合区域之间的交互。与使用现成的对象探测器相比,我们所提出的模块不需要明确的监督,并且更加计算效率。我们在公共WebVID2M和CC3M数据集上预先列车。对四个下游视频文本检索基准测试的广泛评估清楚地展示了我们的地区learner的有效性。代码将在https://github.com/ruiyan1995/region_learner上获得。
translated by 谷歌翻译
最近,通过引入大规模的数据集和强大的变压器网络,视频预培训表明尤其是检索的巨大成功。然而,现有的视频语言变压器模型没有明确细粒度的语义对齐。在这项工作中,我们呈现了对象感知的变换器,以对象为中心的方法,该对象方法扩展了视频语言变压器来合并对象表示。关键的想法是利用边界框和对象标签来指导培训过程。我们在四个广泛使用的基准测试中评估了我们的三个标准子任务的模型。我们还提供了深入的分析和详细消融关于所提出的方法。我们在考虑的所有任务和数据集中表现出清晰的性能,展示将对象表示的模型中的型号集成到视频架构中。代码将以\ URL {https://github.com/fingerrec/oa -transformer}释放。
translated by 谷歌翻译