我们引入了一种基于最近邻居回归的活动函数近似的算法。我们的活跃邻居回归器(ANNR)依靠Voronoi-Delaunay框架从计算几何形状到具有恒定估计函数值的空间将空间细分为恒定的函数值,并以一种将函数图的几何形状计入的方式选择新的查询点。我们将最新的最新活动函数近似值(称为defer)视为基于空间的增量矩形分区,为主基线。ANNR解决了由延期中使用的空间细分策略产生的许多局限性。我们提供了我们方法的计算有效实施以及理论停止保证。经验结果表明,Annr优于封闭形式函数和现实示例的基线,例如引力波参数推断和生成模型潜在空间的探索。
translated by 谷歌翻译
基于最佳抽样的运动计划和轨迹优化是两个竞争框架,以生成最佳运动计划。这两个框架都有互补的属性:基于抽样的计划者通常会趋于趋势,但提供最佳保证。但是,轨迹优化器通常很快就可以收敛,但在非凸问题中不提供全局最佳保证,例如场景有障碍。为了达到两全其美,我们介绍了一个新的计划者Bitkomo,该计划者将渐近最佳的批处理知识树(BIT*)计划者与K-order Markov优化(KOMO)轨迹优化框架集成在一起。我们的计划者随时随地,并保持BIT*提供的相同的渐近优化性保证,同时还利用KOMO轨迹优化器的快速收敛性。我们在实验中评估了我们的计划者在涉及高维配置空间的操作场景方面,最多有两个7-DOF操纵器,障碍物和狭窄的通道。即使Komo失败,Bitkomo的表现也比Komo更好,并且在收敛到最佳解决方案方面,它的表现优于Bit*。
translated by 谷歌翻译
我们介绍了DeepNash,这是一种能够学习从头开始播放不完美的信息游戏策略的自主代理,直到人类的专家级别。 Stratego是人工智能(AI)尚未掌握的少数标志性棋盘游戏之一。这个受欢迎的游戏具有$ 10^{535} $节点的巨大游戏树,即,$ 10^{175} $倍的$倍于GO。它具有在不完美的信息下需要决策的其他复杂性,类似于德克萨斯州Hold'em扑克,该扑克的游戏树较小(以$ 10^{164} $节点为单位)。 Stratego中的决策是在许多离散的动作上做出的,而动作与结果之间没有明显的联系。情节很长,在球员获胜之前经常有数百次动作,而Stratego中的情况则不能像扑克中那样轻松地分解成管理大小的子问题。由于这些原因,Stratego几十年来一直是AI领域的巨大挑战,现有的AI方法几乎没有达到业余比赛水平。 Deepnash使用游戏理论,无模型的深钢筋学习方法,而无需搜索,该方法学会通过自我播放来掌握Stratego。 DeepNash的关键组成部分的正则化NASH Dynamics(R-NAD)算法通过直接修改基础多项式学习动力学来收敛到近似NASH平衡,而不是围绕它“循环”。 Deepnash在Stratego中击败了现有的最先进的AI方法,并在Gravon Games平台上获得了年度(2022年)和历史前3名,并与人类专家竞争。
translated by 谷歌翻译
爆发两年多后,Covid-19的大流行继续困扰世界各地的医疗系统,给稀缺资源带来压力,并夺走了人类的生命。从一开始,已经采用了各种基于AI的CoVID-19检测和监测工具,以试图通过及时诊断来阻止感染的潮流。特别是,已经建议计算机试听是一种非侵入性,成本效益和环保的替代方法,可通过声音通过声音来检测COVID-19的感染。但是,像所有AI方法一样,计算机试镜也很大程度上取决于可用数据的数量和质量,并且由于此类数据的敏感性,大规模的COVID-19声音数据集很难获取 - 除其他原因外。为此,我们介绍了COVYT数据集 - 一种新颖的Covid-19数据集,该数据集是从包含来自65位演讲者的8个小时以上语音的公共资源中收集的。与其他现有的COVID-19声音数据集相比,COVYT数据集的独特功能是,它包括所有65位扬声器的covid-19正和负样本。我们使用可解释的音频描述来分析Covid-19的声学表现,并使用可解释的音频描述,并研究几种分类场景,并调查一些分类场景,以将基于公平的言语的COVID进行适当的分配策略-19检测。
translated by 谷歌翻译
我们提出了一种方法来检测经验观察到的轨迹的异常值,在由单层复杂模型的离散或离散化歧管上的轨迹中的轨迹中的轨迹。我们的方法类似于诸如扩散图和拉普拉斯特征模式的光谱嵌入,其构建与与低特征值相关的图拉普拉斯的特征向量的顶点嵌入。在这里,我们将轨迹视为在单一的复合物上定义的边缘流动矢量,图形的更高阶的概括,并使用单层复合物的霍奇1-laplacian来导出这些边缘流的嵌入。通过将轨迹向量投影到与小特征值相关联的霍奇特1-Laplacian的成熟空间,我们可以表征轨迹相对于复合物的同源性的行为,这对应于底层空间中的孔。这使我们能够根据简单的解释,低维统计来对轨迹进行分类。我们展示了这种技术如何单一突出的轨迹(拓扑地)与典型的轨迹相比不同,并说明了我们对合成和经验数据的方法的性能。
translated by 谷歌翻译
深度网络和决策林(如随机森林和渐变升级树)分别是用于结构化和表格数据的主要机器学习方法。许多论文在一个或两个不同的域(例如,在100个不同的表格数据设置上)经验上比较了大量分类器(例如,在100个不同的表格数据设置)上。然而,使用最具当代最佳实践的仔细概念和经验比较这两种策略尚未进行。概念上,我们说明两者都可以盈利地被视为“分区和投票”方案。具体地,他们俩学习的表示空间是将特征空间分区到凸多台的联合中。对于推理,每个都决定从激活节点的投票。该配方允许统一对这些方法之间关系的基本理解。凭经验,我们对数百个表格数据设置以及多个视觉和听觉设置进行比较这两种策略。我们的重点是在大多数10,000个样本的数据集上,它代表了大部分科学和生物医学数据集。一般而言,我们发现森林在表格和结构化数据(视觉和试镜)上以小样本尺寸的表现,而深网络在具有较大样本尺寸的结构化数据上更好地进行。这表明可以通过进一步结合森林和网络的进一步结合来实现两种情况的进一步提升。我们将继续在未来几个月内修改此技术报告,并更新结果。
translated by 谷歌翻译
放射线学使用定量医学成像特征来预测临床结果。目前,在新的临床应用中,必须通过启发式试验和纠正过程手动完成各种可用选项的最佳放射组方法。在这项研究中,我们提出了一个框架,以自动优化每个应用程序的放射线工作流程的构建。为此,我们将放射线学作为模块化工作流程,并为每个组件包含大量的常见算法。为了优化每个应用程序的工作流程,我们使用随机搜索和结合使用自动化机器学习。我们在十二个不同的临床应用中评估我们的方法,从而在曲线下导致以下区域:1)脂肪肉瘤(0.83); 2)脱粘型纤维瘤病(0.82); 3)原发性肝肿瘤(0.80); 4)胃肠道肿瘤(0.77); 5)结直肠肝转移(0.61); 6)黑色素瘤转移(0.45); 7)肝细胞癌(0.75); 8)肠系膜纤维化(0.80); 9)前列腺癌(0.72); 10)神经胶质瘤(0.71); 11)阿尔茨海默氏病(0.87);和12)头颈癌(0.84)。我们表明,我们的框架具有比较人类专家的竞争性能,优于放射线基线,并且表现相似或优于贝叶斯优化和更高级的合奏方法。最后,我们的方法完全自动优化了放射线工作流的构建,从而简化了在新应用程序中对放射线生物标志物的搜索。为了促进可重复性和未来的研究,我们公开发布了六个数据集,框架的软件实施以及重现这项研究的代码。
translated by 谷歌翻译
While the capabilities of autonomous systems have been steadily improving in recent years, these systems still struggle to rapidly explore previously unknown environments without the aid of GPS-assisted navigation. The DARPA Subterranean (SubT) Challenge aimed to fast track the development of autonomous exploration systems by evaluating their performance in real-world underground search-and-rescue scenarios. Subterranean environments present a plethora of challenges for robotic systems, such as limited communications, complex topology, visually-degraded sensing, and harsh terrain. The presented solution enables long-term autonomy with minimal human supervision by combining a powerful and independent single-agent autonomy stack, with higher level mission management operating over a flexible mesh network. The autonomy suite deployed on quadruped and wheeled robots was fully independent, freeing the human supervision to loosely supervise the mission and make high-impact strategic decisions. We also discuss lessons learned from fielding our system at the SubT Final Event, relating to vehicle versatility, system adaptability, and re-configurable communications.
translated by 谷歌翻译
We present Muse, a text-to-image Transformer model that achieves state-of-the-art image generation performance while being significantly more efficient than diffusion or autoregressive models. Muse is trained on a masked modeling task in discrete token space: given the text embedding extracted from a pre-trained large language model (LLM), Muse is trained to predict randomly masked image tokens. Compared to pixel-space diffusion models, such as Imagen and DALL-E 2, Muse is significantly more efficient due to the use of discrete tokens and requiring fewer sampling iterations; compared to autoregressive models, such as Parti, Muse is more efficient due to the use of parallel decoding. The use of a pre-trained LLM enables fine-grained language understanding, translating to high-fidelity image generation and the understanding of visual concepts such as objects, their spatial relationships, pose, cardinality etc. Our 900M parameter model achieves a new SOTA on CC3M, with an FID score of 6.06. The Muse 3B parameter model achieves an FID of 7.88 on zero-shot COCO evaluation, along with a CLIP score of 0.32. Muse also directly enables a number of image editing applications without the need to fine-tune or invert the model: inpainting, outpainting, and mask-free editing. More results are available at https://muse-model.github.io
translated by 谷歌翻译
Optical coherence tomography (OCT) captures cross-sectional data and is used for the screening, monitoring, and treatment planning of retinal diseases. Technological developments to increase the speed of acquisition often results in systems with a narrower spectral bandwidth, and hence a lower axial resolution. Traditionally, image-processing-based techniques have been utilized to reconstruct subsampled OCT data and more recently, deep-learning-based methods have been explored. In this study, we simulate reduced axial scan (A-scan) resolution by Gaussian windowing in the spectral domain and investigate the use of a learning-based approach for image feature reconstruction. In anticipation of the reduced resolution that accompanies wide-field OCT systems, we build upon super-resolution techniques to explore methods to better aid clinicians in their decision-making to improve patient outcomes, by reconstructing lost features using a pixel-to-pixel approach with an altered super-resolution generative adversarial network (SRGAN) architecture.
translated by 谷歌翻译