音视频技术开发周刊 | 325

每周一期,纵览音视频技术领域的干货。

新闻投稿:contribute@livevideostack.com。

cf73ca108978f381c3b627b8b2d1524f.png

AI读心术震撼登顶会!模型翻译脑电波,人类思想被投屏|NeurIPS 2023

在最近举办的NeurIPS大会上,研究人员展示了当代AI更震撼的应用场景——AI读心术!

OpenAI「登月计划」剑指超级AI!LeCun提出AGI之路七阶段,打造世界模型是首位

OpenAI「登月计划」笃定了超级人工智能必定会到来,甚至近在眼前。而在LeCun看来,实现AGI还很遥远,打造出世界模型仅是这第一步。

AI首次攻克难倒陶哲轩数学难题,DeepMind里程碑算法登Nature!LLM搜代码自我进化

困扰数学家多年、让陶哲轩直呼喜欢的上限集问题数学难题,竟然被DeepMind的新算法破解了?这是史上首个用LLM发现的算法,堪称里程碑级研究,一经发布立马登Nature。

c2a8785717c948527bf305d823efd171.png

视频生成可以无限长?谷歌VideoPoet大模型上线,网友:革命性技术

2023 年底,科技公司都在冲击生成式 AI 的最后一个关卡 —— 视频生成。谷歌提出的视频生成大模型上线,立刻获得了人们的关注。这款名为 VideoPoet 的大语言模型,被人们认为是革命性的 zero-shot 视频生成工具。

NeurIPS 2023 Spotlight | 腾讯AI Lab绝悟新突破:在星际2灵活策略应对职业选手

近日,腾讯 AI Lab 的游戏 AI 团队宣布了其决策智能 AI "绝悟" 在《星际争霸 2》中的最新研究进展,提出一种创新的训练方法显著提升了 AI 的局内策略应变能力,使其在考虑了 APM 公平的对战环境中,与 3 位国内顶尖的神族职业选手各进行多达 20 局神族 vs 神族的对战,稳定地保持 50% 及以上的胜率。该成果已获 NeurIPS 2023 Spotlight 论文收录。

卷生成式AI的旗舰手机,2024年会引发一场交互革命

最近,各家手机厂商都在不约而同地做着一件事:把生成式 AI 搬上手机。先是在 10 月份的骁龙峰会上,小米放出消息,能在手机端侧运行的 60 亿参数大模型。

阿里文生视频挑战Gen-2、Pika,1280×720分辨率无压力,3500万文本-视频对显奇效

文生视频可以精细到什么程度?最近,阿里巴巴的一项研究给出了答案:1280×720 分辨率没有压力,而且生成效果非常连贯。

美图AI动漫功能的落地探索

2022年可以说是AIGC技术的元年,LLM领域的GPT和图像领域的Stable Diffusion,都属于行业的颠覆性技术。在图像领域,业界出现了如DALLE,Midjourney等基于简单描述文本生成图像的模型和工具。美图在2022年以来,发布了多项AIGC相关应用,LiveVideoStackCon 2023深圳站 邀请到了美图 影像研究院李骈臻老师分享相关经验。

ae91a6ed84e490c7bacb099780b13ac3.png

昆士兰大学等发布!激光雷达位置识别图神经网络

本文提出了一种激光雷达位置识别方法,称为P-GAT,旨在增加随时间捕获的点云之间的感知范围。与比较点云对不同,我们比较点云集之间的相似性,利用姿势图SLAM的概念来利用邻近云之间的最大空间和时间信息。通过利用内部和外部关注以及图神经网络,P-GAT关联了欧几里德空间中附近位置捕获的点云及其在特征空间中的嵌入。

深度学习特征提取匹配开源算法:SuperPoint和SuperGlue

SuperPoint和SuperGlue在CVPR2020图像匹配挑战赛中排名第一。并且通过对SuperPont和SuperGlue的优化,许多工作在CVPR2021图像匹配挑战赛中也名列前茅。

同济大学开源!基于极线约束的级联对应匹配

准确和鲁棒的对应匹配对于各种3D计算机视觉任务至关重要。然而,传统的基于显式编程的方法往往难以处理具有挑战性的场景,而基于深度学习的方法需要大量标记良好的数据集进行网络训练。在这篇文章中,我们引入了极线约束的级联对应匹配( E3CM ),这是一种解决这些限制的新方法。

3D Gaussian Splatting为什么牛啵?原理、应用场景及最新进展

3D Gaussian Splatting是最近几个月热度极高的突破性工作,对应论文“3D Gaussian Splatting for Real-Time Radiance Field Rendering”是2023年SIGGRAPH最佳论文,在短短的几个月内席卷三维视觉和SLAM领域。 

c9e73224bc73162adf9f353bb16cb3d5.png

打破“成本质量效率”不可能三角,3D生成式AI加速解决VR内容困境

在研究团队公布的论文中,3D-GPT 被描述为“可以简单地根据用户提供的文本描述生成各种各样的 3D 模型和场景”。简单来说,3D-GPT 主要完成的是从输入文字中提取信息并生成建模指令这一关键一步,而后续的建模过程则主要交给 Blender 等建模软件。

Meta Quest Haptics SDK通过v60向所有开发者开放

日前,Haptics Studio和Haptics SDK这两个工具将结束实验版本状态,并正式通过Meta Quest v60向所有开发者开放,包含新的和改进的功能,例如全新的示例项目The Sense Of Touch。另外,之前仅兼容Unity的Haptics SDK已经支持Unreal。

Steam VR开始为Quest用户提供Advanced Supersample Filtering

在日前发布的SteamVR Beta Updated – 2.2.1中,Valve正在将Advanced Supersample Filtering重新带到Meta头显,允许用户通过Steam Link和Quest Link进行启用。

981f486f68b84e567c971feec813e7c3.png

超声芯片革新脑机接口:向无创植入更进一步

Forest Neurotech 和 Butterfly Network 合作构建了一种能够实现「亚毫米精度」操作的脑机接口,相比于传统的电信号,它将使用超声波来刺激和记录大脑活动。

谈谈先进封装的失效分析

先进封装技术给半导体行业带来了变革,市场对更小、更快、更低能耗、更大算力的电子设备的需求驱动了近年来先进封装的快速发展,它追求结构的进一步微型化、更高集成度、更多功能性,以及更好的散热控制。

芯片制造的核心工艺:一文看懂薄膜沉积

薄膜的制备需要不同技术原理,因此导致薄膜沉积设备也需要不同技术原理,物理/化学等不同沉积方法相互补充。

a60baf65de9131cc173666a5f5911729.png

中科院声学所研究人员提出基于泰勒展开形式的端到端语音增强算法

在当前基于深度神经网络模型的单通道和多通道语音增强算法研究中,通常着重于设计合理的网络拓扑结构以尽可能提升降噪算法的性能,往往忽略了对深度神经网络模型自身结构设计合理性与可解释性的探索。因此在大部分现有工作中,科研人员们在结构设计和参数确定等方面经验较丰富,但这些工作缺乏数学理论的指导和支撑。

Opus编解码器中音乐检测的奥秘

Opus是一个有损音频压缩的数字音频编码格式,由Xiph.Org基金会开发,之后由互联网工程任务组(IETF)进行标准化,目标是希望用单一格式包含声音和语音,取代Speex和Vorbis,且适用于网络上低延迟的即时声音传输,标准格式定义于RFC 6716文件。

基于相关度量的自监督语音模型的噪声稳健提取

与大的语音基础模型相比,小的蒸馏模型表现出降低的噪声鲁棒性。学生的鲁棒性可以通过在预训练期间在输入处引入噪声来提高。尽管如此,使用标准蒸馏损失仍然会导致学生的表现下降。因此,本文提出了通过相关度量的蒸馏来提高学生的鲁棒性。教师行为是通过最大化教师和学生对同一性的表征之间的互相关矩阵来学习的。噪声鲁棒性通过学生的自相关最小化来鼓励。所提出的方法是不可知的教师模型,并始终优于以前的方法。这项工作还提出了一种启发式的自动权衡两个相关项的重要性。实验表明,在SUPERB Challenge上,意图分类、关键词识别和自动语音识别任务的干净和噪声泛化能力始终更好。

https://arxiv.org/abs/2312.12153

daaa159d65435ec02bb5f31ad3344289.png

AVS3实时语音标准制定取得重要进展

由腾讯提交的AI Codec为基础的技术顺利通过评审,被选为AVS3P10实时语音编码标准的RM0基线和WD过点成功。从交叉测试来看,真正实现了低码率下质量是对齐OPUS、EVS中高码率的,达到运营级质量。我们在相近码率下,MOS分差过Google和Meta方案在0.6MO-1.0MOS。

微软Edge 121将支持最先进的图像格式AVIF

Microsoft Edge 121是Microsoft浏览器的下一个稳定版本,将为所有用户带来AVIF支持 。AVIF 是一种基于AV1视频编解码器的图像格式,它比JPEG或PNG等其他格式提供更有效的压缩。这意味着与其他格式相比,AVIF 文件可以更小,同时具有相同或更高的视觉质量。

https://www.gearrice.com/update/microsoft-edge-121-will-bring-support-for-avif-the-most-advanced-image-format/ 

d3f112953b124d3183b1fde195694a98.png

依靠HDR-VMAF,Netflix的HDR视频已全部实现动态优化

据11月30日Netflixtechblog显示,Netflix现已推出动态优化 HDR(高动态范围) 视频流功能。该功能使用了新的算法HDR-VMAF,提升了用户的观看体验。Netflix于2016年开始推出HDR视频,此后其提供的HDR影片数量一直持续增长。HDR视频可以提供更广泛的色彩和更高的对比度,从而提供更趋近真实的图像。受限于不同设备和网络条件的差异,HDR视频的播放质量会受到影响。

对话星纪魅族卢勇,AR眼镜背后的产品、生态与商业思考

“留给创业公司的时间就两到三年,接下来巨头就会入局,它们可以不发产品,只做技术预研,但我们作为初创公司,等它们入场的之后再进场,就没有任何机会了。”星纪魅族集团高级副总裁、XR 事业部总裁卢勇在谈到如此时间点,星纪魅族发布两款 AR 眼镜的缘由时对 VR陀螺说道。

b7435428099b883b697f1f41cf99bdc5.png

Meta发布全新社交平台Hoziron Worlds预告片,为用户准备一系列沉浸式体验

Meta日前为元宇宙社交平台Hoziron Worlds发布了一段全新的预告片。其中,团队以“体验全新的VR冒险”为题展示了他们为用户准备了一系列沉浸式体验,包括现有和即将发行的内容。

专注用VR改善大脑健康,Virtuleap完成250万美元融资

专注于用VR来改善大脑健康的初创公司Virtuleap日前宣布获得由GED Ventures提供的250万美元融资。利用这笔资金,团队计划继续完善Enhance VR,并通过虚拟现实+人工智能的力量来改善大脑健康。

8497be852a16e92a1cb3b75d798cc9ac.png

重磅首发|2024音视频技术发展报告(文末附下载)

11月24日,在LiveVideoStackCon 2023深圳站大会上,我们与腾讯云音视频联合首发《2024音视频技术发展报告》。报告通过300+音视频开发者调研,40+专家一线访谈,下沉8大细分技术领域进行全面解读,涵盖音视频编解码/AI编码/多媒体处理框架/媒体传输协议/超低延迟技术/虚拟现实/AIGC/出海等领域,深入洞察音视频技术现状和未来发展趋势。  

点击 “阅读原文“ 

跳转报告下载链接

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:/a/271008.html

如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈qq邮箱809451989@qq.com,一经查实,立即删除!

相关文章

FPGA-ZYNQ-7000 SoC在嵌入式系统中的优势

FPGA-ZYNQ-7000 SoC在嵌入式系统中的优势 本章节主要参考书籍《Xilinx Zynq-7000 嵌入式系统设计与实现 基于ARM Cortex-A9双核处理器和Vivado的设计方法 (何宾,张艳辉编著)》 本章节主要讲述FPGA-ZYNQ-7000 SoC在嵌入式系统中的优势,学习笔…

Rancher小白学习之路

官网:http://docs.rancher.cn/docs/rancher1/rancher-service/load-balancer/_indexhttp://docs.rancher.cn/docs/rancher1/rancher-service/load-balancer/_indexRancher2.5集群搭建&K3S生产环境搭建手册 - 知乎 【rancher教程】十年运维大佬两小时带你搞定ran…

关于MybatisPlus自动转化驼峰命名规则配置mapUnderscoreToCamelCase的个人测试和总结

关于MybatisPlus自动转化驼峰命名规则配置mapUnderscoreToCamelCase的个人测试和总结 测试一:没有添加 自动转化的配置,且domain中的属性名称和数据库的字段名称一致测试二:没有添加自动转化配置i,domain属性名userPassword和数据…

【csapp】cachelab

文章目录 Part APart B32 * 3264 * 6461 * 67 实验全程参考大佬的博客CS:APP3e 深入理解计算机系统_3e CacheLab实验 ,感觉大佬在矩阵转置那块介绍的还是有些简略,我自己又做了点动图加以补充理解。膜拜大佬! Part A 先解决解析命令行参数的…

年龄相关的微环境变化突显了PDGF-C在ER+乳腺癌转移复发中的作用

今天给同学们分享一篇实验文章“Age-associated microenvironmental changes highlight the role of PDGF-C in ER breast cancer metastatic relapse”,这篇文章发表在Nat Cancer期刊上,影响因子为22.7。 结果解读: ER乳腺癌转移复发的同种…

LH7904D 太阳能警示灯 0.4W×2

应用范围: 可安装在电线杆,路灯,围挡,交 通护栏及各种杆式固体等场所起警示作用。 产品特点: 采用进口PS材质; 光控无开关,白天不闪,昏暗环境自动闪烁,无需手动操作,省时省事; …

cfa一级考生复习经验分享系列(十)

我的背景:我是在职备考CFA的,工作也是跟金融不相关的,工作日基本只有晚上能看最多2-3小时,主要靠周末大块时间复习。由于平时工作忙碌直到9月中才开始看各种资料。但是可能我复习策略比较有效率,所以最后4次官方mock平…

彻底搞懂MySQL的执行计划

欢迎关注微信公众号:互联网全栈架构 MySQL执行计划(EXPLAIN)可以提供SQL运行的一些信息,相当于模拟SQL的执行,从而让我们可以对SQL语句做更深入的分析和了解。在实际开发过程中,我们经常会使用执行计划来分…

编写fastapi接口服务

FastAPI是一个基于 Python 的后端框架,该框架鼓励使用 Pydantic 和 OpenAPI (以前称为 Swagger) 进行文档编制,使用 Docker 进行快速开发和部署以及基于 Starlette 框架进行的简单测试。 step1:安装必要库 pip install fastapi uvicorn st…

FLStudio21中文版水果编曲软件好用吗?如何下载最新版本

FL Studio21版是一款在国内非常受欢迎的多功能音频处理软件,我们可以通过这款软件来对多种不同格式的音频文件来进行编辑处理。而且FL Studio 21版还为用户们准备了超多的音乐乐器伴奏,我们可以直接一键调取自己需要的音调。 FL Studio21版不仅拥有非常…

基于TM的遥感数据的叶面积指数估算解决方案

1.背景与技术路线 叶面积指数是重要的植被结构参数,反演叶面积指数是植被遥感的重要研究内容之一,其影响生态系统的物质和能量循环,成为作物生长、路面过程、水文和生态等模型的输入参数或状态变量。今年来,对也铭记指数的反演已…

vue-awesome-swiper轮播组件

安装版本&#xff1a;"swiper": "^6.0.0", 安装版本&#xff1a;"vue-awesome-swiper": "^4.1.1", <div class"swiper_conter"><swiper class"swiper" :options"swiperOption" ref"mySw…

Windows系统配置pytorch环境,Jupyter notebook编辑器安装使用(深度学习本地篇)

如今现在好一点的笔记本都自带英伟达独立显卡&#xff0c;对于一些简单的深度学习项目&#xff0c;是不需要连接服务器的&#xff0c;甚至数据量不大的话&#xff0c;cpu也足够进行训练学习。我把电脑上一些以前的笔记整理一下&#xff0c;记录起来&#xff0c;方便自己35岁事业…

快速构建空间场景轻应用的一次体验分享

零&#xff1a;前言 最近虚竹哥发现一款基于Web端打造的轻量化工具创作平台&#xff0c;用于快速构建空间场景轻应用&#xff0c;它就是Mapmost Alpha。内置丰富且多样化风格的三维场景、三维模型、数据服务、POI数据、图片、视频、网页等资源&#xff0c;通过拖拉拽的方式&am…

YOLOv8改进 | 主干篇 | RevColV1可逆列网络(特征解耦助力小目标检测)

一、本文介绍 本文给大家带来的是主干网络RevColV1&#xff0c;翻译过来就是可逆列网络去发表于ICLR2022&#xff0c;其是一种新型的神经网络设计(和以前的网络结构的传播方式不太一样)&#xff0c;由多个子网络&#xff08;列&#xff09;通过多级可逆连接组成。这种设计允许…

JavaScript进阶(事件+获取元素+操作元素)

目录 事件基础 事件组成 执行事件的步骤 获取元素 根据ID获取元素 根据标签名获取元素 获取ol中的小li 类选择器&#xff08;html5新增的I9以上支持&#xff09; 获取body和html 操作元素 innerText和innerHtml 表单标签 样式属性操作 操作元素总结 事件基础 事…

铁山靠之——HarmonyOS组件 - 2.0

HarmonyOS学习第二章 一、HarmonyOS基础组件的使用1.1 组件介绍1.2 Text1.2.1 文本样式1.2.2 设置文本对齐方式1.2.3 设置文本超长显示1.2.4 设置文本装饰线 1.3 Image1.3.1 设置缩放类型1.3.2 加载网络图片 1.4 TextInput1.4.1 设置输入提示文本1.4.2 设置输入类型1.4.3 设置光…

关于Python里xlwings库对Excel表格的操作(十八)

这篇小笔记主要记录如何【设置单元格数据的对齐方式】。前面的小笔记已整理成目录&#xff0c;可点链接去目录寻找所需更方便。 【目录部分内容如下】【点击此处可进入目录】 &#xff08;1&#xff09;如何安装导入xlwings库&#xff1b; &#xff08;2&#xff09;如何在Wps下…

MySQL递归公用表表达式

&#x1f607;作者介绍&#xff1a;一个有梦想、有理想、有目标的&#xff0c;且渴望能够学有所成的追梦人。 &#x1f386;学习格言&#xff1a;不读书的人,思想就会停止。——狄德罗 ⛪️个人主页&#xff1a;进入博主主页 &#x1f5fc;专栏系列&#xff1a;MySQL知识 &…

【单调队列】LeetCode1499:满足不等式的最大值

涉及知识点 单调队列 题目 给你一个数组 points 和一个整数 k 。数组中每个元素都表示二维平面上的点的坐标&#xff0c;并按照横坐标 x 的值从小到大排序。也就是说 points[i] [xi, yi] &#xff0c;并且在 1 < i < j < points.length 的前提下&#xff0c; xi &…