{"data":{"id":"d3633832-d3ca-4aa4-9828-4e726daecda5","title":"Vulnerabilities and Defenses in Audio-Visual Attacks: A Survey From Audio to Multimodal Models","summary":"This survey reviews attacks on audio-visual multimodal large language models (MLLMs), covering adversarial, backdoor and jailbreak attacks. It notes that researchers often fine-tune public open-source MLLMs, which introduces security risks, and that existing surveys address only specific attack types. The paper also reviews attacks against the latest audio-visual MLLMs and outlines challenges and trends for future research on attacks and defenses. Published in ACM Computing Surveys on 2026-10-05.","solution":"N/A -- no mitigation discussed in source.","labels":["security","research"],"sourceUrl":"https://doi.org/10.1145/3857219","publishedAt":"2026-10-05T00:00:00.000Z","cveId":null,"cweIds":null,"cvssScore":null,"cvssSeverity":null,"severity":"info","attackType":["jailbreak","model_evasion"],"issueType":"research","affectedPackages":null,"affectedPackageNames":null,"affectedPackageRefs":null,"affectedVendors":[],"affectedVendorsRaw":["multimodal large language models","audio-visual MLLMs"],"classifierModel":"claude-haiku-5-5","classifierPromptVersion":"v4","summaryPromptVersion":"v2","headline":null,"headlinePromptVersion":null,"cvssVector":null,"attackVector":null,"attackComplexity":null,"privilegesRequired":null,"userInteraction":null,"exploitMaturity":null,"epssScore":null,"epssCheckedAt":null,"kevDateAdded":null,"advisoryAliases":null,"affectedPackagesSource":null,"affectedPackagesCheckedAt":null,"patchAvailable":null,"disclosureDate":"2026-10-05T00:00:00.000Z","capecIds":null,"crossRefCount":0,"attackSophistication":"moderate","impactType":["integrity","safety"],"aiComponentTargeted":"model","llmSpecific":true,"classifierConfidence":0.9,"researchCategory":"peer_reviewed","atlasIds":null}}